Речевая аналитика

Материал из Вики Optimism
Перейти к навигации Перейти к поиску

Речевая аналитика (англ. speech analytics) это автоматический разбор записанных разговоров с клиентами. Система переводит звук в текст, размечает реплики по темам и признакам, считает поведение собеседников и складывает всё это в отчёты, по которым разговоры можно искать и сравнивать. Предмет разбора один: что в звонке сказали.

Соседние инструменты отвечают на другие вопросы. Коллтрекинг говорит, из какого источника пришёл звонок, и про содержание разговора не знает ничего. Сквозная аналитика сводит рекламные расходы с продажами. Речевая аналитика начинается там, где обе эти системы заканчиваются: внутри самой записи.

Статья разбирает механику по узлам, показывает, от чего на деле зависит точность расшифровки, и называет цену того слоя, у которого есть опубликованный тариф. Отдельно сказано про главный ходовой аргумент темы. Долю звонков, которые компания без такой системы слушает вручную, страницы из выдачи называют по-разному, от 2 % до 25 %, и подают своё число как факт рынка. Замера с описанной выборкой, который подтверждал бы любое из этих чисел, найти не удалось.

Чем отличается от соседних понятий

Распознавание речи это один узел внутри системы. Синонимом речевой аналитики оно не является: распознавание отдаёт текст, и на этом его работа кончается. Всё, что происходит дальше, поиск по словарю, теги, оценка разговора по чек-листу, к распознаванию отношения не имеет и ломается отдельно.

Голосовой робот говорит сам и ведёт разговор в реальном времени. Речевая аналитика не произносит ни слова и работает по записи, обычно после звонка. Общий у них только передний узел, распознавание.

Чат-бот и ИИ-ассистент живут в текстовых каналах, где расшифровка не нужна вовсе: текст уже есть. Разбор смысла у них похожий, а вход другой.

Ручной контроль качества никуда не девается. Супервизор слушает выборку и ставит оценку по чек-листу. Автоматика меняет охват и скорость этого контроля. Работа человека при этом переезжает с прослушивания на проверку меток.

Предиктивная аналитика предсказывает событие по историческим данным. Речевая аналитика описывает уже случившийся разговор. Её вывод может стать признаком для прогноза, и тогда это два шага одной цепочки.

Откуда взялось

Телефонный разговор считается трудным материалом для машины давно. С девяностых годов эталонной задачей служит корпус Switchboard, собранный из телефонных бесед; на нём и меряли прогресс распознавания.

Английская Википедия называет три подхода, но разбирает по существу два. Фонетический переводит запись в поток звуков и ищет нужные слова уже по нему, словарь при этом крошечный. Полная расшифровка большим словарём (LVCSR) переводит речь в обычный текст, который дальше можно читать, искать и считать. Английская Википедия описывает оба и отдельно отмечает, что метрика ошибки на словах к фонетическим системам неприменима, поэтому прямое сравнение точности двух подходов некорректно.

Точку отсчёта для нынешних ожиданий задала работа исследователей Microsoft, выложенная 17 октября 2016 года и обновлённая 17 февраля 2017 года. В ней измерили, сколько ошибаются профессиональные расшифровщики на наборе NIST 2000: 5,9 % на части Switchboard и 11,3 % на части CallHome. Система авторов дала 5,8 % и 11,0 %. Отсюда следует вещь, которую в рекламных материалах не пишут: у человека на телефонной записи тоже есть процент ошибки, и он двузначный, когда разговор идёт свободно.

Русская речь получила открытый материал позже. 18 июня 2021 года опубликован корпус Golos на 1240 часов, размеченный вручную, вместе с обученной на нём акустической моделью.

Как это устроено

Схема пути звонка через запись, разделение говорящих, расшифровку, разметку и показатели до решения человека
Путь звонка от записи до решения: что теряется на каждом шаге и почему потери складываются

Запись и каналы

Всё решается раньше аналитики, на стороне телефонии. Запись бывает одноканальной, когда оба голоса лежат в одной дорожке, и двухканальной, когда оператор и клиент разведены по своим.

Разница не косметическая. В документации Google Cloud Speech-to-Text прямо сказано: если каждый говорит в своём канале, каналы надо отправлять на распознавание по отдельности, так результат лучше; а одновременная речь двух людей или речь на разной громкости может быть принята за фоновый шум и пропущена.

Из смешанной дорожки голоса разделяют диаризацией. У неё есть условия, и их стоит смотреть до покупки. В документации SaluteSpeech разделение спикеров доступно только для акустической модели general, которая рассчитана на звук выше 8 кГц, тогда как телефонию обслуживает модель callcenter с частотой 8 кГц. Там же перечислены форматы: узкополосные телефонные кодеки G.711 и G.729 принимаются только в один канал.

Расшифровка

Модель превращает звук в слова. Ошибки бывают трёх видов, и в документации SaluteSpeech они названы теми же словами, что и в отраслевой метрике: удаления (слово не распознано), замены (распознано неверно), вставки (появилось лишнее слово).

Слова, которых не было в обучении, сами не появятся. Google предупреждает об этом отдельно: словарь у распознавания большой, но имена собственные и термины за его пределами не распознаются, для них есть подсказки со списком ожидаемых слов и фраз. У SaluteSpeech тот же механизм называется хинтами и действует на одну реплику вперёд. Практический смысл простой: артикулы, названия тарифов и фамилии сотрудников надо принести системе списком, иначе их в расшифровке не будет.

Разметка: словари, правила и модель

Текст сам по себе не отвечает ни на один вопрос бизнеса. Дальше его размечают, и способов три.

Первый это словарь фраз. Список выражений, при встрече которых разговору ставится тег. Способ дешёвый и полностью проверяемый: видно, какая именно строка сработала. Слабое место тоже видно, перефразировку словарь не ловит.

Второй это правила поверх текста: порядок слов, расстояние между ними, отрицания, условие «фраза оператора в первые тридцать секунд».

Третий это модель. Классификатор из машинного обучения учится на размеченных примерах, большая языковая модель размечает по инструкции. Обобщает такой разбор заметно шире словаря, зато объяснить своё решение строкой списка он не может, и сверять его приходится на контрольной выборке.

Три подхода сравнивали в работе по итальянскому контакт-центру, опубликованной 12 марта 2022 года: регулярные выражения, модели на n-граммах с логистической регрессией и дерево решений. Устойчивый выигрыш дало сочетание подходов, а не один из них в чистом виде.

Метрики разговора

Помимо слов, из записи снимают то, что относится к поведению собеседников. Открытый пример состава показателей есть в документации SaluteSpeech Insights: доли речи клиента и оператора, длительность и доля тишины, перебивания, темп речи и то, как собеседники подстраиваются друг под друга, эмоциональная окраска реплик и её изменение между началом и концом разговора.

Условия там названы честно, и они показательны. Модели работают на одноканальном и двухканальном звуке 8 кГц. Первый канал считается оператором, второй клиентом, то есть перепутанные каналы дадут зеркальный отчёт. Статистика по эмоциям собирается только по репликам длиннее двух секунд или содержащим больше двух слов, а уровень эмоции это число от минус единицы до единицы, то есть разница вероятностей позитива и негатива. Чувством человека это число не является.

От чего зависит точность расшифровки

Стандартная метрика это доля ошибочных слов, WER. Microsoft в документации по своему речевому сервису определяет её как сумму вставок, удалений и замен, делённую на число слов в эталонной расшифровке, и даёт ориентиры: 5-10 % считается хорошим качеством, 20 % приемлемым, 30 % и выше требуют доработки под задачу.

Дальше начинается то, о чём в рекламных процентах не говорят. Одна и та же система на разном материале даёт разный результат.

  • Тип разговора. В измерении 2016 года профессиональные расшифровщики ошиблись на 5,9 % в беседах на заданную тему и на 11,3 % в свободных разговорах близких людей. Разница почти вдвое, притом что расшифровывали в обоих случаях профессионалы.
  • Условия записи. В работе по корпусу Golos наименьшие значения у одной и той же модели составили 3,32 % на записях с краудсорсинговой платформы и 11,49 % на дальнем микрофоне. Разброс примерно в три с половиной раза, и меняли в опыте только материал.
  • Частота и кодек. Google советует писать от 16 кГц, но телефонные 8 кГц пересэмплировать вверх не надо, надо отдавать как есть. Сжатие с потерями при записи или передаче точность снижает.
  • Шум и эхо. Сильный фон и эхо ухудшают результат, особенно вместе со сжатием.
  • Наложение голосов. Одновременная речь может быть отброшена как шум.
  • Свои слова. Термины, артикулы и имена вне словаря не распознаются, пока их не передали подсказками.

У распределения ошибок есть диагностическая ценность, и Microsoft описывает её прямо. Много удалений обычно означает слабый сигнал. Много вставок указывает на шумную запись и наложение голосов. Замены чаще всего говорят о нехватке отраслевых слов в обучении.

Отсюда практический вывод про чужие проценты. Заявленная точность без указания того, на каком материале и на какой выборке она получена, ни с чем не сравнима. В выдаче по теме встречаются значения от 80 % до 98 %, и только часть страниц вообще оговаривает, что цифра зависит от качества звука.

Сколько это стоит

Готовые платформы речевой аналитики публичных тарифов почти не держат: на их страницах стоит форма заявки, то есть цена по запросу. Проверить порядок величины можно по нижнему слою, распознаванию речи, у которого тариф опубликован.

Документация SaluteSpeech на 19 сентября 2026 года называет два способа оплаты для юридических лиц. Пакет: 0,6 рубля за минуту распознавания, пакет на 20 000 минут стоит 12 000 рублей. Постоплата: 0,01 рубля за секунду. У асинхронного распознавания единица счёта это секунда одного канала, то есть час двухканальной записи стоит 72 рубля против 36 за час монозаписи; у синхронного и потокового единицей названа просто секунда. При этом действует минимальный платёж 15 000 рублей в месяц: если использование было, но на меньшую сумму, платёж всё равно составит эти 15 000.

Счёт на примере. Тысяча звонков по пять минут в двухканальной записи это 10 000 минут распознавания, по тарифу 6000 рублей. Компания такого размера заплатит месячный минимум: он выше расчёта. Оговорка на той же странице важна не меньше цифр: с 15 июля 2026 года оба способа оплаты новым клиентам недоступны, так что опубликованный тариф годится как порядок величины, а условия подключения сегодня надо спрашивать у поставщика.

Распознавание это только сырьё. Сверху ложатся хранение записей, разметка, интеграция с телефонией и системой управления продажами, а также работа человека, который ведёт словари и проверяет метки. Порядок цены пилота публикует один поставщик из девяти прочитанных страниц выдачи, около ста тысяч рублей. Тарифной страницы за этой цифрой нет, проверить её нечем.

Что делать на практике

Сначала решить вопрос записи
Два канала, без агрессивного шумоподавления, без лишнего пережатия. Это делается в телефонии и стоит дешевле, чем любая последующая борьба за проценты точности.
Снять свою базовую линию
Взять 50-100 типичных звонков, расшифровать их руками и посчитать долю ошибочных слов на своём материале. Без этого числа обсуждать чужие проценты бессмысленно.
Принести системе свой словарь
Названия продуктов, тарифов, артикулы, фамилии. Список пополняется, когда меняется ассортимент.
Начать с одного вопроса
Одна проверяемая вещь вместо двадцати восьми параметров оценки. Назвал ли оператор цену, прозвучал ли отказ, была ли попытка удержать клиента.
Сверять разметку выборкой
Несколько десятков разговоров в неделю читает человек и сравнивает свою метку с машинной. Расхождение это рабочая цифра, которую надо знать.
Развести наблюдение и оценку персонала
Показатели разговора полезны как наблюдение. Как основание для премии они меняют поведение операторов быстрее, чем качество обслуживания.

Запись разговора и персональные данные

Запись и разбор разговоров это обработка персональных данных, и она требует основания из статьи 6 и, в общем случае, согласия по статье 9 Федерального закона от 27.07.2006 № 152-ФЗ. Отдельно стоит статья 11 того же закона: она относит к биометрическим данным сведения о физиологических и биологических особенностях человека, по которым можно установить личность и которые оператор для установления личности использует. Как эти нормы ложатся на конкретный набор записей, решает юрист, а не автор справочной статьи и не поставщик системы.

Чем измеряют

  • Доля ошибочных слов на собственной контрольной выборке, отдельно по каналу оператора и каналу клиента.
  • Точность и полнота срабатывания тега: какая часть отмеченных разговоров отмечена верно и какую часть нужных разговоров система нашла. Эти две величины тянут в разные стороны, и повышение одной обычно роняет другую.
  • Согласие машинной метки с оценкой человека на контрольной выборке, в процентах совпадений.
  • Доля записей, не прошедших обработку: битый файл, тишина, неверный кодек, слишком короткая запись.
  • Доля разговоров, дошедших до разбора, от общего числа состоявшихся: она показывает дыры в записи, а не качество моделей.
  • Время от окончания разговора до появления его в отчёте.
  • Наблюдаемые характеристики диалога: доли речи, тишина, перебивания, темп. Их полезно видеть, и опасно превращать в план.

Деньги речевая аналитика сама по себе не измеряет. Связка с выручкой живёт в воронке и в юнит-экономике, а что делают с разобранным разговором дальше, разбирает ИИ в продажах. Без возврата статусов сделки отчёт остаётся отчётом про разговоры.

Частые ошибки

Считать заявленную точность поставщика своей. Цифра снята на его материале. На записи с уличным шумом, дешёвым кодеком и двумя голосами в одной дорожке она будет другой.

Писать один канал, а потом требовать разделения спикеров. Диаризация не всегда доступна для телефонной модели, и возвращаться придётся к настройке телефонии.

Включить шумоподавление на записи. Обработка сигнала, рассчитанная на человеческое ухо, распознаванию мешает.

Собрать словарь один раз. Через квартал в нём нет ни новых тарифов, ни новых возражений, а отчёты продолжают выходить и выглядеть правдоподобно.

Автоматически ставить оценку сотруднику. Без выборочного аудита и процедуры апелляции цена ошибки модели ложится на человека.

Мерить то, чем удобно управлять. Показатель «доля речи оператора» операторы выучивают за две недели, и он перестаёт что-либо описывать.

Покупать двадцать восемь параметров, не имея ни одного вопроса. Отчёты будут, решений по ним не будет.

Ограничения и спорные места

Главная цифра темы не подтверждена ничем. Доля звонков, которую компания слушает вручную, в разобранных страницах выдачи называется шестью разными значениями в диапазоне от 2 % до 25 %, то есть с разбросом больше чем в десять раз, и каждая страница подаёт своё число как общее свойство рынка. Ни одна не называет ни выборки, ни года, ни способа подсчёта. В научной работе февраля 2026 года про автоматическую оценку операторов та же величина во вводной части названа общей формулировкой: вручную проверяют обычно меньше пяти процентов обращений. Замера за этой фразой тоже нет. На деле доля зависит от числа звонков, размера службы контроля и требований отрасли, и одним числом не описывается.

Заявленная точность несравнима между поставщиками. Разные наборы записей, разные условия, разные определения ошибки. К фонетическим системам метрика ошибки на словах неприменима в принципе.

Автоматическая оценка работы оператора смещена, и это измерено. В работе от 16 февраля 2026 года проверили 18 языковых моделей на 3000 реальных расшифровок контакт-центра. Доля переворотов бинарного вердикта при замене в расшифровке признаков вроде пола, этничности или манеры речи составила от 5,4 % до 13,0 %, а при подсказке о прошлых результатах сотрудника доходила до 16,4 %. Справедливость оценки при этом не следовала за её точностью, а прямая инструкция модели быть непредвзятой давала небольшое улучшение. Вывод авторов практический: перед использованием таких систем в оценке людей нужен отдельный аудит.

Эмоция это предсказание модели. Уровень эмоции считается по вероятностям и по коротким репликам; удовлетворённость клиента такой показатель моделирует, измерением он не является.

Методики поставщиков закрыты. Как устроены их словари, на чём училась модель тональности и что считается одним разговором, наружу не сообщается. Проверить это можно только на своём материале в пилоте.

Сто процентов охвата не равны ста процентам разбора. Фраза про полный контроль звонков означает, что через расшифровку прошли все записи. Сколько из них размечено верно и сколько дошло до решения, она не говорит.

Публичного замера эффекта на деньги нет. Числа роста конверсии и экономии фонда оплаты труда в материалах поставщиков приводятся без базовой линии, без периода наблюдения и без имени компании, у которой их сняли.

Что здесь быстро устаревает

  • Тарифы. Цены выше сверены 19 сентября 2026 года по документации поставщика и меняются вместе с условиями подключения.
  • Состав и имена моделей. Акустические модели, их частотные ограничения и доступность диаризации пересматриваются вендорами без предупреждения.
  • Ориентиры по доле ошибочных слов. То, что сегодня считается приемлемым, через год окажется слабым результатом.
  • Правила про согласие на обработку данных. Требования к форме согласия менялись несколько раз за последние годы.
  • Замеры смещённости языковых моделей. Список моделей в таких работах устаревает за сезон, а вместе с ним и выводы про конкретные названия.
  • Публичные наборы для проверки русской речи. Появляются новые корпуса, и старые числа на них сравнивать нельзя.

См. также

Источники

  1. Microsoft. Test accuracy of a custom speech model: определение доли ошибочных слов, разбор вставок, удалений и замен, ориентиры качества. Microsoft Learn. https://learn.microsoft.com/en-us/azure/ai-services/speech-service/how-to-custom-speech-evaluate-data (сверено 19 сентября 2026 года).
  2. Google. Best practices for Speech-to-Text: частота дискретизации, телефонные 8 кГц, кодеки без потерь, шум и эхо, отдельные каналы для разных говорящих, подсказки для слов вне словаря. https://cloud.google.com/speech-to-text/docs/best-practices (19 сентября 2026 года).
  3. СберДевайсы. SaluteSpeech, раздел «Как улучшить распознавание»: акустические модели general и callcenter, условия разделения спикеров, хинты, виды ошибок распознавания. https://developers.sber.ru/docs/ru/salutespeech/guides/recognition/improvement (19 сентября 2026 года).
  4. СберДевайсы. SaluteSpeech, раздел «Insights модели»: состав показателей разговора, ограничение по каналам и частоте, правила подсчёта эмоций. https://developers.sber.ru/docs/ru/salutespeech/guides/recognition/insights-models (19 сентября 2026 года).
  5. СберДевайсы. SaluteSpeech, раздел «Допустимые форматы и лимиты»: число каналов по форматам, ограничения кодеков G.711 и G.729. https://developers.sber.ru/docs/ru/salutespeech/guides/recognition/encodings (19 сентября 2026 года).
  6. СберДевайсы. SaluteSpeech, раздел «Тарифы для юрлиц»: цена пакета и постоплаты, минимальный месячный платёж, закрытие обоих способов оплаты для новых клиентов с 15 июля 2026 года. https://developers.sber.ru/docs/ru/salutespeech/tariffs/legal-tariffs (19 сентября 2026 года).
  7. W. Xiong, J. Droppo, X. Huang, F. Seide, M. Seltzer, A. Stolcke, D. Yu, G. Zweig. Achieving Human Parity in Conversational Speech Recognition. arXiv:1610.05256, 17 октября 2016 года, версия 2 от 17 февраля 2017 года. Ошибка профессиональных расшифровщиков 5,9 % и 11,3 % на двух частях набора NIST 2000. https://arxiv.org/abs/1610.05256 (19 сентября 2026 года).
  8. N. Karpov, A. Denisenko, F. Minkin. Golos: Russian Dataset for Speech Research. arXiv:2106.10161, 18 июня 2021 года. Корпус 1240 часов; наименьшие значения доли ошибочных слов 3,32 % и 11,49 % на двух наборах, таблица 6. https://arxiv.org/abs/2106.10161 (19 сентября 2026 года).
  9. A. Brunello, E. Marzano, A. Montanari, G. Sciavicco. A combined approach to the analysis of speech conversations in a contact center domain. arXiv:2203.06396, 12 марта 2022 года. Сравнение регулярных выражений, моделей на n-граммах и дерева решений на разметке расшифровок итальянского контакт-центра. https://arxiv.org/abs/2203.06396 (19 сентября 2026 года).
  10. K. Mayilvaghanan, S. Gupta, A. Kumar. Counterfactual Fairness Evaluation of LLM-Based Contact Center Agent Quality Assurance System. arXiv:2602.14970, 16 февраля 2026 года. 18 моделей, 3000 расшифровок, доля переворотов вердикта от 5,4 % до 13,0 % и до 16,4 % при подсказке о прошлых результатах. https://arxiv.org/abs/2602.14970 (19 сентября 2026 года).
  11. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных», статья 6 «Условия обработки персональных данных». КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/315f051396c88f1e4f827ba3f2ae313d999a1873/ (19 сентября 2026 года).
  12. Тот же закон, статья 9 «Согласие субъекта персональных данных на обработку его персональных данных». КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/6c94959bc017ac80140621762d2ac59f6006b08c/ (19 сентября 2026 года).
  13. Тот же закон, статья 11 «Биометрические персональные данные». КонсультантПлюс. https://www.consultant.ru/document/cons_doc_LAW_61801/7336c78762a98b5f4f698b8c3800dca1111acc16/ (19 сентября 2026 года).
  14. Speech analytics. Английская Википедия: фонетический подход и полная расшифровка большим словарём, неприменимость метрики ошибки на словах к фонетическим системам, точность и полнота как метрики поиска. https://en.wikipedia.org/wiki/Speech_analytics (19 сентября 2026 года).
  15. Собственный разбор выдачи 19 сентября 2026 года: десять страниц топа по запросу «речевая аналитика», из них девять прочитаны. Считались заявленная точность распознавания, доля ручного прослушивания, наличие цены и даты рядом с ней, ссылка на первоисточник чисел. Адреса разобранных страниц не приводятся: справочник не ссылается на материалы прямых соперников по выдаче.