Как ИИ анализирует звонки: что распознаёт надёжно, где ошибается, от чего зависит точность и как проверить систему на своих записях без рекламных обещаний.
Этот разбор - для тех, кто выбирает анализ звонков и упирается в вопрос доверия: ИИ поставит оценку разговору, а можно ли ей верить. Ниже - честная карта: что искусственный интеллект в звонке ловит надёжно, что распознаёт с ошибками и что не увидит никогда. Это часть цикла про контроль качества звонков: рядом - как задать критерии оценки, какие признаки слива искать и во сколько обходятся потери.
Как устроен анализ звонков с помощью ИИ?
Анализ звонков с помощью ИИ - это конвейер из трёх шагов. Сначала запись переводится в текст, затем текст и звук размечаются по заданным критериям, после чего собирается отчёт с оценкой. Система не понимает разговор так же, как человек: она проверяет наблюдаемые признаки и смысловые критерии, заданные при настройке.
Когда сервис речевой аналитики «слушает» звонок, он воспринимает его иначе, чем человек. Разговор проходит три стадии. Первая - транскрибация: аудио превращается в текст, а реплики по возможности разносятся по говорящим. Вторая - разметка: система прогоняет текст и звуковые метрики через набор критериев. Проверяет, назвал ли менеджер компанию, задал ли открытый вопрос, прозвучало ли слово из стоп-листа, сколько длились паузы. Третья - отчёт: по этим отметкам выставляется оценка звонка и подсвечиваются проблемные места.
Ключевое здесь - слово «заданные». ИИ проверяет ровно то, что в него заложили как критерий. Он не решает сам, что в этом звонке было важно; он сверяет разговор со списком признаков, который настроили под ваш скрипт. Поэтому вопрос «что ИИ ловит» распадается на два: что он способен распознать технически и что вы попросили его искать. Дальше - про оба.
Что ИИ ловит надёжно?
Надёжнее всего ИИ распознаёт структурные и наблюдаемые признаки: был ли этап скрипта, прозвучали ли конкретные слова, сколько длились паузы, кто говорил больше, перебивал ли менеджер клиента, назначен ли следующий шаг. Эти факты видны в тексте и звуковой дорожке.
Сила машины - в том, что легко свести к проверяемому признаку. По описанию сервисов речевой аналитики (UIS, Skorozvon, Roistat), система уверенно фиксирует:
- Ключевые слова и фразы. Прозвучало ли название компании, имя клиента, слово из стоп-листа, упоминание конкурента. Это прямой поиск по тексту.
- Этапы скрипта. Было ли приветствие, задан ли открытый вопрос, назван ли следующий шаг. Система сверяет разговор с каркасом скрипта и отмечает пропущенные этапы.
- Паузы и темп. Длину пауз, скорость речи, Talk Ratio и затянувшиеся монологи менеджера.
- Перебивания. Система слышит, когда менеджер перебивал клиента или наоборот.
- Наличие следующего шага. Прозвучали ли в конце конкретная дата и договорённость - или разговор закончился на «звоните, если что».
На таких признаках речевая аналитика работает устойчивее, чем на субъективной оценке эмоций: слово, паузу и наличие этапа можно проверить по записи. Именно эту рутину она снимает с человека. Как разложить звонок на этапы и превратить их в критерии, разобрано в чек-листе оценки звонка.
Насколько точно ИИ расшифровывает речь?
Качество расшифровки зависит от записи сильнее, чем от красивой цифры в презентации сервиса. Чистая двухканальная запись обычно распознаётся лучше, чем шумная моно-запись. Ошибки чаще возникают на редких терминах, именах, акцентах и одновременной речи собеседников.
Точность - первое, о чём спрашивает директор: «система вообще разберёт наши разговоры со всей нашей спецификой?» Универсального процента здесь нет. Результат зависит от телефонии, качества записи, словаря компании и того, говорят ли собеседники одновременно. Поэтому точность нужно измерять на собственных звонках.
Что снижает точность:
- Качество линии. Телефонные линии дают результат хуже, чем IP-телефония. Шум, эхо, неразборчивая дикция - выше доля ошибок.
- Термины, названия, имена. Редкие слова, узкая номенклатура, фамилии распознаются с ошибками чаще обычной речи.
- Одна дорожка вместо двух. Когда менеджер и клиент записаны на раздельные каналы, система точнее понимает, кто что сказал. На моно-записи диаризация работает хуже, и реплики могут смешаться.
Вывод для практики: если запись чистая и двухканальная, расшифровке можно доверять как основе для оценки. Если линия плохая или запись моно - ошибки будут, и это стоит держать в голове, особенно когда критерий завязан на конкретное слово.
Проверить это можно без внедрения: бесплатный аудит записей звонков показывает, что система извлекла из реальных записей с вашей линией и терминологией. Так точность видна на собственных данных.
Что ИИ ловит плохо или не ловит совсем?
Здесь проходит граница, о которой вендоры пишут неохотно. Всё, что сводится к смыслу и намерению, машина распознаёт слабее, чем факт.
- Тональность и эмоции. Речевая аналитика размечает разговор как позитивный, негативный или нейтральный, но это грубая шкала. Вежливое «спасибо, я подумаю» с интонацией отказа она легко посчитает нейтральным, а живое раздражение под спокойными словами - пропустит.
- Ирония и сарказм. «Ну да, конечно, очень выгодно» на письме выглядит согласием. Машина считывает слова, интонацию голоса за ними - хуже.
- Искренность и подтекст. Согласился ли клиент искренне или просто хочет закончить разговор - это человек чувствует по разговору целиком, а система по отдельным признакам улавливает не всегда.
- Настоящая причина ухода. ИИ покажет, что менеджер не задал вопрос и не назначил следующий шаг. Но почему клиент на самом деле не купил - передумал, нашёл дешевле, потерял доверие - в записи может быть не сказано вслух, и тогда этого нет и в анализе.
У машины из-за этого есть чёткая зона: она сильна в вопросе «что произошло в разговоре» - какие действия менеджер сделал или пропустил, - и слаба в вопросе «что человек при этом чувствовал». Надёжную оценку строят на первом, а второе оставляют человеку.
Почему анализ по ключевым словам иногда врёт: речевая аналитика 1.0 и 2.0?
Старые системы искали в разговоре заданные слова и ошибались в обе стороны: фраза могла прозвучать в другом смысле или нужная мысль выражалась иначе. Речевая аналитика 2.0 учитывает контекст и перефразирование, но её выводы всё равно зависят от качества критериев и исходной расшифровки.
Часть недоверия к оценке ИИ идёт от старого поколения систем. Речевую аналитику принято делить на два поколения (это различие описывают, например, SalesAI и МТС).
Первое поколение (1.0) работает по ключевым словам и правилам: задан список слов - система ищет их в тексте. Отсюда два типа ошибок:
- Ложное срабатывание. Менеджер сказал «не буду давить на вас скидкой» - в тексте есть слово «скидка», правило «упомянул скидку» отметилось, хотя по смыслу всё наоборот.
- Пропуск. Клиент выразил сомнение в цене словами «надо посчитать, потяну ли» - слова «дорого» нет, и правило «возражение по цене» промолчало, хотя возражение было.
Второе поколение (2.0) построено на генеративных языковых моделях. Оно разбирает смысл реплики, не буквальное совпадение слов, поэтому лучше понимает перефраз, синонимы и контекст: «потяну ли» оно засчитает как возражение по цене. Это ближе к тому, как разговор понял бы человек. Но и здесь оценка хороша ровно настолько, насколько точно написаны критерии, - поэтому следующий вопрос звучит как «как настроить ИИ под ваш скрипт».
Как настроить ИИ, чтобы он ловил нужное именно вам?
ИИ оценивает звонок по заранее заданному списку признаков. Этот список - дерево оценки: критерии по этапам звонка под ваш скрипт. Каждый критерий лучше привязывать к наблюдаемому факту из записи. Тогда оценка получается воспроизводимой, и её можно проверить.
Вопрос «можно ли доверять оценке ИИ» во многом решается на этапе настройки, ещё до анализа. Система прогоняет звонок по критериям, и вся её справедливость зависит от того, как эти критерии написаны.
В M.I.L.O. набор критериев называется деревом оценки: разговор раскладывается на этапы - от приветствия и выявления потребности до работы с возражениями и фиксации следующего шага, - и на каждом задаётся, что именно проверять. Настраивается это под ваш скрипт один раз, дальше система применяет одни и те же критерии ко всем звонкам.
Рабочее правило настройки - опирать критерий на наблюдаемое, не на интерпретируемое:
- Наблюдаемый критерий (машина оценит надёжно): «менеджер назвал конкретную дату следующего контакта», «задан хотя бы один открытый вопрос до презентации», «на возражение прозвучал уточняющий вопрос».
- Интерпретируемый критерий (машина оценит зыбко): «менеджер был убедителен», «клиент остался доволен», «разговор прошёл тепло». Такие формулировки лучше переводить в наблюдаемый признак или оставлять человеку.
Чем больше критериев из первой группы, тем меньше споров с отделом: оценку видно в записи, на неё можно показать пальцем. Как собрать такой список под свой скрипт и не раздуть его до полусотни пунктов, разобрано в чек-листе оценки звонка.
Почему самодельная сборка на общедоступных нейросетях обычно не взлетает
Логичная мысль: нейросети доступны всем, звонки есть, промпт написать несложно - зачем платить за готовый сервис. Разберём случай, когда компания прошла этот путь до конца.
Клиент решил построить свою систему оценки отдела продаж на базе стандартных общедоступных ИИ-сервисов. Внедрял три месяца. В компании работал менеджер по контролю качества, поэтому появилась возможность честно сверить: одни и те же звонки оценивал человек и оценивала система.
Оценки расходились сильно, и права оказывалась не машина. Человек видел контекст: кто этот клиент, в какой он ситуации, почему в этом разговоре уместно одно, а в соседнем - прямо противоположное. Система выдавала стандартный анализ по единому шаблону.
Попытки дообучать систему сделали хуже. Каждое уточнение под один сценарий ломало оценку в другом, и количество странных ошибок только росло. Это типичная траектория самодельных сборок: первые две недели выглядят обнадёживающе, дальше начинается борьба с исключениями, которая не заканчивается.
Дальше клиент протестировал наш сервис - и это тот самый случай, когда оценку ИИ оспорили и оспаривающий был прав. Только речь шла не о нашей оценке, а о самодельной, и именно это сравнение показало, в чём разница.
Разница не в «более умной нейросети». Она в устройстве.
Во-первых, под капотом работает несколько моделей, и у каждой своя узкая задача. Одна переводит речь в текст. Вторая расставляет роли в диалоге: где говорит менеджер, где клиент. Третья перепроверяет результат. Четвёртая правит термины и специфические слова конкретной ниши. Пятая анализирует содержание, шестая собирает выводы и отчёт. Ошибка на любом шаге ловится следующим и не уезжает в итоговую оценку.
Во-вторых, есть дерево оценки - настройка под каждый продукт и каждую воронку отдельно. Звонок сначала относится к своей категории и только потом разбирается по правилам, которые для неё написаны. Именно этого не хватало самодельной сборке: она обрабатывала всё одинаково, потому что иначе не умела.
В-третьих, всё это несколько лет отлаживалось на разных нишах, чеках, скриптах и типах воронок - то есть на тех самых исключениях, борьба с которыми и топит самостоятельные попытки.
По результатам сравнения точность оценок превзошла показатели живого контролёра.
Что произошло дальше, для нас важнее самой точности. Собственник передал сервис своему менеджеру по контролю качества - но не для того, чтобы тот продолжал слушать звонки. Прослушивание, выставление оценок и подготовка отчётности занимали у него около 90% рабочего времени. Эти 90% освободились и ушли на другое: приоритизацию находок, внедрение изменений и контроль исполнения.
Аналитика сама по себе не приносит денег. Она приносит их только в связке с процессом, который превращает выводы в действия, - а на этот процесс у людей обычно физически не остаётся времени, потому что оно уходит на прослушку.
Через месяц после перестройки чистая прибыль компании выросла на 14%.
Чем ИИ реально сильнее человека и в чём человек всё ещё нужен?
Сила ИИ - в охвате и постоянстве. Он применяет к потоку звонков одинаковые критерии и быстро выделяет отклонения. Человек нужен для калибровки критериев, разбора спорных разговоров и решений по результатам.
Сравнивать «ИИ против человека» некорректно: у них разные роли. Но понять, кто в чём сильнее, полезно.
Где машина выигрывает объективно:
- Охват. РОП вручную работает с выборкой, тогда как система может применить критерии ко всему доступному потоку.
- Скорость. Автоматический разбор появляется вскоре после загрузки записи, а ручная очередь растёт вместе с объёмом звонков.
- Постоянство. Один и тот же критерий применяется к первому звонку и к тысячному одинаково. Человек к концу дня оценивает иначе, чем утром.
Где нужен человек:
- Калибровка. Критерии пишет и сверяет человек. Без этого система будет уверенно измерять не то.
- Спорные звонки. Нестандартный разговор, удачная импровизация вне скрипта, сложный контекст - это разбирает руководитель.
- Решение. Что делать с оценкой - учить, менять скрипт, разговаривать с менеджером - остаётся за человеком. Сама по себе оценка ничего не меняет.
Роль ИИ - снять с человека сплошную рутину прослушки и отдать ему уже размеченные звонки, чтобы время уходило на разбор отмеченных отклонений, не на ручной поиск проблемных записей. Как выстроить такой контроль по шагам, описано в карте контроля качества для РОПа; какие признаки слива при этом искать - в разборе признаков, что менеджеры сливают лиды; а во сколько обходится невидимый слив, можно посчитать по формуле стоимости слитых лидов.
Как проверить, разберёт ли ИИ ваши звонки?
Не опирайтесь только на общие цифры точности. Возьмите 10-15 реальных звонков, прогоните через анализ и сверьте расшифровку, этапы и итоговую оценку с ручной проверкой. Так вы увидите точность на своей линии и поймёте, какие критерии нужно донастроить.
Любые проценты в статьях - это среднее по рынку. Ваша линия, ваши менеджеры, ваша терминология дадут свою точность, и узнать её можно только на своих звонках.
Практичный способ проверки:
- Возьмите 10-15 реальных записей, желательно разных - удачные, провальные, спорные.
- Прогоните их через анализ и откройте расшифровку. Сверьте с аудио: где система ошиблась в словах, где перепутала говорящих.
- Посмотрите разметку по этапам: совпадает ли она с тем, что вы слышите сами. Отметьте, где критерий сработал не так, как вы ждали.
- По этим расхождениям донастройте критерии и повторите на новой партии звонков.
После пары таких итераций вы точно знаете, чему в оценке ИИ доверять на своих данных, а где оставить контроль за человеком. Это и есть честный ответ на исходный вопрос: доверять стоит не «ИИ вообще», а конкретной настройке, проверенной на ваших звонках.
Источники
- «Речевая аналитика с искусственным интеллектом», UIS: https://www.uiscom.ru/blog/rechevaya-analitika-s-iskusstvennym-intellektom/
- «Что такое речевая аналитика звонков для контактных центров», Skorozvon: https://skorozvon.ru/articles/rechevaya-analitika-zvonkov-dlya-kontaktnyh-centrov
- «Речевая аналитика (speech analytics)», Roistat: https://roistat.com/rublog/rechevaya-analitika-speech-analytics/
- «Скрипты и речевая аналитика: контроль 100% звонков», Rechka: https://rechka.ai/blog/skripty-i-rechevaya-analitika/
- «Расшифровка звонков: от транскрибации к аналитике», Rechka: https://rechka.ai/blog/rasshifrovka-zvonkov/
- «Контроль качества звонков: как ИИ спасает прибыль», AmSales: https://amsales.ru/journal/kontrol-kachestva-zvonkov-ai-audit
- «Сравнение речевой аналитики 1.0 и 2.0», SalesAI: https://blog.salesai.ru/sravnenie-rechevoj-analitiki-pervogo-pokoleniya-i-vtorogo-pokoleniya
Общие цифры точности говорят только о среднем. Что ИИ извлечёт именно из ваших звонков - с вашей линией, терминологией и скриптом - видно на бесплатном аудите записей звонков: мы разбираем разговоры по вашим критериям и показываем, что система услышала и где возникают потери.

