M.I.L.O.M.I.L.O.

Как ИИ анализирует звонки: что он реально ловит, а что нет

Опубликовано 30 июля 2026 г.Обновлено 19 августа 2026 г.12 мин чтенияСредний
Как ИИ анализирует звонки: что он реально ловит, а что нет
Что вы узнаете
  • Разберётесь, как ИИ превращает запись в оценку
  • Поймёте, какие признаки он ловит надёжно
  • Получите план проверки точности на своих звонках
Внедрить за 15 мин
Экономит 3 ч
Средний
5просмотров

Как ИИ анализирует звонки: что распознаёт надёжно, где ошибается, от чего зависит точность и как проверить систему на своих записях без рекламных обещаний.

Этот разбор - для тех, кто выбирает анализ звонков и упирается в вопрос доверия: ИИ поставит оценку разговору, а можно ли ей верить. Ниже - честная карта: что искусственный интеллект в звонке ловит надёжно, что распознаёт с ошибками и что не увидит никогда. Это часть цикла про контроль качества звонков: рядом - как задать критерии оценки, какие признаки слива искать и во сколько обходятся потери.

Как устроен анализ звонков с помощью ИИ?

Анализ звонков с помощью ИИ - это конвейер из трёх шагов. Сначала запись переводится в текст, затем текст и звук размечаются по заданным критериям, после чего собирается отчёт с оценкой. Система не понимает разговор так же, как человек: она проверяет наблюдаемые признаки и смысловые критерии, заданные при настройке.

Когда сервис речевой аналитики «слушает» звонок, он воспринимает его иначе, чем человек. Разговор проходит три стадии. Первая - транскрибация: аудио превращается в текст, а реплики по возможности разносятся по говорящим. Вторая - разметка: система прогоняет текст и звуковые метрики через набор критериев. Проверяет, назвал ли менеджер компанию, задал ли открытый вопрос, прозвучало ли слово из стоп-листа, сколько длились паузы. Третья - отчёт: по этим отметкам выставляется оценка звонка и подсвечиваются проблемные места.

Ключевое здесь - слово «заданные». ИИ проверяет ровно то, что в него заложили как критерий. Он не решает сам, что в этом звонке было важно; он сверяет разговор со списком признаков, который настроили под ваш скрипт. Поэтому вопрос «что ИИ ловит» распадается на два: что он способен распознать технически и что вы попросили его искать. Дальше - про оба.

Что ИИ ловит надёжно?

Надёжнее всего ИИ распознаёт структурные и наблюдаемые признаки: был ли этап скрипта, прозвучали ли конкретные слова, сколько длились паузы, кто говорил больше, перебивал ли менеджер клиента, назначен ли следующий шаг. Эти факты видны в тексте и звуковой дорожке.

Сила машины - в том, что легко свести к проверяемому признаку. По описанию сервисов речевой аналитики (UIS, Skorozvon, Roistat), система уверенно фиксирует:

  1. Ключевые слова и фразы. Прозвучало ли название компании, имя клиента, слово из стоп-листа, упоминание конкурента. Это прямой поиск по тексту.
  2. Этапы скрипта. Было ли приветствие, задан ли открытый вопрос, назван ли следующий шаг. Система сверяет разговор с каркасом скрипта и отмечает пропущенные этапы.
  3. Паузы и темп. Длину пауз, скорость речи, Talk Ratio и затянувшиеся монологи менеджера.
  4. Перебивания. Система слышит, когда менеджер перебивал клиента или наоборот.
  5. Наличие следующего шага. Прозвучали ли в конце конкретная дата и договорённость - или разговор закончился на «звоните, если что».

На таких признаках речевая аналитика работает устойчивее, чем на субъективной оценке эмоций: слово, паузу и наличие этапа можно проверить по записи. Именно эту рутину она снимает с человека. Как разложить звонок на этапы и превратить их в критерии, разобрано в чек-листе оценки звонка.

Насколько точно ИИ расшифровывает речь?

Качество расшифровки зависит от записи сильнее, чем от красивой цифры в презентации сервиса. Чистая двухканальная запись обычно распознаётся лучше, чем шумная моно-запись. Ошибки чаще возникают на редких терминах, именах, акцентах и одновременной речи собеседников.

Точность - первое, о чём спрашивает директор: «система вообще разберёт наши разговоры со всей нашей спецификой?» Универсального процента здесь нет. Результат зависит от телефонии, качества записи, словаря компании и того, говорят ли собеседники одновременно. Поэтому точность нужно измерять на собственных звонках.

Что снижает точность:

  1. Качество линии. Телефонные линии дают результат хуже, чем IP-телефония. Шум, эхо, неразборчивая дикция - выше доля ошибок.
  2. Термины, названия, имена. Редкие слова, узкая номенклатура, фамилии распознаются с ошибками чаще обычной речи.
  3. Одна дорожка вместо двух. Когда менеджер и клиент записаны на раздельные каналы, система точнее понимает, кто что сказал. На моно-записи диаризация работает хуже, и реплики могут смешаться.

Вывод для практики: если запись чистая и двухканальная, расшифровке можно доверять как основе для оценки. Если линия плохая или запись моно - ошибки будут, и это стоит держать в голове, особенно когда критерий завязан на конкретное слово.

Проверить это можно без внедрения: бесплатный аудит записей звонков показывает, что система извлекла из реальных записей с вашей линией и терминологией. Так точность видна на собственных данных.

Что ИИ ловит плохо или не ловит совсем?

Здесь проходит граница, о которой вендоры пишут неохотно. Всё, что сводится к смыслу и намерению, машина распознаёт слабее, чем факт.

  1. Тональность и эмоции. Речевая аналитика размечает разговор как позитивный, негативный или нейтральный, но это грубая шкала. Вежливое «спасибо, я подумаю» с интонацией отказа она легко посчитает нейтральным, а живое раздражение под спокойными словами - пропустит.
  2. Ирония и сарказм. «Ну да, конечно, очень выгодно» на письме выглядит согласием. Машина считывает слова, интонацию голоса за ними - хуже.
  3. Искренность и подтекст. Согласился ли клиент искренне или просто хочет закончить разговор - это человек чувствует по разговору целиком, а система по отдельным признакам улавливает не всегда.
  4. Настоящая причина ухода. ИИ покажет, что менеджер не задал вопрос и не назначил следующий шаг. Но почему клиент на самом деле не купил - передумал, нашёл дешевле, потерял доверие - в записи может быть не сказано вслух, и тогда этого нет и в анализе.

У машины из-за этого есть чёткая зона: она сильна в вопросе «что произошло в разговоре» - какие действия менеджер сделал или пропустил, - и слаба в вопросе «что человек при этом чувствовал». Надёжную оценку строят на первом, а второе оставляют человеку.

Почему анализ по ключевым словам иногда врёт: речевая аналитика 1.0 и 2.0?

Старые системы искали в разговоре заданные слова и ошибались в обе стороны: фраза могла прозвучать в другом смысле или нужная мысль выражалась иначе. Речевая аналитика 2.0 учитывает контекст и перефразирование, но её выводы всё равно зависят от качества критериев и исходной расшифровки.

Часть недоверия к оценке ИИ идёт от старого поколения систем. Речевую аналитику принято делить на два поколения (это различие описывают, например, SalesAI и МТС).

Первое поколение (1.0) работает по ключевым словам и правилам: задан список слов - система ищет их в тексте. Отсюда два типа ошибок:

  1. Ложное срабатывание. Менеджер сказал «не буду давить на вас скидкой» - в тексте есть слово «скидка», правило «упомянул скидку» отметилось, хотя по смыслу всё наоборот.
  2. Пропуск. Клиент выразил сомнение в цене словами «надо посчитать, потяну ли» - слова «дорого» нет, и правило «возражение по цене» промолчало, хотя возражение было.

Второе поколение (2.0) построено на генеративных языковых моделях. Оно разбирает смысл реплики, не буквальное совпадение слов, поэтому лучше понимает перефраз, синонимы и контекст: «потяну ли» оно засчитает как возражение по цене. Это ближе к тому, как разговор понял бы человек. Но и здесь оценка хороша ровно настолько, насколько точно написаны критерии, - поэтому следующий вопрос звучит как «как настроить ИИ под ваш скрипт».

Как настроить ИИ, чтобы он ловил нужное именно вам?

ИИ оценивает звонок по заранее заданному списку признаков. Этот список - дерево оценки: критерии по этапам звонка под ваш скрипт. Каждый критерий лучше привязывать к наблюдаемому факту из записи. Тогда оценка получается воспроизводимой, и её можно проверить.

Вопрос «можно ли доверять оценке ИИ» во многом решается на этапе настройки, ещё до анализа. Система прогоняет звонок по критериям, и вся её справедливость зависит от того, как эти критерии написаны.

В M.I.L.O. набор критериев называется деревом оценки: разговор раскладывается на этапы - от приветствия и выявления потребности до работы с возражениями и фиксации следующего шага, - и на каждом задаётся, что именно проверять. Настраивается это под ваш скрипт один раз, дальше система применяет одни и те же критерии ко всем звонкам.

Рабочее правило настройки - опирать критерий на наблюдаемое, не на интерпретируемое:

  1. Наблюдаемый критерий (машина оценит надёжно): «менеджер назвал конкретную дату следующего контакта», «задан хотя бы один открытый вопрос до презентации», «на возражение прозвучал уточняющий вопрос».
  2. Интерпретируемый критерий (машина оценит зыбко): «менеджер был убедителен», «клиент остался доволен», «разговор прошёл тепло». Такие формулировки лучше переводить в наблюдаемый признак или оставлять человеку.

Чем больше критериев из первой группы, тем меньше споров с отделом: оценку видно в записи, на неё можно показать пальцем. Как собрать такой список под свой скрипт и не раздуть его до полусотни пунктов, разобрано в чек-листе оценки звонка.

Почему самодельная сборка на общедоступных нейросетях обычно не взлетает

Логичная мысль: нейросети доступны всем, звонки есть, промпт написать несложно - зачем платить за готовый сервис. Разберём случай, когда компания прошла этот путь до конца.

Клиент решил построить свою систему оценки отдела продаж на базе стандартных общедоступных ИИ-сервисов. Внедрял три месяца. В компании работал менеджер по контролю качества, поэтому появилась возможность честно сверить: одни и те же звонки оценивал человек и оценивала система.

Оценки расходились сильно, и права оказывалась не машина. Человек видел контекст: кто этот клиент, в какой он ситуации, почему в этом разговоре уместно одно, а в соседнем - прямо противоположное. Система выдавала стандартный анализ по единому шаблону.

Попытки дообучать систему сделали хуже. Каждое уточнение под один сценарий ломало оценку в другом, и количество странных ошибок только росло. Это типичная траектория самодельных сборок: первые две недели выглядят обнадёживающе, дальше начинается борьба с исключениями, которая не заканчивается.

Дальше клиент протестировал наш сервис - и это тот самый случай, когда оценку ИИ оспорили и оспаривающий был прав. Только речь шла не о нашей оценке, а о самодельной, и именно это сравнение показало, в чём разница.

Разница не в «более умной нейросети». Она в устройстве.

Во-первых, под капотом работает несколько моделей, и у каждой своя узкая задача. Одна переводит речь в текст. Вторая расставляет роли в диалоге: где говорит менеджер, где клиент. Третья перепроверяет результат. Четвёртая правит термины и специфические слова конкретной ниши. Пятая анализирует содержание, шестая собирает выводы и отчёт. Ошибка на любом шаге ловится следующим и не уезжает в итоговую оценку.

Во-вторых, есть дерево оценки - настройка под каждый продукт и каждую воронку отдельно. Звонок сначала относится к своей категории и только потом разбирается по правилам, которые для неё написаны. Именно этого не хватало самодельной сборке: она обрабатывала всё одинаково, потому что иначе не умела.

В-третьих, всё это несколько лет отлаживалось на разных нишах, чеках, скриптах и типах воронок - то есть на тех самых исключениях, борьба с которыми и топит самостоятельные попытки.

По результатам сравнения точность оценок превзошла показатели живого контролёра.

Что произошло дальше, для нас важнее самой точности. Собственник передал сервис своему менеджеру по контролю качества - но не для того, чтобы тот продолжал слушать звонки. Прослушивание, выставление оценок и подготовка отчётности занимали у него около 90% рабочего времени. Эти 90% освободились и ушли на другое: приоритизацию находок, внедрение изменений и контроль исполнения.

Аналитика сама по себе не приносит денег. Она приносит их только в связке с процессом, который превращает выводы в действия, - а на этот процесс у людей обычно физически не остаётся времени, потому что оно уходит на прослушку.

Через месяц после перестройки чистая прибыль компании выросла на 14%.

Чем ИИ реально сильнее человека и в чём человек всё ещё нужен?

Сила ИИ - в охвате и постоянстве. Он применяет к потоку звонков одинаковые критерии и быстро выделяет отклонения. Человек нужен для калибровки критериев, разбора спорных разговоров и решений по результатам.

Сравнивать «ИИ против человека» некорректно: у них разные роли. Но понять, кто в чём сильнее, полезно.

Где машина выигрывает объективно:

  1. Охват. РОП вручную работает с выборкой, тогда как система может применить критерии ко всему доступному потоку.
  2. Скорость. Автоматический разбор появляется вскоре после загрузки записи, а ручная очередь растёт вместе с объёмом звонков.
  3. Постоянство. Один и тот же критерий применяется к первому звонку и к тысячному одинаково. Человек к концу дня оценивает иначе, чем утром.

Где нужен человек:

  1. Калибровка. Критерии пишет и сверяет человек. Без этого система будет уверенно измерять не то.
  2. Спорные звонки. Нестандартный разговор, удачная импровизация вне скрипта, сложный контекст - это разбирает руководитель.
  3. Решение. Что делать с оценкой - учить, менять скрипт, разговаривать с менеджером - остаётся за человеком. Сама по себе оценка ничего не меняет.

Роль ИИ - снять с человека сплошную рутину прослушки и отдать ему уже размеченные звонки, чтобы время уходило на разбор отмеченных отклонений, не на ручной поиск проблемных записей. Как выстроить такой контроль по шагам, описано в карте контроля качества для РОПа; какие признаки слива при этом искать - в разборе признаков, что менеджеры сливают лиды; а во сколько обходится невидимый слив, можно посчитать по формуле стоимости слитых лидов.

Как проверить, разберёт ли ИИ ваши звонки?

Не опирайтесь только на общие цифры точности. Возьмите 10-15 реальных звонков, прогоните через анализ и сверьте расшифровку, этапы и итоговую оценку с ручной проверкой. Так вы увидите точность на своей линии и поймёте, какие критерии нужно донастроить.

Любые проценты в статьях - это среднее по рынку. Ваша линия, ваши менеджеры, ваша терминология дадут свою точность, и узнать её можно только на своих звонках.

Практичный способ проверки:

  1. Возьмите 10-15 реальных записей, желательно разных - удачные, провальные, спорные.
  2. Прогоните их через анализ и откройте расшифровку. Сверьте с аудио: где система ошиблась в словах, где перепутала говорящих.
  3. Посмотрите разметку по этапам: совпадает ли она с тем, что вы слышите сами. Отметьте, где критерий сработал не так, как вы ждали.
  4. По этим расхождениям донастройте критерии и повторите на новой партии звонков.

После пары таких итераций вы точно знаете, чему в оценке ИИ доверять на своих данных, а где оставить контроль за человеком. Это и есть честный ответ на исходный вопрос: доверять стоит не «ИИ вообще», а конкретной настройке, проверенной на ваших звонках.

Источники

Общие цифры точности говорят только о среднем. Что ИИ извлечёт именно из ваших звонков - с вашей линией, терминологией и скриптом - видно на бесплатном аудите записей звонков: мы разбираем разговоры по вашим критериям и показываем, что система услышала и где возникают потери.

Была ли статья полезной?
Евгений Санников
Автор
Евгений Санников
CEO M.I.L.O.

Я строю M.I.L.O. - сервис, который слушает звонки отдела продаж с помощью искусственного интеллекта и показывает, на каком месте разговора ушёл клиент. Компании чинят эти места и зарабатывают больше на том же потоке заявок - за счёт роста конверсии и среднего чека.

Похожие статьи

Должностная инструкция менеджера по продажам: что в неё писать

Разбираем должностную инструкцию менеджера по продажам как рабочий документ: из каких пяти разделов она состоит, какие формулировки обязанностей можно проверить, а какие остаются пожеланиями, и как убедиться, что подписанный документ действительно исполняется.

17 мин

Стоимость лида: как посчитать и понять, много это или мало

Считаем стоимость лида по формуле, сравниваем с рынком и разбираем, почему одинаковый CPL у двух каналов может означать прямо противоположные вещи.

11 мин

Анализ звонков менеджеров: как найти ошибки без ручной прослушки

РОП может послушать десять звонков и почувствовать проблему. Но чтобы управлять продажами, нужна карта повторяющихся ошибок вместо разового разбора: где менеджер теряет потребность, возражение, следующий шаг и деньги.

16 мин

Окупится ли анализ звонков: честный расчёт выгоды и пилот

Вендоры показывают ROI в сотни и тысячи процентов, но эти цифры держатся на одном допущении. Разбираем честную формулу окупаемости анализа звонков, четыре ловушки завышения и как проверить выгоду на пилоте за 2-4 недели.

14 мин

Похожие термины

Термин

дерево оценки

Настраиваемый список критериев, по которым ИИ оценивает звонок: этапы разговора от приветствия до фиксации следующего шага.

Термин

речевая аналитика

Автоматический разбор речи в звонках: транскрибация плюс оценка по заданным критериям.

Термин

транскрибация

Автоматический перевод записи звонка в текст для последующего анализа.

Термин

РОП

РОП - руководитель отдела продаж, который отвечает за план, команду, конверсию, качество звонков и управленческие решения по продажам.

Термин

Talk Ratio

Соотношение времени речи менеджера и клиента в разговоре.

Термин

речевая аналитика 2.0

Поколение анализа звонков, которое учитывает смысл и контекст реплик, а не только совпадение ключевых слов.

Термин

диаризация

Автоматическое разделение аудиозаписи на реплики разных говорящих.

Термин

следующий шаг

Следующий шаг - конкретное действие после контакта с клиентом: задача, дата и ответственный, без которых сделка легко теряется.

Термин

Двухканальная запись

Формат записи, в котором голос менеджера и клиента хранятся на отдельных аудиоканалах.