mksim.pro
К списку статей
ИИ 9 мин чтения

Голосовые агенты дошли до операций: что отличает рабочего агента от дорогой демки

ElevenLabs сообщает про 15 млн разговоров в неделю, и это уже возвраты, страховые операции и бронирования. Разбираю, почему голос первым из agentic AI попал в реальные процессы, что отличает работающего агента от демонстрации и что делать с персональными данными и 152-ФЗ, когда запись разговора становится вашим активом и вашим риском.

ElevenLabs получила оценку около 22 млрд долларов в рамках сделки с выкупом акций сотрудников, примерно вдвое больше февральской. Компания сообщает, что её голосовые агенты проводят больше 15 млн разговоров в неделю – примерно втрое больше февральского уровня. Цифры здесь даны как заявление компании, сверить их со стороны я не могу, и сама по себе оценка мне интересна мало.

Интересно другое – расшифровка того, чем эти разговоры заняты. Речь уже идёт не только про генерацию речи: по словам компании, агенты обрабатывают возвраты, страховые операции, бронирования. Это обычные операционные процессы, за которые внутри компании кто-то отвечает по метрикам. Голос перестал быть витриной и попал в операции. В сегменте agentic AI, где большая часть разговоров пока идёт про потенциал, это первый участок с массовым и понятным production-сценарием.

Ниже – моя попытка разобрать, почему первым пошёл именно голос, что отличает работающего агента от дорогой демонстрации и какой вопрос про персональные данные нужно задать до пилота, а не после.

Почему первым пошёл именно голос

Я бы не стал объяснять это зрелостью моделей. Качество синтеза и распознавания действительно выросло, но у голосового обращения в поддержку есть четыре свойства, которых нет у большинства модных агентных сценариев.

  • Процесс короткий. Разговор про возврат или перенос брони укладывается в минуты. У агента нет длинного горизонта, на котором накапливается ошибка, и нет десятка шагов, где каждый следующий опирается на предыдущий. Про то, как плохо агенты держатся на длинных задачах, я писал отдельно – длинные задачи и готовность к проду.

  • Сценарий узкий. У обращения есть конечный список исходов: оформили возврат, перенесли дату, проверили статус, передали человеку. Узкая область – это то место, где языковая модель ведёт себя предсказуемо, потому что ей просто некуда уйти в сторону.

  • Результат проверяемый. Через час после разговора видно, создана ли заявка на возврат, изменена ли бронь, закрыт ли тикет. Здесь не нужен экспертный разбор, чтобы понять, сработал агент или нет. Для сравнения: качество агента, который пишет аналитическую записку, вы будете оценивать неделями и спорить о критериях.

  • Экономика считается в стоимости обращения. У поддержки уже есть цифра: сколько стоит минута оператора, сколько обращений приходит в час пик, сколько стоит нанять и обучить человека. Любой пилот тут сравнивается с готовым знаменателем, а не с гипотезой. Я обычно начинаю разговор про ИИ именно с этого – какие вопросы задать до инвестиции.

Соберите эти четыре свойства вместе, и вы получите портрет процесса, который первым выдерживает автоматизацию. Что характерно, голос тут вторичен: то же самое сработало бы в тексте. Просто телефонный канал в поддержке дороже всего обходится компании, поэтому экономия заметна быстрее.

Что отличает работающего агента от дорогой игрушки

Демонстрация голосового агента почти всегда выглядит отлично. Она и должна: сценарий подобран, собеседник доброжелателен, краевых случаев нет. Разница между демо и работающей системой лежит в пяти вещах, и ни одна из них не про качество голоса.

Честная передача человеку. Агент должен уметь признать, что не справляется, и передать разговор оператору вместе с контекстом – что уже выяснено, что клиент просил, что агент успел сделать. Плохая передача выглядит так: клиент заново рассказывает историю живому человеку. Это злит сильнее, чем если бы робота не было вовсе. Отдельно стоит продумать явный выход по требованию: клиент сказал "оператора" – агент не уговаривает его остаться.

Подтверждение необратимых операций. Проверить статус заказа агент может сам. Списать деньги, отменить полис, аннулировать бронь – это операции, которые нельзя откатить одним движением, и для них нужен либо явный подтверждающий шаг, либо человек в контуре. Граница проходит не по сложности задачи, а по цене ошибки. Про этот принцип у меня есть отдельная заметка: человек в контуре автоматизации.

Запись и хранение разговора по правилам. Голосовой агент по определению производит запись и расшифровку каждого разговора. Это новый массив чувствительных данных, у которого должны быть срок хранения, правила доступа, журнал обращений и процедура удаления. Если про это подумали после запуска, вы получите архив записей, который никто не контролирует.

Идентификация звонящего. Прежде чем обсуждать заказ или полис, агент должен понимать, с кем разговаривает. Голос звучит убедительно и этим опасен: человек на том конце склонен доверять уверенной интонации. Идентификация должна опираться на проверяемые факторы – код из приложения, звонок с известного номера, данные, которые знает только клиент, – а решение о её достаточности принимается до запуска, а не в момент первого спорного случая.

Измеримая доля доведённых до конца обращений. Главная метрика голосового агента – сколько обращений он закрыл полностью, так что оператор не подключался и клиент не перезвонил в ближайшие сутки. Вокруг неё собираются остальные: доля передач оператору, средняя длительность, доля брошенных звонков, стоимость обращения. Если такой метрики нет, вы не управляете системой, а наблюдаете за ней.

Разговор с клиентом – это персональные данные, а голос бывает биометрией

Этот блок я вынес отдельно, потому что его чаще всего пропускают.

Любой разговор с клиентом содержит персональные данные: имя, номер заказа, адрес доставки, детали полиса, иногда здоровье и финансы. Запись разговора и его расшифровка – это обработка персональных данных со всеми вытекающими: основание обработки, уведомление человека о записи, срок хранения, ограничение доступа, удаление по требованию. Текстовый чат-бот создаёт ровно те же обязательства, просто в случае звонка объём данных больше и формат тяжелее.

Дальше начинается специфика голоса. Если запись голоса используется для того, чтобы установить личность звонящего, по 152-ФЗ это биометрические персональные данные, а у них отдельный и более строгий режим: по общему правилу требуется письменное согласие, а государственная биометрическая система живёт по собственным правилам. Практический вывод простой: голосовая аутентификация и запись разговора ради качества обслуживания – это две разные истории с разной юридической нагрузкой, и смешивать их в одном пилоте не стоит.

Второй вопрос, который в российском контуре нужно задавать поставщику первым: где физически обрабатывается и хранится запись. Голосовой агент обычно означает поток аудио в облако вендора, часто зарубежное, с хранением записей и расшифровок на его стороне. Требование о том, что базы с персональными данными россиян должны находиться на территории России, никуда не делось, и трансграничная передача требует отдельных оснований и уведомления регулятора. Архитектурно это упирается в выбор: локальное развёртывание моделей, российское облако либо сознательное сужение того, что вообще уходит наружу.

Третий вопрос – что вендор делает с вашими разговорами. Пункт про использование данных клиентов для улучшения моделей в стандартном договоре стоит читать внимательно: записи разговоров ваших клиентов это ваш актив и ваша ответственность. По 152-ФЗ перед человеком отвечает оператор, то есть вы, а не поставщик модели. Я разбирал эту конструкцию подробно – ИИ-контур и 152-ФЗ, и отдельно про то, что защита начинается с карты потоков: сначала карта потоков, потом меры.

Как выбрать первый процесс для пилота

Критерии, по которым я бы отбирал кандидата. Процесс должен проходить все шесть, а не пять из шести.

  1. Высокая частота и низкая вариативность. Сотни однотипных обращений в неделю. Редкий сложный случай не даст ни статистики, ни экономии, зато соберёт все краевые ситуации сразу.

  2. Короткий горизонт. Задача решается внутри одного разговора. Сценарии с ожиданием, возвратом через сутки и несколькими участниками оставьте на потом.

  3. Проверяемый машиной результат. После разговора в системе появляется объект, который можно посчитать: заявка, изменённая запись, закрытый тикет. Это ваш критерий успеха и источник метрики.

  4. Понятная цена ошибки и возможность откатить. Ошибку в статусе заказа исправляют извинением. Ошибку в списании денег исправляют возвратом, разбирательством и репутационным ущербом. Начинайте с первого типа.

  5. Чистые данные на входе. Агенту нужен доступ к актуальному статусу заказа, условиям тарифа, правилам возврата. Если эти сведения разбросаны по трём системам и расходятся между собой, голосовой агент просто быстрее и вежливее озвучит ваш бардак.

  6. Ясный правовой контур. До запуска известно: на каком основании ведётся запись, как человек об этом уведомляется, где хранятся аудио и расшифровки, сколько и кто имеет к ним доступ. Это решается на старте, потому что задним числом переделывать придётся вместе с интеграцией.

И ещё одно практическое правило: первый месяц держите агента в режиме, где человек видит каждый разговор в записи и может вмешаться. Этот месяц даст вам список реальных краевых случаев, который невозможно придумать заранее.

Честные оговорки

  • Цифры ElevenLabs – это заявление компании. 15 млн разговоров в неделю и оценка в 22 млрд долларов пришли от самой компании и из сделки с акциями сотрудников. Независимой проверки у меня нет, и строить на этих числах выводы о рынке я бы не стал. Полезен тут сам факт: категория процессов, где голосовые агенты уже работают, названа вслух.

  • Массовость не равна качеству. Объём разговоров ничего не говорит о доле обращений, которые агент довёл до конца, и о том, сколько раз клиент потом перезвонил живому человеку. Эту метрику публично никто не раскрывает, и у себя её придётся считать самому.

  • Голос дороже текста и ломается заметнее. Задержка в полторы секунды в чате незаметна, в разговоре она убивает диалог. Телефонный канал добавляет к стеку телефонию, потоковое распознавание, синтез и прерывания собеседника – каждый слой со своей латентностью и своей ценой. Если тот же процесс закрывается в чате, начинать разумнее с чата. Про практическую сторону голосовых интерфейсов я писал раньше: голосовой интерфейс важен не только для телефонов.

  • Я не продаю голосовых агентов. Моя роль здесь – помочь выбрать процесс, посчитать экономику, выстроить правовой контур и требования к поставщику. Саму интеграцию и телефонию делают профильные команды, и мне спокойнее привести их, чем изображать подрядчика во всём сразу.

Если коротко

  • ElevenLabs сообщает про 15 млн разговоров в неделю и оценку около 22 млрд долларов; важнее цифр то, что агенты заняты возвратами, страховыми операциями и бронированиями.
  • Голос пошёл первым из-за свойств процесса: короткий разговор, узкий сценарий, машинно-проверяемый результат и готовая экономика в стоимости обращения.
  • Работающего агента от демонстрации отличают честная передача человеку, подтверждение необратимых операций, правила хранения записей, идентификация звонящего и метрика доведённых до конца обращений.
  • Запись разговора – это персональные данные, а голос для установления личности – биометрия с более строгим режимом. Вопрос "где физически обрабатывается запись" задают поставщику до пилота.
  • Первый процесс выбирают по частоте, короткому горизонту, проверяемому результату, цене ошибки, чистоте данных и ясному правовому контуру.

Если вы думаете про голосового агента в поддержке или уже получили предложение от подрядчика, самый полезный разговор – про выбор процесса и правовой контур до интеграции, а не после. Обсудить задачу можно через форму на главной, и первый разговор ни к чему вас не обязывает.

К списку статей
Контакт

Если эта статья отозвалась - напишите. Я отвечаю лично.

Telegram TenChat MAX