Top.Mail.Ru
Эксперт счел голосовой ИИ не готовым к прорыву из-за проблем с пониманием речи — MiraNews

Эксперт счел голосовой ИИ не готовым к прорыву из-за проблем с пониманием речи

11 октября 2026, 21:45 ·

Голосовой интерфейс претендует на роль следующего крупного способа взаимодействия с технологиями. Инвесторы уже вложили миллиарды долларов в стартапы, разрабатывающие голосовой искусственный интеллект: от создателей моделей и корпоративных сервисов поддержки до приложений для протоколирования встреч и голосового ввода.

Новые модели и инструменты появляются практически каждую неделю и обещают звучать и вести диалог по-человечески. Однако, по словам технического директора корпоративной платформы PolyAI Шона Вэня, голосовой искусственный интеллект пока не пережил своего «момента ChatGPT». Даже модели с полным дуплексом, способные одновременно слушать собеседника и отвечать ему, ещё не сделали общение полностью естественным.

«Мы достигли важного этапа, создав модели с полным дуплексом. Следующая задача — сделать рассуждение очень быстрым, чтобы модели могли оперативно находить ответы, а разговор ощущался естественным», — сказал Вэнь на конференции HumanX в прошлом месяце, как передаёт TechCrunch. Он также отметил, что голосовые агенты в службах поддержки не должны звучать механически: клиентам важно доверять им решение своих проблем.

«Думаю, следующий этап будет немного другим: когда голос станет достаточно качественным и клиент согласится поговорить с системой первые два-три раза, у него начнёт формироваться доверие. Со временем человек может решить, что ему, вероятно, не нужно обращаться к оператору, если агент способен решить проблему», — заявил Вэнь.

Директор по маркетингу сервиса Otter для автоматической расшифровки встреч Алекс Гэй считает важными точное определение говорящих, понимание их намерений и обработку сказанного с учётом корпоративных знаний. Otter также разрабатывает цифровых двойников, которые смогут представлять участников встреч. По словам Гэя, такие системы должны передавать эмоциональные оттенки речи, иначе взаимодействие с аватаром сведётся к обычному чат-боту с вопросами и ответами, а не к полноценному обсуждению.

Отдельной проблемой остаётся точность распознавания речи. Модели автоматического распознавания речи могут пропускать ключевые слова, из-за чего теряется часть контекста, а ошибки в расшифровке приводят к неверным итогам встреч и последующим действиям. «Для Otter расшифровка никогда не была конечной целью. Это был лишь слой, на основе которого мы могли запускать функции повышения продуктивности. Но если исходная расшифровка недостаточно точна, все дальнейшие действия становятся ошибочными. Как только система начинает действовать неправильно, доверие к платформе исчезает. Поэтому для нас критически важно продолжать улучшать модель автоматического распознавания речи, поскольку последствия затрагивают все последующие процессы», — сказал Гэй. Разработчики также считают необходимым заранее сообщать людям, что их записывает искусственный интеллект или что они разговаривают с ним, чтобы сохранять доверие участников общения.