Искусственный интеллект
# технология

Технология мгновенной реакции: «Сбер» готовит голосовой ИИ, способный вести живой диалог без пауз

Технология мгновенной реакции: «Сбер» готовит голосовой ИИ, способный вести живой диалог без пауз
Сбербанк разрабатывает технологию «фулл-дуплекс» для создания более естественного взаимодействия с ИИ. Новая нейросеть сможет одновременно слушать и говорить, имитируя живой телефонный диалог.

В Сбербанке работают над созданием принципиально иного формата взаимодействия с искусственным интеллектом. Речь идет о технологии «фулл-дуплекс», которая позволит нейросети имитировать естественный телефонный разговор, обладая способностью одновременно воспринимать речь и генерировать собственную. О деталях этой разработки в интервью РБК сообщил Сергей Марков, отвечающий за развитие технологий ИИ в финансовой организации.

Существующий сегодня стандарт работы голосовых помощников предполагает строго последовательный процесс: пользователь завершает фразу, система обрабатывает запрос, и лишь после этого следует ответ. Текущие решения опираются на цепочку из нескольких разных нейросетей, где одна отвечает за распознавание речи, вторая — за формирование смысла, а третья — за синтез голоса. Новая концепция, представленная Марковым, предполагает использование единой модели. Такой подход позволит ИИ не только вести бесперебойную беседу, но и, при интеграции с видеоданными, считывать визуальный контекст и управлять мимикой аватара.

Мировая практика уже демонстрирует подобные успехи: в 2024 году французский стартап Kyutai представил модель Moshi, а вслед за ними свои аналоги выкатили гиганты Google (в лице Gemini Live) и OpenAI (проект GPT-Live). Главное достижение таких систем — радикальное снижение задержки. Если раньше ожидание ответа измерялось секундами, то теперь оно составляет всего 160–320 миллисекунд, что практически идентично скорости реакции обычного человека.

На российском рынке подобные амбициозные проекты пока не афишируются. Стоит отметить, что у «Яндекса» реализовано решение Realtime API, позволяющее быстро отвечать и прерывать ассистента. Однако, по оценке Сергея Маркова, это не является полноценным дуплексом. Ключевое различие заключается в том, что алгоритмы «Яндекса» всё еще ожидают окончания реплики пользователя, в то время как технология «фулл-дуплекс» способна непрерывно слушать собеседника даже в момент собственного вещания.

Видео для новости

Похожие новости