❓ Вопрос / 💻 Технологии
📅 30.07.2026 02:42

OpenAI и Alibaba представили новые голосовые модели

"Откройте для себя новые инновационные голосовые модели от OpenAI и Alibaba. Узнайте, как эти технологии изменяют взаимодействие с искусственным интеллектом и улучшают качество голосового общения."

Краткий пересказ от QRazy ИИ

  • OpenAI представила модели для точного распознавания речи, адаптируя их к контексту беседы и снижая коэффициент ошибок.
  • Alibaba разработала системы для естественного голосового общения, позволяя пользователю прерывать ответ без обращения к тексту.
  • Новые модели отличаются по задачам: OpenAI фокусируется на расшифровке, а Alibaba — на интерактивном диалоге и использовании внешних функций.

OpenAI и Alibaba почти одновременно показали новые модели для работы с голосом. При этом компании решают разные задачи. OpenAI улучшает перевод речи в текст, а Alibaba развивает системы, с которыми можно разговаривать голосом в реальном времени.

Новые модели OpenAI для распознавания речи

OpenAI представила две модели: GPT-Live-Transcribe и GPT-Transcribe.

GPT-Live-Transcribe расшифровывает речь прямо во время разговора. Звук обрабатывается по мере поступления, поэтому текст появляется почти сразу. Модель можно использовать для звонков, онлайн-встреч, голосовых помощников и других сервисов, где важна небольшая задержка.

GPT-Transcribe предназначена для уже готовых записей. Например, ей можно передать интервью, лекцию, подкаст или телефонный разговор. Также модель подходит для пакетной обработки большого количества аудиофайлов.

Моделям можно заранее объяснить контекст

Перед началом расшифровки пользователь может рассказать модели, о чём будет запись. В описании разрешается указать имена людей, названия компаний, профессиональные термины, ключевые слова и предполагаемые языки.

Это пригодится в тех случаях, когда в разговоре встречаются редкие фамилии, названия продуктов или узкоспециализированные выражения. Без подсказки система может принять незнакомое слово за более привычное и записать его неправильно.

GPT-Live-Transcribe также учитывает предыдущие реплики. Модель не воспринимает каждую фразу отдельно, а старается следить за ходом разговора. Если человек продолжает начатую ранее мысль, система может использовать уже расшифрованный текст для понимания следующей реплики.

Что показали тесты OpenAI

В тесте OpenAI Context Aware ASR дополнительная информация о записи заметно повлияла на результат.

Семантическая точность GPT-Live-Transcribe выросла с 38,5% до 44,6%. У GPT-Transcribe показатель увеличился с 41,6% до 45,2%.

На реальных аудиозаписях новые модели также ошибались реже своих предшественников. У GPT-Live-Transcribe коэффициент ошибок составил 9,60%. Для сравнения, GPT-Realtime-Whisper показала 11,65%.

GPT-Transcribe завершила тот же тест с результатом 8,98%, тогда как у Whisper-1 коэффициент ошибок достигал 15,21%.

Artificial Analysis приводит ещё один результат. В её тестах коэффициент ошибок в словах у GPT-Transcribe составил 3,31%. Это заметно лучше показателей предыдущих моделей OpenAI.

Обработка 1000 минут аудио с помощью GPT-Transcribe стоит $4,50.

Alibaba сделала ставку на живой разговор

Alibaba представила Qwen-Audio-3.0-Realtime Plus и Qwen-Audio-3.0-Realtime Flash. Эти модели рассчитаны прежде всего на голосовое общение. Человек говорит с системой, а она отвечает ему голосом без необходимости постоянно переходить к текстовому интерфейсу.

Разговор при этом не обязательно вести строго по очереди. Пользователь может начать говорить, пока модель ещё отвечает. Система должна заметить новую реплику, остановить текущий ответ и переключиться на то, что сказал человек.

Для голосовых помощников это важная возможность. В обычных системах пользователю нередко приходится ждать, пока закончится длинный ответ, или повторять вопрос, если помощник не заметил перебивание.

Модели Alibaba также умеют обращаться к внешним функциям. Благодаря этому голосовой помощник может не только отвечать на вопросы, но и выполнять действия в подключённых сервисах. Кроме того, заявлена возможность клонирования пользовательских голосов.

Qwen заняла первое место в рейтинге

Qwen-Audio-3.0-Realtime Plus возглавила рейтинг Artificial Analysis Speech-to-Speech Index. Модель получила 84,1%.

GPT-Realtime-2.1 High от OpenAI заняла второе место с результатом 79,1%.

Решение Alibaba также показало лучшие результаты в тестах на речевое мышление, ведение диалога и выполнение агентных задач. Иными словами, модель хорошо справилась не только с обычной беседой, но и со сценариями, в которых нужно понимать ситуацию и использовать дополнительные инструменты.

Главный недостаток — долгая пауза перед ответом

При всех сильных сторонах у Qwen-Audio-3.0-Realtime Plus есть заметный минус. Модель не сразу начинает отвечать.

По данным Artificial Analysis, первое аудио появляется примерно через четыре секунды после реплики пользователя. В обычном голосовом разговоре такая пауза уже хорошо ощущается.

У GPT-Realtime-2 High задержка значительно меньше — около 1,14 секунды.

Компании пока развивают разные направления

OpenAI сейчас делает упор на точную расшифровку речи. Новые модели подойдут для обработки интервью, звонков, лекций, совещаний и других аудиозаписей.

Alibaba больше внимания уделяет самому разговору. Её модели умеют реагировать на перебивания, обращаться к внешним функциям и вести диалог голосом.

При этом однозначного победителя пока нет. Решение Alibaba оказалось сильнее в тестах на голосовое общение, но заметно проигрывает OpenAI по скорости начала ответа.

👁 141 💬 0 👍 0 👎 0