GPT Transcribe и GPT Live Transcribe: когда новые модели OpenAI выгоднее конкурентов, а когда нет

Компания, которая расшифровывает звонки, интервью или совещания, теперь может делать это через новые модели OpenAI: GPT Transcribe для аудиофайлов и GPT Live Transcribe для потокового звука в реальном времени. Одновременно OpenAI снизила цену: минута обработки файла стоит $0,0045, минута потоковой расшифровки — $0,017. Для бизнеса это означает конкретный вопрос: стоит ли переносить транскрибацию на новые модели, или конкуренты с более низким уровнем ошибок всё ещё выгоднее. Ответ зависит не от громкости анонса, а от трёх цифр: точности (WER), скорости и цены за минуту. Ниже — разбор этих цифр и рабочий метод выбора.

Источник: OpenAI News: Introducing GPT Transcribe and GPT Live Transcribe

Что именно выпустила OpenAI

OpenAI представила две модели распознавания речи, доступные через API.

GPT Transcribe работает с готовыми аудиофайлами. По данным компании, она обрабатывает запись примерно в 34 раза быстрее реального времени: часовое совещание расшифровывается примерно за две минуты машинной работы. Это важно для архивов звонков, подкастов, записей встреч — всего, что накапливается пачками.

GPT Live Transcribe оптимизирована для потоковой расшифровки с минимальной задержкой — то есть для сценариев, где текст нужен прямо во время речи: живые субтитры, голосовые ассистенты, расшифровка совещания на ходу.

Обе модели умеют учитывать текстовый контекст и заданные ключевые слова — например, можно заранее передать список названий продуктов или фамилий, чтобы модель не искажала их в расшифровке. Поддерживается мультиязычный ввод.

Почему это меняет экономику транскрибации

Цена — главная часть релиза. Минута обработки файла через GPT Transcribe стоит $0,0045. Для прикидки: 100 часов записей в месяц — это 6000 минут, то есть около $27. Для большинства компаний это сумма, которая не требует отдельного согласования бюджета, и транскрибация перестаёт быть «дорогой функцией», которую включают только для избранных записей.

Потоковая GPT Live Transcribe стоит $0,017 за минуту — почти в четыре раза дороже. Это нормальная рыночная логика: низкая задержка требует больше вычислений. Но для бизнеса это означает, что «живую» расшифровку нужно включать осознанно: если текст нужен не в реальном времени, а через час после встречи, дешевле сохранить файл и прогнать его через GPT Transcribe.

Второй экономический эффект — скорость. Обработка в 34 раза быстрее реального времени означает, что ночной архив записей контакт-центра можно расшифровать до утра без очередей и без резервирования мощностей.

Что показывают независимые замеры

По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe показывает уровень ошибок в словах (WER) 3,3%. Это на 0,7 процентного пункта лучше, чем у предшественницы — GPT-4o Transcribe. Прогресс есть, но лидером рынка новая модель не стала.

Текущий рейтинг AA-WER выглядит так:

Модель WER (доля ошибок в словах) Что это значит для бизнеса
Fun-Realtime-ASR-Preview (Alibaba) 1,7% Лучшая точность, но нужно проверять доступность и условия API
ElevenLabs Scribe v2 2,2% Сильная точность у профильного аудио-вендора
MAI-Transcribe-1.5 2,4% Конкурент в верхней части рейтинга
Mistral Voxtral Small 2,8% Европейский вариант, интересен с точки зрения юрисдикции
Gemini 3.1 Pro 2,8% Вариант внутри экосистемы Google
GPT Transcribe (OpenAI) 3,3% Не лидер по точности, но низкая цена и высокая скорость

Разница между 2,2% и 3,3% выглядит небольшой, но на практике это заметно: на часовой записи речь идёт о десятках дополнительных ошибок. Если расшифровка идёт напрямую клиенту, в юридические документы или в медицинские карты — эта разница критична. Если текст нужен для внутреннего поиска по архиву или черновой выжимки совещания — разница почти не ощущается, а цена и скорость выходят на первый план.

Важная оговорка: бенчмарки — это снимок на дату теста. Рейтинги обновляются, модели переобучаются, поэтому перед внедрением стоит свериться с актуальной версией таблицы Artificial Analysis и прогнать собственный тест на своих записях.

Как выбрать модель без веры в анонсы

Практический метод сводится к четырём шагам, и ни один не требует глубокой технической экспертизы.

Шаг 1. Определите сценарий: файл или поток. Если текст нужен после записи — это файловый сегмент, где конкурируют GPT Transcribe, Scribe v2, Voxtral и другие. Если текст нужен во время речи — сегмент потоковый, и там сравнивать нужно GPT Live Transcribe с другими решениями реального времени, учитывая её цену $0,017 за минуту.

Шаг 2. Посчитайте стоимость ошибки, а не только стоимость минуты. Ошибка в расшифровке внутреннего совещания стоит ноль рублей. Ошибка в расшифровке клиентского звонка, которая попадёт в претензию или договор, стоит дорого. Чем выше цена ошибки, тем сильнее аргумент в пользу модели с меньшим WER, даже если минута дороже.

Шаг 3. Прогоните пилот на своих данных. Возьмите 10–20 типичных записей: с шумом, акцентами, профессиональной лексикой, несколькими говорящими. Отправьте их в две-три модели и сравните результат глазами. Общий бенчмарк не знает, как звучат ваши менеджеры и ваши термины.

Шаг 4. Проверьте функцию ключевых слов. Обе новые модели OpenAI умеют учитывать заданный словарь. Если в ваших записях постоянно звучат названия продуктов, ФИО или отраслевые термины, эта функция может сократить ошибки сильнее, чем разница в WER между моделями. Проверьте её в пилоте отдельно.

Где ограничения и риски

Первый риск — доступ и оплата. API OpenAI для российских компаний означает привычный набор вопросов: способ оплаты, стабильность доступа, риск блокировки аккаунта. Если процесс транскрибации станет критичным для бизнеса, зависимость от одного зарубежного провайдера нужно закладывать в архитектуру заранее — например, через слой абстракции, позволяющий переключить модель.

Второй риск — данные. Записи звонков и совещаний часто содержат персональные данные и коммерческую тайну. Перед отправкой аудио в любой внешний API нужно понять, какие условия обработки и хранения данных принимает компания, и согласовать это с юристом.

Третий риск — устаревание цифр. Цены и бенчмарки в этой статье приведены на момент публикации. OpenAI уже один раз снизила тарифы вместе с релизом; конкуренты отвечают тем же. Решение, принятое по сегодняшней таблице, стоит пересматривать раз в квартал.

Четвёртое ограничение: WER — усреднённая метрика. Модель с лучшим средним показателем может хуже справляться именно с вашим типом записи: телефонным качеством звука, перебиваниями, смешением русского и английского. Поэтому пилот на своих данных важнее любой таблицы.

Что сделать на этой неделе

Практический чек-лист для руководителя или операционной команды:

  1. Посчитайте текущий объём. Сколько часов аудио в месяц компания реально расшифровывает или хотела бы расшифровывать. Умножьте на $0,0045 — это базовая прикидка затрат на GPT Transcribe.
  2. Разделите сценарии на «файл» и «поток». Отметьте, где текст нужен в реальном времени, а где достаточно обработки после записи. Не платите за потоковую модель там, где хватит файловой.
  3. Соберите тестовый набор. 10–20 реальных записей разного качества, включая самые сложные: шум, акценты, термины.
  4. Прогоните пилот минимум на двух моделях. Например, GPT Transcribe и ElevenLabs Scribe v2. Сравните количество ошибок в критичных местах: цифры, имена, суммы, названия.
  5. Проверьте юридическую сторону. Куда уходят аудиофайлы, как долго хранятся, что написано в условиях обработки данных провайдера.
  6. Зафиксируйте дату пересмотра. Поставьте в календарь проверку цен и рейтинга AA-WER через три месяца.

Главный вывод прост: новые модели OpenAI не стали самыми точными на рынке, но сделали транскрибацию дешёвой и быстрой настолько, что порог входа в автоматическую расшифровку заметно снизился. Для задач с низкой ценой ошибки это повод начать внедрение уже сейчас. Для задач, где каждая ошибка дорога, — повод провести пилот и сравнить с лидерами рейтинга, а не переключаться по анонсу.

Источники

Темы журнала

Что почитать дальше