GPT Transcribe и GPT Live Transcribe: когда новые модели OpenAI выгоднее конкурентов, а когда нет
Компания, которая расшифровывает звонки, интервью или совещания, теперь может делать это через новые модели OpenAI: GPT Transcribe для аудиофайлов и GPT Live Transcribe для потокового звука в реальном времени. Одновременно OpenAI снизила цену: минута обработки файла стоит $0,0045, минута потоковой расшифровки — $0,017. Для бизнеса это означает конкретный вопрос: стоит ли переносить транскрибацию на новые модели, или конкуренты с более низким уровнем ошибок всё ещё выгоднее. Ответ зависит не от громкости анонса, а от трёх цифр: точности (WER), скорости и цены за минуту. Ниже — разбор этих цифр и рабочий метод выбора.
Источник: OpenAI News: Introducing GPT Transcribe and GPT Live Transcribe
Что именно выпустила OpenAI
OpenAI представила две модели распознавания речи, доступные через API.
GPT Transcribe работает с готовыми аудиофайлами. По данным компании, она обрабатывает запись примерно в 34 раза быстрее реального времени: часовое совещание расшифровывается примерно за две минуты машинной работы. Это важно для архивов звонков, подкастов, записей встреч — всего, что накапливается пачками.
GPT Live Transcribe оптимизирована для потоковой расшифровки с минимальной задержкой — то есть для сценариев, где текст нужен прямо во время речи: живые субтитры, голосовые ассистенты, расшифровка совещания на ходу.
Обе модели умеют учитывать текстовый контекст и заданные ключевые слова — например, можно заранее передать список названий продуктов или фамилий, чтобы модель не искажала их в расшифровке. Поддерживается мультиязычный ввод.
Почему это меняет экономику транскрибации
Цена — главная часть релиза. Минута обработки файла через GPT Transcribe стоит $0,0045. Для прикидки: 100 часов записей в месяц — это 6000 минут, то есть около $27. Для большинства компаний это сумма, которая не требует отдельного согласования бюджета, и транскрибация перестаёт быть «дорогой функцией», которую включают только для избранных записей.
Потоковая GPT Live Transcribe стоит $0,017 за минуту — почти в четыре раза дороже. Это нормальная рыночная логика: низкая задержка требует больше вычислений. Но для бизнеса это означает, что «живую» расшифровку нужно включать осознанно: если текст нужен не в реальном времени, а через час после встречи, дешевле сохранить файл и прогнать его через GPT Transcribe.
Второй экономический эффект — скорость. Обработка в 34 раза быстрее реального времени означает, что ночной архив записей контакт-центра можно расшифровать до утра без очередей и без резервирования мощностей.
Что показывают независимые замеры
По данным тестов Artificial Analysis на бенчмарке AA-WER, GPT Transcribe показывает уровень ошибок в словах (WER) 3,3%. Это на 0,7 процентного пункта лучше, чем у предшественницы — GPT-4o Transcribe. Прогресс есть, но лидером рынка новая модель не стала.
Текущий рейтинг AA-WER выглядит так:
| Модель | WER (доля ошибок в словах) | Что это значит для бизнеса |
|---|---|---|
| Fun-Realtime-ASR-Preview (Alibaba) | 1,7% | Лучшая точность, но нужно проверять доступность и условия API |
| ElevenLabs Scribe v2 | 2,2% | Сильная точность у профильного аудио-вендора |
| MAI-Transcribe-1.5 | 2,4% | Конкурент в верхней части рейтинга |
| Mistral Voxtral Small | 2,8% | Европейский вариант, интересен с точки зрения юрисдикции |
| Gemini 3.1 Pro | 2,8% | Вариант внутри экосистемы Google |
| GPT Transcribe (OpenAI) | 3,3% | Не лидер по точности, но низкая цена и высокая скорость |
Разница между 2,2% и 3,3% выглядит небольшой, но на практике это заметно: на часовой записи речь идёт о десятках дополнительных ошибок. Если расшифровка идёт напрямую клиенту, в юридические документы или в медицинские карты — эта разница критична. Если текст нужен для внутреннего поиска по архиву или черновой выжимки совещания — разница почти не ощущается, а цена и скорость выходят на первый план.
Важная оговорка: бенчмарки — это снимок на дату теста. Рейтинги обновляются, модели переобучаются, поэтому перед внедрением стоит свериться с актуальной версией таблицы Artificial Analysis и прогнать собственный тест на своих записях.
Как выбрать модель без веры в анонсы
Практический метод сводится к четырём шагам, и ни один не требует глубокой технической экспертизы.
Шаг 1. Определите сценарий: файл или поток. Если текст нужен после записи — это файловый сегмент, где конкурируют GPT Transcribe, Scribe v2, Voxtral и другие. Если текст нужен во время речи — сегмент потоковый, и там сравнивать нужно GPT Live Transcribe с другими решениями реального времени, учитывая её цену $0,017 за минуту.
Шаг 2. Посчитайте стоимость ошибки, а не только стоимость минуты. Ошибка в расшифровке внутреннего совещания стоит ноль рублей. Ошибка в расшифровке клиентского звонка, которая попадёт в претензию или договор, стоит дорого. Чем выше цена ошибки, тем сильнее аргумент в пользу модели с меньшим WER, даже если минута дороже.
Шаг 3. Прогоните пилот на своих данных. Возьмите 10–20 типичных записей: с шумом, акцентами, профессиональной лексикой, несколькими говорящими. Отправьте их в две-три модели и сравните результат глазами. Общий бенчмарк не знает, как звучат ваши менеджеры и ваши термины.
Шаг 4. Проверьте функцию ключевых слов. Обе новые модели OpenAI умеют учитывать заданный словарь. Если в ваших записях постоянно звучат названия продуктов, ФИО или отраслевые термины, эта функция может сократить ошибки сильнее, чем разница в WER между моделями. Проверьте её в пилоте отдельно.
Где ограничения и риски
Первый риск — доступ и оплата. API OpenAI для российских компаний означает привычный набор вопросов: способ оплаты, стабильность доступа, риск блокировки аккаунта. Если процесс транскрибации станет критичным для бизнеса, зависимость от одного зарубежного провайдера нужно закладывать в архитектуру заранее — например, через слой абстракции, позволяющий переключить модель.
Второй риск — данные. Записи звонков и совещаний часто содержат персональные данные и коммерческую тайну. Перед отправкой аудио в любой внешний API нужно понять, какие условия обработки и хранения данных принимает компания, и согласовать это с юристом.
Третий риск — устаревание цифр. Цены и бенчмарки в этой статье приведены на момент публикации. OpenAI уже один раз снизила тарифы вместе с релизом; конкуренты отвечают тем же. Решение, принятое по сегодняшней таблице, стоит пересматривать раз в квартал.
Четвёртое ограничение: WER — усреднённая метрика. Модель с лучшим средним показателем может хуже справляться именно с вашим типом записи: телефонным качеством звука, перебиваниями, смешением русского и английского. Поэтому пилот на своих данных важнее любой таблицы.
Что сделать на этой неделе
Практический чек-лист для руководителя или операционной команды:
- Посчитайте текущий объём. Сколько часов аудио в месяц компания реально расшифровывает или хотела бы расшифровывать. Умножьте на $0,0045 — это базовая прикидка затрат на GPT Transcribe.
- Разделите сценарии на «файл» и «поток». Отметьте, где текст нужен в реальном времени, а где достаточно обработки после записи. Не платите за потоковую модель там, где хватит файловой.
- Соберите тестовый набор. 10–20 реальных записей разного качества, включая самые сложные: шум, акценты, термины.
- Прогоните пилот минимум на двух моделях. Например, GPT Transcribe и ElevenLabs Scribe v2. Сравните количество ошибок в критичных местах: цифры, имена, суммы, названия.
- Проверьте юридическую сторону. Куда уходят аудиофайлы, как долго хранятся, что написано в условиях обработки данных провайдера.
- Зафиксируйте дату пересмотра. Поставьте в календарь проверку цен и рейтинга AA-WER через три месяца.
Главный вывод прост: новые модели OpenAI не стали самыми точными на рынке, но сделали транскрибацию дешёвой и быстрой настолько, что порог входа в автоматическую расшифровку заметно снизился. Для задач с низкой ценой ошибки это повод начать внедрение уже сейчас. Для задач, где каждая ошибка дорога, — повод провести пилот и сравнить с лидерами рейтинга, а не переключаться по анонсу.
Источники
- OpenAI News: Introducing GPT Transcribe and GPT Live Transcribe
- OpenAI API Docs: Speech to text
- Artificial Analysis: Speech to Text Leaderboard
- ElevenLabs Scribe v2 announcement
- Mistral Voxtral Small announcement
Темы журнала
Что почитать дальше
- GPT‑5.6 от OpenAI: новые модели Sol, Terra, Luna, режим Ultra и trusted access
- OpenAI Presence вместо SaaS: чек-лист рисков и экономии в 2026
- Биоинформатика: когда данных больше, чем может обработать команда
- Где есть бензин в июле 2026: карты Т-Банка и Яндекса для поиска топлива
- Где заправиться: 7 приложений для поиска бензина в реальном времени в 2026