Перейти к основному содержимому

Whisper: как устроена нейросеть распознавания речи от OpenAI

Whisper — нейросеть OpenAI, которая переводит речь из аудио в текст. С момента релиза в 2022 году её используют в сервисах расшифровки, плагинах для монтажа видео и системах субтитров. Разберём, как модель устроена внутри, почему качество меняется от записи к записи и как пользоваться облачной транскрибацией без видеокарты и командной строки.

Схема распознавания речи Whisper из аудиоволны в текст
Модель распознавания речи превращает акустический сигнал в текст, но итог всё равно нужно вычитать.
Коротко

Whisper обучили на большом массиве речи из интернета, но это не даёт единого процента точности для всех языков и записей. В EdWord можно проверить облачную транскрибацию на собственном файле: для аккаунта может быть доступен стартовый лимит.

Переведите запись в текст прямо здесь

Загрузите аудио или видео — вернётся текст с таймкодами и экспортом в TXT, DOCX, SRT или VTT. Файл до 2 ГБ и до 3 часов, бесплатный старт без карты.

Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Запись встречи загружайте здесь, на сайте: Telegram-бот принимает файлы до 20 МБ, а часовая запись весит больше.

Что такое Whisper

Whisper — открытая модель автоматического распознавания речи (ASR, automatic speech recognition), которую OpenAI опубликовала в сентябре 2022 года вместе с кодом и весами. Лицензия MIT позволяет использовать её где угодно, включая коммерческие продукты. Отсюда и взрыв популярности: любой разработчик может взять готовую модель и встроить речь-в-текст в своё приложение.

Модель мультиязычная: в обучающем корпусе 97 языков, так что на практике Whisper понимает речь примерно на сотне языков. Она сама определяет язык записи и расставляет пунктуацию — точки, запятые, заглавные буквы появляются в тексте автоматически. Для сравнения: классические ASR-системы прошлого поколения выдавали сплошной поток строчных слов, который потом приходилось размечать отдельным алгоритмом.

Whisper — модель многозадачная. Внутри одной сети упакованы четыре задачи: транскрибация речи на исходном языке, перевод речи на английский, определение языка и детекция голоса (VAD — понимание, есть ли в фрагменте речь вообще). Задача выбирается специальными токенами вроде <|transcribe|> и <|translate|>, поэтому испанский подкаст можно получить английским текстом за один проход, без промежуточного перевода.

Слово «whisper» переводится как «шёпот» (в рунете модель часто пишут кириллицей — «Виспер»). Ирония в том, что именно тихую и невнятную речь модель разбирает заметно лучше предшественников — сказалась манера обучения, о которой ниже.

680 000 часов аудио: на чём обучали модель

Главный секрет Whisper — масштаб и «грязнота» обучающих данных. OpenAI собрала из интернета 680 000 часов аудио с парными субтитрами: подкасты, лекции, интервью, ролики. Это примерно 77 лет непрерывного звучания. Около 117 000 часов — записи на языках, отличных от английского, и распределение там неравномерное: свыше тысячи часов набралось лишь у полутора десятков языков, а порядка 10 000 часов — только у пяти. Русский входит в эту пятёрку, поэтому по качеству распознавания он держится рядом с английским.

Академические ASR-модели до этого учились на вылизанных корпусах: студийный звук, дикторская речь, выверенная разметка. Такие модели показывали красивые цифры на тестах и разваливались на живых записях с эхом, перебиваниями и уличным шумом. Whisper учился сразу на «диком» аудио, поэтому реальный созвон в Zoom или голосовое из машины для него — привычная среда, близкая к обучающей выборке.

Обучение «со слабым надзором» (weakly supervised) означает, что субтитры из интернета никто вручную не выверял. Часть разметки была неточной, и модель научилась извлекать сигнал из шумных данных. Побочный эффект — устойчивость к акцентам, диалектам и специфической лексике, которой в стерильных корпусах попросту нет.

Как звук превращается в текст

Внутри Whisper — трансформер типа «энкодер-декодер», та же архитектура, что у переводчиков и языковых моделей. Путь от звука до текста выглядит так:

  1. Нарезка. Аудио режется на фрагменты по 30 секунд. Длинная запись обрабатывается окнами, результаты сшиваются.
  2. Спектрограмма. Каждый фрагмент превращается в лог-мел-спектрограмму — по сути, картинку, где по горизонтали время, по вертикали частоты, а яркость показывает энергию звука. Нейросеть «смотрит» на звук как на изображение.
  3. Энкодер. Стек трансформер-блоков сжимает спектрограмму в набор векторов — внутреннее представление того, что было сказано.
  4. Декодер. Вторая половина сети генерирует текст токен за токеном, опираясь на векторы энкодера и уже напечатанные слова. Работает как автодополнение: предсказывает следующее слово с учётом контекста.

Контекстность декодера — причина, по которой Whisper грамотно пишет «прийти» вместо «придти» и восстанавливает смысл в местах, где звук смазан: модель опирается на языковую статистику, накопленную за время обучения. Подробнее о том, чем нейросетевой перевод аудио в текст отличается от старых движков распознавания, мы разбирали в отдельном материале.

Насколько хорошо Whisper понимает русский

Русский входит в группу языков, на которых Whisper показывает лучшие результаты — вместе с английским, испанским, немецким и итальянским. Причина простая: русскоязычного аудио в обучающей выборке было много.

Качество распознавания измеряют метрикой WER (word error rate) — долей заменённых, пропущенных и добавленных слов. Значение зависит от версии модели, языка, набора тестовых записей и методики подсчёта, поэтому без публичного benchmark нельзя переносить один процент на все файлы.

На практике модель уверенно разбирает:

  • беглую разговорную речь со словами-паразитами и оборванными фразами;
  • региональные акценты и речь людей, для которых русский второй язык;
  • профессиональную лексику — медицинскую, юридическую, айтишную;
  • записи с умеренным фоновым шумом: кафе, улица, клавиатура на созвоне.

Точность падает на плохом сигнале: перегруженный микрофон, сильная реверберация, несколько людей говорят одновременно. Технология распознавания речи в текст любит запись с расстояния 20–30 см от рта — это дешевле любых улучшений на этапе обработки.

Совет

Смешанная речь — рабочий сценарий для Whisper. Фраза «закинь фичу в бэклог, обсудим на дейли» распознаётся корректно: англицизмы внутри русского предложения модель видела в обучении тысячи раз.

Семейство моделей: от tiny до large

Whisper выпущен в нескольких размерах. Чем больше параметров, тем выше точность и тем медленнее обработка на том же железе.

Модель Параметры Память Скорость Русский язык
tiny 39 млн ~1 ГБ Очень быстро Слабо, много ошибок
base 74 млн ~1 ГБ Быстро Терпимо для черновика
small 244 млн ~2 ГБ Средне Хорошо на чистом звуке
medium 769 млн ~5 ГБ Медленно на CPU Уверенно
large 1,55 млрд ~10 ГБ Нужна GPU Максимум качества

Для русского языка разница между tiny и large драматична. Маленькие модели натренированы преимущественно на английском, и русская речь у них рассыпается на бессвязные слова. Серьёзная работа с русским аудио начинается с medium, а комфортное качество дают large-версии — именно модели этого класса крутятся под капотом ИИ-транскрибации EdWord.

Large-версия тоже развивалась: после исходной модели OpenAI выпустила large-v2, затем large-v3 с дополнительным дообучением, а следом облегчённую large-v3-turbo — она жертвует крохами качества ради кратного ускорения. Каждая итерация подтягивала качество на «неанглийских» языках, и русский выигрывал от этого заметнее многих. Параллельно сообщество ускоряло и расширяло модель: whisper.cpp и faster-whisper переписали вычисления так, что та же сеть работает в разы шустрее и влезает в более скромное железо, Whisper JAX распараллелил обработку длинных файлов на серверных ускорителях, а WhisperX добавил поверх точные таймкоды на каждое слово и связку с диаризацией — разметкой, кто из говорящих произнёс фразу.

Распознавание речи Whisper для разных источников звука и условий записи
Качество зависит от языка, шума, микрофона и того, говорят ли участники одновременно.

Слабые места Whisper

Модель сильная, но у неё есть характерные болячки, о которых честно предупредить:

  • Галлюцинации на тишине. Декодер обязан что-то генерировать, поэтому на длинных паузах и музыкальных вставках модель иногда «дописывает» фразы, которых никто не произносил. У русскоязычных записей набор известных фраз-подписей узнаваем: «Субтитры сделал DimaTorzok», «Редактор субтитров А.Синецкая», «Корректор А.Егорова», «Продолжение следует…», «Спасибо за просмотр!». Все они — артефакт обучения на субтитрах из интернета: модель запомнила титры, которыми люди подписывали свои переводы, и воспроизводит их там, где сказать нечего.
  • Зацикливание. На очень плохом звуке декодер может застрять и повторять одну фразу несколько раз подряд. При локальном запуске это лечат подбором параметров: поднимают temperature, отключают опору на предыдущий текст флагом --condition_on_previous_text False или подсказывают контекст через --initial_prompt — затравку с нужными терминами и именами.
  • Числа и имена. «Двадцать пять тысяч триста» модель может записать словами, цифрами или смесью. Редкие фамилии и названия компаний пишутся на слух.
  • Спикеры не размечаются. Из коробки Whisper выдаёт единый поток текста без указания, кто говорит. Разделение по голосам — отдельная задача, которую решают другие инструменты.
  • Таймкоды приблизительные. Метки времени привязаны к фразам и могут плавать на доли секунды — для субтитров хватает, для монтажа по миллисекундам стоит перепроверять.

Хорошая новость: большинство болячек лечится на уровне сервиса. Продакшен-системы поверх Whisper режут записи по паузам, фильтруют пустые сегменты, ловят зацикливания и склеивают куски так, чтобы фантомные фразы отсеивались до того, как попадут в итоговый текст. Пользователь этого слоя даже не видит — просто получает более чистую расшифровку, чем выдала бы «голая» модель из репозитория.

Вывод для практики: расшифровку важного интервью или юридической консультации стоит пробежать глазами, особенно места с числами, именами и датами. Пять минут вычитки против часа ручного набора — всё ещё огромный выигрыш.

Для чего используют Whisper

Технология одна, а сценариев вокруг неё десятки. Самые частые задачи, под которые берут Whisper и сервисы на его основе:

  • Субтитры к видео. Модель выдаёт текст с таймкодами, из которого собирается готовый SRT- или VTT-файл для YouTube, VK Видео и монтажных программ.
  • Интервью и подкасты. Журналисты и блогеры получают текстовую версию беседы за минуты и выбирают цитаты поиском по тексту вместо перемотки записи.
  • Созвоны и переговоры. Расшифровка рабочего звонка фиксирует договорённости, задачи и ответственных — из неё быстро собирается протокол встречи.
  • Лекции и вебинары. Студенты превращают запись пары в конспект, по которому удобно готовиться к экзамену и искать нужную тему.
  • Голосовые сообщения. Длинные войсы в Telegram читаются текстом за секунды — этот сценарий целиком закрывает бот.
  • Звонки в поддержку. Компании расшифровывают обращения клиентов, чтобы анализировать типовые проблемы и контролировать качество ответов операторов.
  • Изучение языков. Двойные субтитры к иностранному ролику — оригинал плюс перевод — помогают разбирать живую речь на слух.

Запуск у себя или через сервис: сравнение

Whisper открыт, поэтому путей три: развернуть модель на своём железе, дёргать облачный API OpenAI из кода или загрузить файл в готовый сервис. Считаем честно.

Локальный запуск начинается с установки: pip install openai-whisper плюс ffmpeg для работы с медиафайлами, либо сборка whisper.cpp / faster-whisper без Python-окружения. Дальше потребуются видеокарта от 8–10 ГБ VRAM для large-модели (на процессоре часовая запись может обрабатываться несколько часов), место под веса и терпение на настройку зависимостей. Плюс — полный контроль: аудио остаётся на вашей машине, платить за минуты никому нужно.

Облачный API OpenAI снимает вопрос железа: отправляете файл запросом, получаете текст. Тариф — около $0,006 за минуту записи, то есть примерно $0,36 за час. Нюанс для России: оплата принимается зарубежной картой, поэтому напрямую из РФ этот путь затруднён и востребован в основном у разработчиков с валютными счетами.

Критерий Whisper у себя API OpenAI EdWord
Старт Часы на установку Ключ API и код 2 минуты, браузер
Железо GPU для large Не нужно Любой ноутбук, телефон
Час записи От минут до часов ≈$0,36, валютная карта зависит от записи и нагрузки
Экспорт Скриптами вручную Текст и JSON в коде TXT, DOCX, SRT, VTT кнопкой

Локальная установка оправдана, когда записей десятки часов ежедневно, есть железо и инженер, который будет это поддерживать. Для остальных сценариев — совещание раз в неделю, лекции в сессию, интервью для статьи — сервис закрывает задачу быстрее, чем вы успеете скачать веса модели.

Расшифровка через EdWord: пошагово

EdWord выполняет распознавание на сервере; конкретная модель зависит от выбранного режима. Передать запись можно тремя способами.

Способ 1. Через сайт

  1. Откройте edword.ru и войдите через Telegram или Яндекс — для аккаунта может быть доступен стартовый лимит, карта не нужна.
  2. Перетащите файл в окно загрузки. Принимаются MP3, WAV, M4A, FLAC, OGG, WebM и видео MP4, AVI, MOV, MKV — до 2 ГБ.
  3. Дождитесь обработки: срок зависит от длительности записи, выбранного режима и текущей нагрузки; язык определяется автоматически.
  4. Заберите результат — скопируйте в один клик или скачайте в нужном формате. Расшифровка сохранится в истории личного кабинета.

Способ 2. Через Telegram-бот

Отправьте голосовое, кружок, аудио- или видеофайл боту @mywhisperedbot — текст придёт ответным сообщением. Бот живёт и в групповых чатах: добавьте его в рабочую группу, и каждое голосовое будет автоматически превращаться в текст под исходным сообщением.

Способ 3. По ссылке

Вставьте ссылку на видео с YouTube, VK Видео, Rutube и других площадок — сервис сам скачает ролик, вытащит дорожку и отдаст расшифровку. Удобно для лекций и вебинаров, которые лень выкачивать вручную.

Проверьте Whisper на своей записи
Аккаунту может быть доступен стартовый лимит без карты
Загрузить аудио на EdWord

Что получается на выходе

Результат — связный текст с пунктуацией, по желанию с таймкодами. Форматы экспорта под разные задачи:

  • TXT — чистый текст для заметок и поиска по записи;
  • DOCX — документ для правок в Word и согласований;
  • SRT и VTT — готовые субтитры для YouTube, монтажных программ и плееров.

Из такого транскрипта легко собрать конспект лекции, протокол встречи или цитаты для статьи: текст структурирован по фразам, а таймкоды позволяют мгновенно вернуться к нужному месту записи. Для диктовки коротких заметок голосом есть отдельный инструмент — EdWord Mini работает прямо в браузере и ставится на компьютер как PWA-приложение.

Сколько стоит распознавание

Стартовый баланс может быть доступен, если доступен аккаунту. Дальше — разовые пакеты: час за 390 ₽, три часа за 990 ₽, десять часов за 2 990 ₽, пятьдесят — за 12 900 ₽. Командам подойдут пакеты 50 часов за 9 900 ₽ и 100 часов за 17 900 ₽. Подписки нет, купленные минуты лежат на балансе без срока сгорания — купили десять часов в июле, спокойно тратите их до зимы.

Итог

Whisper сделал качественное распознавание речи доступнее как открытая модель, которую можно запустить локально при наличии подходящего железа и навыков настройки. EdWord решает другую задачу: принимает файл в браузере или Telegram и выполняет обработку на сервере. Аккаунту может быть доступен стартовый лимит для проверки на собственных записях.

Проверка качества распознавания речи Whisper по шуму и вычитке текста
Сильная сторона Whisper — устойчивость на разных записях; слабая — редкие имена и шумные фрагменты.

Частые вопросы

Whisper бесплатный?

Сама модель открыта под лицензией MIT — скачать веса и запустить у себя можно бесплатно. Платите вы железом и временем: для large-версии нужна видеокарта, а установка и настройка требуют технических навыков. Сервисы вроде EdWord берут эту часть на себя; аккаунту может быть доступен стартовый лимит.

Какая точность у Whisper на русском языке?

Единого процента точности для русского языка нет: результат зависит от версии модели, тестового набора и качества звука. Сравнивайте WER на собственных записях и отдельно проверяйте имена, числа и термины.

Сколько языков распознаёт Whisper?

Whisper — мультиязычная модель, но качество различается по языкам и версиям. В EdWord язык определяется автоматически; в веб-интерфейсе также можно выбрать русский, английский, немецкий, французский или испанский.

Почему Whisper иногда выдаёт текст, которого нет в записи?

Это галлюцинации декодера: на длинной тишине или музыке модель генерирует правдоподобные, но выдуманные фразы — например, фантомные подписи авторов субтитров. Лечится обрезкой пустых кусков записи и вычиткой мест с паузами.

Умеет ли Whisper различать голоса разных людей?

Из коробки модель выдаёт единый поток текста без разметки по говорящим — разделение голосов относится к другому классу задач (диаризация) и решается отдельными инструментами. Таймкоды при этом помогают ориентироваться: по ним легко найти нужный фрагмент записи и понять контекст.

Как попробовать Whisper без установки?

Загрузите поддерживаемый файл на edword.ru (до 2 ГБ), отправьте небольшую запись до 20 МБ боту @mywhisperedbot или вставьте публичную ссылку YouTube, VK Видео, Rutube либо Vimeo. Новому аккаунту может быть доступно стартовый баланс без карты.

Работает ли Whisper из России?

Да. Модель открытая: веса скачиваются свободно, локальный запуск работает без VPN и валютных платежей. Ограничение касается облачного API OpenAI — он оплачивается зарубежной картой, поэтому напрямую из РФ затруднён. Российские сервисы на базе Whisper, включая EdWord, принимают оплату в рублях.

Умеет ли Whisper расшифровывать речь в реальном времени?

Классический Whisper обрабатывает готовую запись: аудио режется на 30-секундные окна и распознаётся целиком, поэтому живую синхронную стенограмму модель сама по себе не выдаёт. Для расшифровки «в прямом эфире» используют потоковые модели и специальные обвязки. EdWord также работает с готовыми файлами и записями длительностью до 3 часов.

Что умеет WhisperX из коробки?

WhisperX — открытая надстройка над Whisper: точные таймкоды на каждое слово за счёт выравнивания, диаризация (разметка, кто из спикеров говорит) через связку с pyannote, ускоренная пакетная обработка на базе faster-whisper и фильтрация тишины через VAD. Взамен потребуются GPU и настройка Python-окружения — это инструмент для технически подготовленных пользователей.

Какие фразы Whisper дописывает на тишине?

На паузах и музыке модель воспроизводит фразы-подписи, запомненные из субтитров: «Субтитры сделал DimaTorzok», «Редактор субтитров А.Синецкая», «Корректор А.Егорова», «Спасибо за просмотр!», «Продолжение следует…». Если такая строка встретилась в расшифровке, на записи в этом месте почти наверняка тишина или музыкальная вставка — фрагмент можно смело удалить.

Есть ли в Whisper русские голоса для озвучки?

Голосов в Whisper нет: модель решает задачу распознавания — превращает готовую речь в текст. Озвучкой занимается другой класс нейросетей, TTS (text-to-speech), и у OpenAI это отдельные модели. Русскую речь Whisper при этом распознаёт уверенно — русский входит в группу языков с наибольшим объёмом обучающих данных.

Источники

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.