Перейти к основному содержимому
Онлайн-транскрибация аудио и видео

Whisper-транскрибация: локальная модель и онлайн-альтернатива

Качество зависит от исходной записи. Язык определяется автоматически. Окружение настраивать незачем.

Попробуйте прямо сейчас 30 минут бесплатно, карта не нужна*
Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Запрос «whisper транскрибация» обычно приводит к инструкциям: поставить Python, собрать whisper.cpp или faster-whisper, найти видеокарту с достаточным объёмом VRAM, подружить всё это с ffmpeg. EdWord — онлайн-альтернатива локальному запуску: обработка идёт на сервере через внешнего STT-провайдера, а конкретная модель зависит от выбранного режима. От пользователя нужен только поддерживаемый файл или ссылка.

  • Качество зависит от записи
  • Автоопределение языка
  • TXT, DOCX, SRT, VTT
  • Таймкоды реплик

Срок зависит от длительности и нагрузки. Качество зависит от записи. Язык определяется автоматически. На выходе — текст с опциональными таймкодами и экспорт в TXT, DOCX, SRT или VTT: субтитровые форматы генерируются сразу, дописывать конвертацию скриптами не придётся.

Локальный запуск Whisper подходит, когда важен собственный контур и есть ресурсы для поддержки модели. Онлайн-сервис снимает настройку с пользователя, но передаёт запись внешнему STT-провайдеру; срок обработки зависит от длительности и нагрузки. EdWord принимает на сайте записи до 3 часов и 2 ГБ в поддерживаемых форматах, а YouTube, VK Видео и Rutube обрабатывает по ссылке.

Аккаунту может быть доступно до 30 стартовых минут, привязка карты для этого не требуется. Дальше пакеты: 390 ₽ за час, 990 ₽ за три, 2 990 ₽ за десять, 12 900 ₽ за пятьдесят. Купленные минуты остаются на балансе бессрочно. Для быстрых задач есть Telegram-бот @mywhisperedbot: кинули файл или голосовое в чат — получили текст, терминал так и остался закрытым.

Как перевести в текст

1

Загрузите файл

Перетащите файл на сайт или отправьте в Telegram-бот @mywhisperedbot

2

Нейросеть распознаёт речь

Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы

3

Скачайте текст

Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете

Что такое Whisper и почему вокруг неё столько сервисов

Whisper — модель распознавания речи, которую OpenAI выпустила в 2022 году с открытым исходным кодом. Обучение на сотнях тысяч часов разноязычных записей дало ей главное свойство: устойчивость к шуму, акцентам и спонтанной разговорной речи. Модель сама определяет язык дорожки, умеет расставлять таймкоды и существует в нескольких размерах — от компактной tiny до самой точной large-v3; сообщество добавило ускоренные сборки faster-whisper и whisper.cpp. Открытая лицензия объясняет обилие продуктов со словом «Whisper» в названии: любой разработчик может развернуть модель у себя и продавать доступ к ней. Поэтому запрос «whisper ai транскрибация» приводит к десяткам разных сервисов — OpenAI распространяет модель кодом и через API, а надстройки вокруг неё строят сторонние команды.

Что понадобилось бы для локального запуска

Типичный чек-лист самостоятельной сборки: Python и виртуальное окружение, ffmpeg в PATH, веса модели на несколько гигабайт, для комфортной скорости — видеокарта с 8-10 ГБ VRAM, плюс вечер на отладку зависимостей. После этого каждый час аудио на CPU обрабатывается дольше самого аудио. Срок зависит от длительности и нагрузки.

Выход: таймкоды, субтитры, документы, история

Веб-расшифровка отдаётся текстом с опциональными таймкодами — по ним удобно сверять спорные фрагменты с исходной записью. Экспорт доступен в четырёх форматах: TXT для заметок и дальнейшей обработки, DOCX для документов, SRT и VTT для субтитров. Веб-задачи сохраняются в истории личного кабинета: можно вернуться к старой расшифровке, скопировать текст или скачать файл повторно. Telegram-бот @mywhisperedbot использует тот же баланс, но присылает текст только в чат.

Выберите пакет

Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.

1 час
390 ₽
6.50 ₽/мин
3 часа
990 ₽
5.50 ₽/мин
−15%
Популярный
10 часов
2 990 ₽
4.98 ₽/мин
−23%
50 часов
12 900 ₽
4.30 ₽/мин
−34%

Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot

Частые вопросы

EdWord использует оригинальный Whisper от OpenAI?

Не во всех режимах. Конкретная модель зависит от выбранных настроек: режим с таймкодами может использовать whisper-1, а основной режим — другую модель распознавания речи. Качество стоит проверять на собственной записи.

Whisper открытый и бесплатный — за что тогда платить?

Вы платите за вычисления и сэкономленное время. Локальный запуск требует GPU с большим объёмом памяти либо многочасовой обработки на CPU, плюс настройку Python-окружения и ffmpeg. Срок зависит от длительности и нагрузки. Аккаунту может быть доступно до 30 стартовых минут — можно сравнить результат со своей локальной сборкой.

Какие форматы и лимиты у загрузки?

Сайт принимает файлы до 3 часов и 2 ГБ: MP3, WAV, M4A, FLAC, OGG, OGA, OPUS, WebM, MP4, AVI, MOV и MKV. По ссылке поддерживаются публичные YouTube, VK Видео, Rutube и Vimeo.

Можно ли сразу получить субтитры SRT или VTT?

Да, оба формата доступны в экспорте наряду с TXT и DOCX. Расшифровка с таймкодами превращается в готовый файл субтитров без промежуточных конвертеров — удобно для роликов, курсов и публикации видео с текстовой дорожкой.

Насколько хорошо распознаётся русская речь?

Русский — один из поддерживаемых сценариев сервиса. Качество зависит от записи. Термины, редкие фамилии и аббревиатуры стоит проверять при вычитке независимо от выбранной модели.

Whisper и Whisper AI — это одно и то же?

Да, «whisper ai» — распространённое написание названия той же модели OpenAI; отдельного продукта с таким именем у OpenAI нет. Сервисы с похожими названиями — сторонние надстройки над открытой моделью или её API. Выбирая между ними, смотрите на практичное: лимиты на файл, форматы экспорта, цену часа и то, куда попадает ваша запись.

Какая версия Whisper самая точная?

Из открытых весов самой точной считается large-v3; варианты tiny, base и small заметно быстрее и легче, за что расплачиваются качеством распознавания. На CPU large-версия обрабатывает час записи в разы дольше самой записи, поэтому локально её запускают на GPU. В облачных сервисах версию выбирает провайдер: у EdWord модель зависит от режима обработки, и результат в любом случае стоит вычитать.

Сколько стоит расшифровка в EdWord?

Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.

Какая точность распознавания?

Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.

Безопасно ли загружать файлы в EdWord?

Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.

Есть ли ограничения по длительности или размеру?

Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.

Можно попробовать бесплатно?

Если аккаунту доступен стартовый лимит, после регистрации появится до 30 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.

Загрузите запись прямо здесь

Текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Новым пользователям — 30 бесплатных минут, карта не нужна.*

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.