Перейти к основному содержимому
Онлайн-транскрибация аудио и видео

Распознавание речи в текст: технология и практика

Автоматическое распознавание превращает живую речь в текст: диктовка в браузере, голосовые в Telegram, записи разговоров.

Попробуйте прямо сейчас До 60 мин — если доступен стартовый лимит
Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Распознавание речи — это работа нейросети, которая слушает звуковую волну и предсказывает, какие слова в ней произнесены. Так речь из аудио превращается в текст: надиктованная заметка, войс, голос из часовой записи созвона. Современные модели обучены на сотнях тысяч часов речи, поэтому справляются с разными голосами, темпом, акцентами и бытовым шумом. Качество зависит от записи.

  • Качество зависит от записи
  • Автоопределение языка
  • TXT, DOCX, SRT, VTT
  • Таймкоды реплик

Модель воспринимает речь целостно, с контекстом. Слово «замок» она запишет правильно, потому что учитывает соседние фразы; окончания и пунктуацию расставит по смыслу предложения. Язык определяется автоматически. Расшифровка всегда выполняется на языке оригинала: французская речь станет французским текстом.

Живую речь EdWord принимает в нескольких видах. Диктовка — через EdWord Mini на edword.ru/mini: наговорили мысль в микрофон браузера, остановили запись и дождались расшифровки; инструмент устанавливается на компьютер как PWA. Голосовые сообщения — через Telegram-бот @mywhisperedbot, который расшифровывает войсы, кружки и аудиофайлы, в том числе в групповых чатах. Готовые записи — файлом на сайте: аудио или видео до 2 ГБ, голос из которых переводится в текст онлайн без установки программ. Срок зависит от длительности и нагрузки.

Результат распознавания приходит в личный кабинет: текст с опциональными таймкодами, копирование одним кликом, выгрузка в TXT, DOCX, SRT или VTT. Проверить технологию на собственном голосе можно бесплатно — для аккаунта может быть доступен стартовый лимит до 60 минут без привязки карты, дальше действуют пакеты от 390 ₽ за час с бессрочными минутами. Часа хватит, чтобы прогнать через модель и диктовку, и пару голосовых, и запись рабочего созвона.

Как перевести в текст

1

Загрузите файл

Перетащите файл на сайт или отправьте в Telegram-бот @mywhisperedbot

2

Нейросеть распознаёт речь

Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы

3

Скачайте текст

Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете

Что влияет на качество распознавания

Главный фактор — соотношение голоса и шума. Речь, записанная близко к микрофону в тихой комнате, распознаётся почти без ошибок; гулкий зал, улица и работающий телевизор добавляют промахи. Второй фактор — манера говорящих: чёткая размеренная речь читается лучше скороговорки, а одновременный разговор двух людей — самая сложная ситуация для любой модели. Третий — лексика: редкие фамилии, локальные аббревиатуры и профессиональный жаргон модель может записать на слух. Практический вывод: пишите звук ближе к говорящему, а после распознавания пробегитесь по именам и цифрам — остальное EdWord сделает сам.

Три сценария работы с живой речью

Диктовка: EdWord Mini превращает браузер в голосовой ввод — наговорили абзац, скопировали, вставили в документ. Голосовые: бот @mywhisperedbot принимает войсы и после обработки возвращает текст в Telegram. Записи: разговор с клиентом, выступление или диктофонная заметка загружаются на сайт файлом до 3 часов и 2 ГБ и возвращаются текстом с опциональными таймкодами. Во всех сценариях расходуется один общий баланс минут.

Перевод речи в текст: чем отличается от диктовки

Перевод речи в текст в EdWord работает с готовыми записями, а диктовка в телефоне — с живым голосом в моменте. Разница практическая: диктовке нужно, чтобы вы говорили медленно и следили за экраном, а сервису всё равно, когда и как записан файл — лекция с задней парты, планёрка в переговорке, интервью в кафе. Загрузите запись целиком, и модель сама расставит пунктуацию и разобьёт поток речи на абзацы. Для быстрых голосовых заметок есть страница записи /mini: наговорите мысль с телефона, текст придёт в кабинет.

Выберите пакет

Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.

1 час
390 ₽
6.50 ₽/мин
3 часа
990 ₽
5.50 ₽/мин
−15%
Популярный
10 часов
2 990 ₽
4.98 ₽/мин
−23%
50 часов
12 900 ₽
4.30 ₽/мин
−34%

Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot

Частые вопросы

Как нейросеть распознаёт речь?

Модель анализирует звуковую волну и предсказывает наиболее вероятную последовательность слов, опираясь на контекст фразы. В EdWord эта работа выполняется внешней моделью распознавания речи; конкретная модель зависит от выбранного режима.

Какая точность у распознавания речи?

Качество зависит от записи. Точность падает на сильном фоновом шуме, при наложении голосов и очень тихой речи. Имена собственные, аббревиатуры и узкие термины стоит проверять — это слабое место любой системы распознавания.

Распознаётся ли речь с акцентом или диалектом?

Акцент и региональное произношение могут влиять на качество. Проверьте результат на собственной записи и сверьте по таймкодам имена, термины и фрагменты, в которых речь звучит неразборчиво.

Как надиктовать текст голосом?

Для диктовки есть EdWord Mini на edword.ru/mini: откройте страницу в браузере, разрешите доступ к микрофону, наговорите текст и остановите запись. После обработки результат появится в интерфейсе. Mini можно установить как PWA и запускать с ярлыка.

Речь на каких языках распознаёт EdWord?

Язык определяется автоматически. Выбирать язык в настройках нет нужды — модель сама определяет его по звучанию. Текст выдаётся на языке говорящего; смешанную двуязычную речь стоит потом просмотреть внимательнее.

Как перевести голос из аудио в текст онлайн?

Загрузите запись в кабинете на edword.ru — подойдёт файл с диктофона, экспортированное голосовое или дорожка созвона. После обработки текст появится в истории: его можно прочитать, скопировать в один клик или выгрузить в TXT и DOCX. Короткий войс быстрее переслать боту @mywhisperedbot.

Распознаётся ли речь из видео?

Да. Видеофайл загружается так же, как аудио: звуковая дорожка отделяется на стороне сервиса, распознаётся и возвращается текстом. Для роликов, опубликованных на YouTube, VK Видео, Rutube или Vimeo, достаточно вставить ссылку — скачивать видео на устройство не нужно.

Сколько стоит расшифровка в EdWord?

Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.

Какая точность распознавания?

Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.

Безопасно ли загружать файлы в EdWord?

Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.

Есть ли ограничения по длительности или размеру?

Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.

Можно попробовать бесплатно?

Если аккаунту доступен стартовый лимит, после регистрации появится до 60 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.

Попробуйте EdWord прямо сейчас

Загрузите файл или перешлите запись боту — текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Регистрация через Telegram или Яндекс, без карты.

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.