Перейти к основному содержимому
Онлайн-транскрибация аудио и видео

Распознавание аудио в текст

Автоматическое распознавание речи из аудиофайлов, голосовых и записей встреч.

Попробуйте прямо сейчас До 60 мин — если доступен стартовый лимит
Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Распознать аудио в текст автоматика умеет за минуты, и первый вопрос к ней — сколько ошибок окажется в готовом тексте. Качество зависит от записи. В часовом разговоре порядка девяти тысяч слов, так что каждый процент точности — это примерно девяносто сэкономленных правок. Дальше всё решает сама запись, и на её качество вы влияете сильнее, чем кажется.

  • Качество зависит от записи
  • Автоопределение языка
  • TXT, DOCX, SRT, VTT
  • Таймкоды реплик

Результат определяют четыре фактора. Шум и эхо: гулкая переговорка или кафе на фоне съедают разборчивость быстрее всего. Расстояние до микрофона: голос в полуметре распознаётся заметно лучше, чем речь с другого конца стола. Дикция и темп: скороговорка с проглоченными окончаниями путает и людей, и модель. Редкие термины, имена и аббревиатуры: слово, которого нет в обычной речи, машина заменит созвучным.

Максимум выжимается простыми действиями. Пишите на гарнитуру или кладите телефон ближе к говорящему. Закройте окно и выключите фоновую музыку. Попросите участников говорить по очереди — одновременная речь двух человек превращается в кашу на любом сервисе. Если в разговоре много специфики, держите под рукой список терминов: после распознавания каждый быстро проверяется поиском по готовому тексту.

Оценить точность на собственной записи можно бесплатно: для аккаунта может быть доступен стартовый лимит до 60 минут без привязки карты. Загрузите файл на сайте перетаскиванием (до 2 ГБ), перешлите голосовое боту @mywhisperedbot или вставьте ссылку на ролик с YouTube, VK Видео или Rutube. Срок зависит от длительности и нагрузки. Дальше час обработки стоит от 390 ₽, купленные минуты остаются на балансе навсегда.

Как перевести в текст

1

Загрузите файл

Перетащите файл на сайт или отправьте в Telegram-бот @mywhisperedbot

2

Нейросеть распознаёт речь

Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы

3

Скачайте текст

Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете

Характеристики формата

КодекРечь из аудио передаётся в модель распознавания после подготовки файла
Битрейтзависит от исходного файла; важнее чистота речи
Макс. размер файла2 ГБ
Расширения.mp3, .m4a, .wav, .ogg, .flac
Типичное применениеГолосовые, диктофонные записи, интервью, лекции и созвоны

Чек-лист перед записью: две минуты, которые спасают точность

Пройдитесь по списку до начала встречи или интервью.

1. Микрофон в 30-50 см от основного говорящего; на групповой встрече — в центре стола. 2. Кондиционер, вентилятор и музыка выключены: равномерный гул мешает сильнее редких громких звуков. 3. Помещение с мягкой мебелью или шторами глушит эхо; пустая комната с голыми стенами его усиливает. 4. Тестовая запись на 20 секунд: прослушайте — если вы разбираете слова с первого раза, модель тоже разберёт. 5. Договоритесь о правиле «один голос в момент времени»: перебивания портят фрагмент сразу у обоих спикеров.

Эти пять пунктов дают больший прирост точности, чем любые манипуляции с форматом файла или битрейтом.

Как вычитать готовый текст без повторного прослушивания

Переслушивать запись целиком после распознавания незачем — проверяются типовые зоны риска. Пройдитесь поиском по тексту: числа и даты (модель иногда записывает их словами или путает порядок), фамилии и названия компаний (заменяются созвучными словами), профессиональные термины и аббревиатуры. Каждое сомнительное место сверяйте точечно: включите таймкоды при обработке, найдите метку рядом со спорной фразой и отмотайте оригинал ровно туда.

На часовое интервью такая точечная вычитка занимает 10-15 минут. Результат хранится в личном кабинете EdWord, поэтому править можно в несколько подходов, а финальную версию выгрузить в DOCX или TXT.

Распознать аудио в текст онлайн: с чего начать

Порядок простой. Откройте edword.ru и перетащите аудиофайл в окно загрузки — поддерживаются MP3, WAV, M4A, OGG, FLAC и видеоформаты, размер до 2 ГБ. Перед запуском решите, нужны ли метки времени: с ними спорные фразы потом сверяются с исходником за секунды. Запустите обработку и займитесь своими делами — готовый текст появится в личном кабинете, откуда его можно скопировать или скачать в TXT и DOCX, а при включённых таймкодах ещё и в SRT или VTT.

Записи, которые уже лежат в Telegram, распознаются без скачивания на компьютер: перешлите голосовое или файл до 20 МБ боту @mywhisperedbot. Для опубликованных роликов сработает третий путь — вставьте ссылку на YouTube, VK Видео или Rutube, сервис сам заберёт звук.

Выберите пакет

Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.

1 час
390 ₽
6.50 ₽/мин
3 часа
990 ₽
5.50 ₽/мин
−15%
Популярный
10 часов
2 990 ₽
4.98 ₽/мин
−23%
50 часов
12 900 ₽
4.30 ₽/мин
−34%

Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot

Частые вопросы

Как распознать аудио в текст?

Загрузите аудиофайл на сайт или отправьте небольшой файл до 20 МБ в Telegram-бот. Веб-результат сохранится в кабинете, а бот вернёт текст сообщением в Telegram.

Какие записи распознаются лучше всего?

Лучше всего обрабатываются записи, где голос звучит близко к микрофону, без громкой музыки, эха и постоянных перебиваний. Важные места удобно проверять по таймкодам.

Можно ли распознать аудио с несколькими языками?

EdWord автоматически определяет язык речи и поддерживает десятки языков. Если спикеры часто переключаются между языками, финальный текст стоит внимательнее проверить.

Подойдёт ли распознавание для юридически важного текста?

Для договоров, протоколов и других важных материалов используйте результат как черновик. После автоматического распознавания текст должен проверить человек, особенно имена и числа.

Сколько времени занимает распознавание записи?

Срок зависит от длительности и нагрузки: короткое голосовое обычно готово быстро, часовая запись обрабатывается дольше. Ждать у экрана необязательно — веб-результат сохранится в истории кабинета, а ответ Telegram-бота придёт сообщением, когда текст будет готов.

Нужно ли устанавливать программу распознавания речи?

Установка не нужна: распознавание аудио в текст онлайн проходит на серверах сервиса, а вы работаете через браузер с компьютера или телефона. Записи из мессенджера ещё проще переслать боту @mywhisperedbot — он вернёт текст прямо в Telegram.

Разделяет ли сервис реплики по говорящим?

Автоматической разметки спикеров в EdWord нет: реплики идут сплошным текстом в порядке звучания. Если для задачи важно, кто что сказал, включите таймкоды — по меткам легко отмотать запись и подписать участников вручную при вычитке.

Сколько стоит расшифровка в EdWord?

Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.

Какая точность распознавания?

Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.

Безопасно ли загружать файлы в EdWord?

Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.

Есть ли ограничения по длительности или размеру?

Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.

Можно попробовать бесплатно?

Если аккаунту доступен стартовый лимит, после регистрации появится до 60 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.

Попробуйте EdWord прямо сейчас

Загрузите файл или перешлите запись боту — текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Регистрация через Telegram или Яндекс, без карты.

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.