Перейти к основному содержимому
Онлайн-транскрибация аудио и видео

Транскрибация речи и голоса

Речь из аудио, видео, голосовых сообщений и записей с микрофона становится текстом.

Попробуйте прямо сейчас 30 минут бесплатно, карта не нужна*
Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Транскрибация речи — это перевод звучащего голоса в печатный текст: сказали — получили написанное. Живую речь при этом обычно сложнее распознавать, чем аккуратную диктовку: люди тараторят, глотают окончания, перебивают друг друга и вставляют слова-паразиты. EdWord создаёт автоматический черновик такого разговора, но результат нужно вычитать, особенно при шуме и наложении голосов.

  • Качество зависит от записи
  • Автоопределение языка
  • TXT, DOCX, SRT, VTT
  • Таймкоды реплик

Акценты и региональное произношение модель переваривает уверенно: южный говор, окающая речь, русский с кавказским или среднеазиатским акцентом распознаются без специальных настроек. Язык определяется автоматически. Быстрый темп тоже терпим: скороговорка теряет точность в основном там, где спикер физически смазывает слова.

Паузы, обрывы фраз и слова-паразиты попадают в текст ровно в той мере, в какой прозвучали. Черновик живого разговора выглядит как разговор — и это нормально: вычистить «эээ» и повторы поиском по тексту занимает минуты, а смысл и формулировки уже зафиксированы. Со специфическими терминами и именами собственными сложнее: их стоит проверять отдельно, включив таймкоды и отматывая запись в спорных местах.

Речь попадает в EdWord четырьмя путями: поддерживаемый файл до 2 ГБ на сайте, голосовое или медиа до 20 МБ в боте @mywhisperedbot, публичная ссылка YouTube, VK Видео, Rutube или Vimeo, а также новая запись через EdWord Mini. Качество зависит от записи, срок — от длительности и нагрузки. Новому аккаунту может быть доступно до 30 стартовых минут; дальше пакеты начинаются с 390 ₽ за час, купленные минуты не сгорают.

Как перевести в текст

1

Загрузите файл

Перетащите файл на сайт или отправьте в Telegram-бот @mywhisperedbot

2

Нейросеть распознаёт речь

Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы

3

Скачайте текст

Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете

Характеристики формата

КодекРечь из аудио передаётся в модель распознавания после подготовки файла
Битрейтзависит от исходного файла; важнее чистота речи
Макс. размер файла2 ГБ
Расширения.mp3, .m4a, .wav, .ogg, .flac
Типичное применениеГолосовые, диктофонные записи, интервью, лекции и созвоны

Три привычки чистой диктовки в Mini

Диктовка через EdWord Mini даёт самый чистый результат при трёх привычках. Проговаривайте фразу в голове перед тем, как произнести: обрывы вида «так, стоп, заново» уходят из черновика сами. Держите ровный средний темп — спешить незачем, минута речи даёт примерно 120-150 слов, то есть страницу текста за 3-4 минуты. Знаки препинания расставит распознавание, а структуру задавайте голосом: закончили мысль — пауза, новая тема — новая запись.

Длинный материал удобнее диктовать блоками по 5-10 минут: каждый блок сразу проверяется, термины исправляются по горячим следам, и к концу часа у вас правленый текст вместо горы сырья.

Слабые места живой речи и что с ними делать

Одновременная речь: когда два человека говорят разом, фрагмент смазывается у обоих — на встречах выручает договорённость передавать слово. Имена и фамилии: модель подставляет созвучное слово, поэтому после обработки пройдитесь поиском по всем упоминаниям людей и компаний. Профессиональный жаргон и отраслевые сокращения распознаются неровно — держите глоссарий проекта под рукой при вычитке. Числа: суммы и даты сверяйте с записью по таймкодам, это самая дорогая ошибка в рабочих текстах.

Всё перечисленное — точечные правки: на час живого разговора обычно уходит 10-20 минут вычитки при уже готовом черновике.

Транскрибация звука: что кроме голосовых можно расшифровать

Под транскрибацию звука попадает любой материал, где различима человеческая речь. Диктофонная запись пары или планёрки, звуковая дорожка ролика в MP4 или MOV, вебинар по публичной ссылке, аудиокнига собственного авторства, черновик подкаста — всё это обрабатывается наравне с голосовыми. Конвертировать видео заранее незачем: звук из него отделяется автоматически.

Не расшифруется только то, где речи нет физически: музыка без слов, шум зала, запись, в которой голос утонул в фоне. Если при прослушивании слова различимы с трудом, транскрибация услышит их не лучше человеческого уха — такой файл стоит сначала прогнать через шумоподавление и лишь потом отправлять на распознавание.

Выберите пакет

Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.

1 час
390 ₽
6.50 ₽/мин
3 часа
990 ₽
5.50 ₽/мин
−15%
Популярный
10 часов
2 990 ₽
4.98 ₽/мин
−23%
50 часов
12 900 ₽
4.30 ₽/мин
−34%

Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot

Частые вопросы

Что можно назвать транскрибацией речи?

Это перевод произнесённой речи в текст. В EdWord источником может быть аудиофайл, видео, голосовое сообщение, диктофонная запись или новая запись через /mini.

Можно ли транскрибировать свой голос с микрофона?

Да. Откройте /mini, запишите речь в браузере и отправьте её на обработку. Такой способ удобен для заметок, черновиков писем, идей и коротких объяснений.

Подходит ли EdWord для голоса на русском языке?

Да. Русская речь поддерживается, язык определяется автоматически. Для лучшего результата говорите ближе к микрофону и избегайте одновременной речи нескольких людей.

Как получить текст голоса из Telegram?

Перешлите голосовое сообщение боту @mywhisperedbot. Он запустит распознавание и пришлёт текст в тот же Telegram-диалог; в историю веб-кабинета ответ бота не переносится.

Чем автоматическая транскрибация голоса отличается от ручной?

Ручную расшифровку делает человек: слушает и печатает, беря за час записи от 1 000 ₽ и минимум сутки срока, зато сразу размечает говорящих. Автоматическая транскрибация возвращает черновик за долю этого времени и заметно дешевле; имена, цифры и спорные места вы вычитываете сами по таймкодам.

Сколько текста получается из часа речи?

Час разговорной речи в среднем даёт 7-9 тысяч слов — порядка 15-20 страниц. Точный объём зависит от темпа: спокойная лекция окажется короче, оживлённый спор длиннее. Ориентироваться в таком массиве помогают таймкоды — по ним нужная фраза находится за секунды.

Сколько стоит расшифровка в EdWord?

Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.

Какая точность распознавания?

Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.

Безопасно ли загружать файлы в EdWord?

Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.

Есть ли ограничения по длительности или размеру?

Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.

Можно попробовать бесплатно?

Если аккаунту доступен стартовый лимит, после регистрации появится до 30 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.

Загрузите запись прямо здесь

Текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Новым пользователям — 30 бесплатных минут, карта не нужна.*

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.