Транскрибация речи и голоса
Речь из аудио, видео, голосовых сообщений и записей с микрофона становится текстом.
Передача по HTTPS · файлы удаляются после обработки
Транскрибация речи — это перевод звучащего голоса в печатный текст: сказали — получили написанное. Живую речь при этом обычно сложнее распознавать, чем аккуратную диктовку: люди тараторят, глотают окончания, перебивают друг друга и вставляют слова-паразиты. EdWord создаёт автоматический черновик такого разговора, но результат нужно вычитать, особенно при шуме и наложении голосов.
- Качество зависит от записи
- Автоопределение языка
- TXT, DOCX, SRT, VTT
- Таймкоды реплик
Акценты и региональное произношение модель переваривает уверенно: южный говор, окающая речь, русский с кавказским или среднеазиатским акцентом распознаются без специальных настроек. Язык определяется автоматически. Быстрый темп тоже терпим: скороговорка теряет точность в основном там, где спикер физически смазывает слова.
Паузы, обрывы фраз и слова-паразиты попадают в текст ровно в той мере, в какой прозвучали. Черновик живого разговора выглядит как разговор — и это нормально: вычистить «эээ» и повторы поиском по тексту занимает минуты, а смысл и формулировки уже зафиксированы. Со специфическими терминами и именами собственными сложнее: их стоит проверять отдельно, включив таймкоды и отматывая запись в спорных местах.
Речь попадает в EdWord четырьмя путями: поддерживаемый файл до 2 ГБ на сайте, голосовое или медиа до 20 МБ в боте @mywhisperedbot, публичная ссылка YouTube, VK Видео, Rutube или Vimeo, а также новая запись через EdWord Mini. Качество зависит от записи, срок — от длительности и нагрузки. Новому аккаунту может быть доступно до 30 стартовых минут; дальше пакеты начинаются с 390 ₽ за час, купленные минуты не сгорают.
Как перевести в текст
Нейросеть распознаёт речь
Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы
Скачайте текст
Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете
Характеристики формата
Три привычки чистой диктовки в Mini
Диктовка через EdWord Mini даёт самый чистый результат при трёх привычках. Проговаривайте фразу в голове перед тем, как произнести: обрывы вида «так, стоп, заново» уходят из черновика сами. Держите ровный средний темп — спешить незачем, минута речи даёт примерно 120-150 слов, то есть страницу текста за 3-4 минуты. Знаки препинания расставит распознавание, а структуру задавайте голосом: закончили мысль — пауза, новая тема — новая запись.
Длинный материал удобнее диктовать блоками по 5-10 минут: каждый блок сразу проверяется, термины исправляются по горячим следам, и к концу часа у вас правленый текст вместо горы сырья.
Слабые места живой речи и что с ними делать
Одновременная речь: когда два человека говорят разом, фрагмент смазывается у обоих — на встречах выручает договорённость передавать слово. Имена и фамилии: модель подставляет созвучное слово, поэтому после обработки пройдитесь поиском по всем упоминаниям людей и компаний. Профессиональный жаргон и отраслевые сокращения распознаются неровно — держите глоссарий проекта под рукой при вычитке. Числа: суммы и даты сверяйте с записью по таймкодам, это самая дорогая ошибка в рабочих текстах.
Всё перечисленное — точечные правки: на час живого разговора обычно уходит 10-20 минут вычитки при уже готовом черновике.
Транскрибация звука: что кроме голосовых можно расшифровать
Под транскрибацию звука попадает любой материал, где различима человеческая речь. Диктофонная запись пары или планёрки, звуковая дорожка ролика в MP4 или MOV, вебинар по публичной ссылке, аудиокнига собственного авторства, черновик подкаста — всё это обрабатывается наравне с голосовыми. Конвертировать видео заранее незачем: звук из него отделяется автоматически.
Не расшифруется только то, где речи нет физически: музыка без слов, шум зала, запись, в которой голос утонул в фоне. Если при прослушивании слова различимы с трудом, транскрибация услышит их не лучше человеческого уха — такой файл стоит сначала прогнать через шумоподавление и лишь потом отправлять на распознавание.
Выберите пакет
Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.
Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot
Частые вопросы
Что можно назвать транскрибацией речи?
Это перевод произнесённой речи в текст. В EdWord источником может быть аудиофайл, видео, голосовое сообщение, диктофонная запись или новая запись через /mini.
Можно ли транскрибировать свой голос с микрофона?
Да. Откройте /mini, запишите речь в браузере и отправьте её на обработку. Такой способ удобен для заметок, черновиков писем, идей и коротких объяснений.
Подходит ли EdWord для голоса на русском языке?
Да. Русская речь поддерживается, язык определяется автоматически. Для лучшего результата говорите ближе к микрофону и избегайте одновременной речи нескольких людей.
Как получить текст голоса из Telegram?
Перешлите голосовое сообщение боту @mywhisperedbot. Он запустит распознавание и пришлёт текст в тот же Telegram-диалог; в историю веб-кабинета ответ бота не переносится.
Чем автоматическая транскрибация голоса отличается от ручной?
Ручную расшифровку делает человек: слушает и печатает, беря за час записи от 1 000 ₽ и минимум сутки срока, зато сразу размечает говорящих. Автоматическая транскрибация возвращает черновик за долю этого времени и заметно дешевле; имена, цифры и спорные места вы вычитываете сами по таймкодам.
Сколько текста получается из часа речи?
Час разговорной речи в среднем даёт 7-9 тысяч слов — порядка 15-20 страниц. Точный объём зависит от темпа: спокойная лекция окажется короче, оживлённый спор длиннее. Ориентироваться в таком массиве помогают таймкоды — по ним нужная фраза находится за секунды.
Сколько стоит расшифровка в EdWord?
Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.
Какая точность распознавания?
Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.
Безопасно ли загружать файлы в EdWord?
Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.
Есть ли ограничения по длительности или размеру?
Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.
Можно попробовать бесплатно?
Если аккаунту доступен стартовый лимит, после регистрации появится до 30 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.
Похожие форматы
Перевести голосовое сообщение в текст
Для длинных войсов из Telegram: отправьте сообщение боту и получите текст с таймкодами.
Голосовое в текст онлайн
Онлайн-расшифровка войсов и аудиосообщений без установки программ.
Распознавание аудио в текст
Автоматическое распознавание речи из аудиофайлов, голосовых и записей встреч.
Транскрипция аудио в текст
Аудиозаписи, интервью, лекции и голосовые превращаются в текст с таймкодами.
Транскрибация записи в текст
Аудиозаписи, голосовые, диктофон и файлы встреч превращаются в текст с экспортом.
Запись с диктофона iPhone и Android в текст
Запись из «Диктофона» на iPhone, с Android-рекордера или с аппаратного диктофона превращается в текст через сайт и Telegram.
Загрузите запись прямо здесь
Текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Новым пользователям — 30 бесплатных минут, карта не нужна.*