Перейти к основному содержимому
Онлайн-транскрибация аудио и видео

Звук из видео в текст

Извлеките речь из видео и получите текст для конспекта, статьи, протокола или субтитров.

Попробуйте прямо сейчас До 60 мин — если доступен стартовый лимит
Запись Микрофон

Передача по HTTPS · файлы удаляются после обработки

Для большого файла время загрузки и обработки зависит от его длительности, размера и текущей нагрузки
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.
Поддерживаются YouTube, VK Видео, RuTube, Vimeo и прямые публичные ссылки на медиафайлы
Поддерживаемые платформы:
YouTube VK Видео RuTube Vimeo
Также можно проверить прямую публичную ссылку на медиафайл
Модель определит язык автоматически. Для коротких файлов (<30 сек) лучше выбрать язык вручную.

Результат

AI-отчёт по записи
Загружаю форматы…
Отчёт оборвался на середине — запись слишком длинная для одного ответа модели. Нажмите формат ещё раз или возьмите «Кратко».
Остаток: мин

Технически задача «звук из видео в текст» состоит из двух операций: сначала из видеоконтейнера извлекается аудиодорожка, затем она отправляется в распознавание речи. EdWord выполняет обе на своей стороне — вы загружаете видеофайл в исходном виде, без предварительной возни с конвертерами и аудиоредакторами. Тот же маршрут закрывает и соседнюю формулировку «голос из видео в текст»: голос — это речевая часть дорожки, и именно её сервис превращает в текст.

  • Качество зависит от записи
  • Автоопределение языка
  • TXT, DOCX, SRT, VTT
  • Таймкоды реплик

Контейнер значения почти не имеет. MP4 с телефона, MOV с камеры или айфона, MKV с экранной записи, AVI из старого архива, WebM из браузерных рекордеров — сервис открывает все распространённые обёртки и сам находит внутри звуковой поток. Кодек дорожки, битрейт, частота дискретизации, вертикальная или горизонтальная картинка — всё это забота сервиса. Ограничение одно: размер файла до 2 ГБ при загрузке через сайт.

Дальше дорожку обрабатывает модель распознавания речи. Качество зависит от записи, язык определяется автоматически, а срок — от длительности и нагрузки. Чем ближе и разборчивее записан голос, тем меньше обычно требуется вычитки; запись с дальнего конца переговорки стоит проверять особенно внимательно.

Маршрутов загрузки три: поддерживаемый файл на edword.ru, небольшое видео или кружок до 20 МБ через @mywhisperedbot либо публичная ссылка YouTube, VK Видео, Rutube или Vimeo. Сервис сам подготавливает аудиодорожку к распознаванию.

Новичку может быть доступно до 60 стартовых минут без привязки карты. Платные пакеты стартуют с 390 ₽ за час (3 часа — 990 ₽, 10 часов — 2 990 ₽); купленные минуты хранятся на балансе бессрочно.

Как перевести в текст

1

Загрузите файл

Перетащите файл на сайт или отправьте в Telegram-бот @mywhisperedbot

2

Нейросеть распознаёт речь

Модель распознавания обработает запись, расставит знаки препинания и разделит текст на абзацы

3

Скачайте текст

Скопируйте результат или скачайте в формате TXT. Текст сохранится в личном кабинете

Характеристики формата

КодекАудиодорожка извлекается из видео перед распознаванием
Битрейтзависит от видеокодека и качества исходной дорожки
Макс. размер файла2 ГБ
Расширения.mp4, .mov, .avi, .mkv, .webm
Типичное применениеВстречи, вебинары, лекции, ролики и записи экрана

Контейнер, кодек, дорожка: что сервис делает с вашим файлом

Видеофайл устроен как коробка: контейнер (MP4, MKV, MOV, AVI, WebM) хранит внутри отдельные потоки — видеоряд, одну или несколько аудиодорожек, иногда встроенные субтитры. Для расшифровки нужен только звуковой поток. После загрузки EdWord вскрывает контейнер, достаёт аудиодорожку и передаёт её в распознавание; видеоряд при этом остаётся в стороне и на результат никак не влияет. Кодек звука — AAC, MP3, Opus, PCM — сервис читает сам, готовить файл заранее незачем. Практический вывод: чем меньше файл пережимался по пути к вам, тем чище дорожка и тем точнее итоговый текст.

Вытаскивать звук самому или загрузить видео целиком

Извлечь дорожку можно и вручную — через ffmpeg или аудиоредактор — и загрузить уже готовый MP3 или WAV. Смысл в этом появляется в одном случае: видеофайл тяжелее 2 ГБ, а аудио из него весит в разы меньше и проходит лимит сайта. Во всех остальных ситуациях выгоднее отправлять видео как есть: экономится шаг с конвертером, исчезает риск испортить дорожку неудачным битрейтом, а распознаётся в обоих вариантах один и тот же звук. Отдельный плюс загрузки оригинала: дорожка сохраняет полное исходное качество, и это напрямую поднимает точность распознавания.

Как вытащить звук из видео и получить текст: порядок действий

Откройте edword.ru и перетащите видеофайл в окно загрузки — подойдут MP4, MOV, MKV, AVI и WebM до 2 ГБ. Запустите обработку: сервис извлечёт из контейнера аудиодорожку, определит язык речи и расшифрует её; вкладку можно закрыть, задача выполняется на сервере. Готовый текст откройте в кабинете — при включённых таймкодах спорные фразы сверяются с нужной секундой записи в пару кликов. Останется выбрать формат выгрузки: TXT для заметок, DOCX для документа, SRT или VTT, если текст пойдёт в субтитры. Ролик, опубликованный на YouTube, VK Видео, Rutube или Vimeo, можно вовсе передать ссылкой — звук сервис заберёт сам, без скачивания файла на диск.

Выберите пакет

Без подписки, минуты не сгорают — покупаете разовые пакеты и тратите в своём темпе. Списываем только за реально обработанное аудио.

1 час
390 ₽
6.50 ₽/мин
3 часа
990 ₽
5.50 ₽/мин
−15%
Популярный
10 часов
2 990 ₽
4.98 ₽/мин
−23%
50 часов
12 900 ₽
4.30 ₽/мин
−34%

Удобнее в Telegram? Пакеты минут продаются и в боте: открыть @mywhisperedbot

Частые вопросы

Как получить звук из видео в виде текста?

Загрузите видеофайл или вставьте ссылку на ролик. EdWord извлечёт аудиодорожку, распознает речь и покажет текст с возможностью экспорта.

Что будет, если в видео есть музыка?

Если музыка не перекрывает голос, распознавание обычно справляется. Когда музыка громче речи или в видео много шумов, текст может содержать ошибки и требует проверки.

Можно ли получить только слова из видео?

Да. EdWord возвращает текст произнесённой речи. Визуальные титры без озвучки автоматически не считываются, потому что сервис работает с аудиодорожкой.

Подходит ли результат для субтитров?

Да. Для субтитров используйте экспорт SRT или VTT. После выгрузки проверьте переносы строк, имена и термины перед публикацией.

Что будет, если в видео нет звуковой дорожки?

Распознавать в таком файле нечего: текст создаётся из речи, записанной в аудиопотоке. Пустая дорожка случается у экранных записей с выключенным микрофоном и у роликов после неудачного экспорта. Проверьте файл локальным плеером: если звука нет там, не появится он и в расшифровке — понадобится исходник с озвучкой.

Можно ли извлечь текст из видео на телефоне?

Да. Сайт работает в мобильном браузере: загрузка файла и скачивание результата устроены так же, как на компьютере. Видео до 20 МБ ещё проще переслать Telegram-боту @mywhisperedbot — текст придёт ответным сообщением в чат. Тяжёлый ролик с телефона удобнее отдать ссылкой на опубликованную версию.

Сколько стоит расшифровка в EdWord?

Расшифровка оплачивается разовыми пакетами: 1 час за 390 ₽ (6.50 ₽/мин), 3 часа за 990 ₽ (5.50 ₽/мин), 10 часов за 2 990 ₽ (4.98 ₽/мин). Для команд и компаний — пакеты до 100 часов от 9 900 ₽. Подписки нет: купленные минуты не сгорают и списываются только за реально обработанное аудио.

Какая точность распознавания?

Качество зависит от исходной записи: фонового шума, расстояния до микрофона, разборчивости речи и одновременных реплик. Проверьте результат на своём файле и вычитайте имена, числа и профессиональные термины. Язык определяется автоматически; также можно выбрать русский, английский, немецкий, французский или испанский.

Безопасно ли загружать файлы в EdWord?

Файлы передаются по HTTPS. Для распознавания медиа передаётся внешнему STT-провайдеру, описанному в Политике конфиденциальности. Временная копия на сервере EdWord автоматически удаляется после завершения обработки, а текст хранится в личном кабинете, пока вы не удалите его.

Есть ли ограничения по длительности или размеру?

Максимальный размер файла — 2 ГБ, максимальная длительность одной записи — 3 часа. Этого хватает на большинство совещаний, интервью, лекций и подкастов. Более длинную запись разбейте на части перед загрузкой.

Можно попробовать бесплатно?

Если аккаунту доступен стартовый лимит, после регистрации появится до 60 минут — этого хватает, чтобы проверить качество на своей записи. Карта не нужна. Быстрее всего начать в Telegram-боте: открыть @mywhisperedbot.

Попробуйте EdWord прямо сейчас

Загрузите файл или перешлите запись боту — текст придёт с таймкодами и выгрузится в DOCX, SRT или TXT. Регистрация через Telegram или Яндекс, без карты.

Поддержка

Если что-то не работает или есть вопрос — пишите напрямую.