Транскрибация аудио и видео в текст
Кидаете запись и закрываете вкладку: текст обычно готов за несколько минут — зависит от длины записи и очереди. У каждого куска стоит время начала, по нему найдёте нужное место в своей записи.
1,5 ₽ за минуту речи. Считаем только то время, когда реально говорили: паузы и молчание в счёт не идут.
При регистрации кладём на счёт 150 ₽ — это около 100 минут речи. Хватит проверить на своём файле.
Что можно расшифровать
Берём то, что обычно и лежит на телефоне: запись с диктофона, голосовое из мессенджера, ролик, вебинар.
Голосовые и кружочки
Голосовое из Telegram или WhatsApp обычно сохраняется как .ogg или .oga — берём как есть. Из видеокружка возьмём звук.
Диктофон и подкасты
Запись с телефона, разговор на ходу, выпуск подкаста, эфир. Всё, что записалось одной дорожкой.
Лекции, вебинары, уроки
Двухчасовая лекция превращается в текст — нужный кусок потом находится поиском по слову.
Распознавание речи из видео
Ролик с телефона, запись экрана, вебинар в mp4. Звуковую дорожку вытащим сами — отдельно доставать не надо.
Запись созвона или планёрки
Тоже расшифруем, но честно: по голосам такой файл не разделим — получится сплошной текст с таймкодами.
Старый архив записей
Накопилась папка со звуком за год — грузите пачкой. Одновременно расшифровываем до 12 файлов, остальные добавите, когда освободится место.
Форматы аудио
Форматы видео
Звук достаём сами, картинку не трогаем.
Один файл — до 500 МБ. Часовой mp3 весит мегабайт сорок, так что упереться в потолок можно разве что тяжёлым видео с телефона.
Три способа отдать запись
Один файл через кабинет
Открыли кабинет, выбрали запись, ушли по делам. Держать вкладку открытой не нужно — вернётесь, текст будет на месте.
Сразу пачкой
Выделите несколько файлов в проводнике или перетащите их мышкой в окно. Одновременно в работе до 12 файлов — остальные добавляйте, когда освободится место.
По API из своей программы
Отдаёте файл по ключу, забираете текст. Тариф тот же, что в вебе. Пример запроса
Как это работает
Регистрируетесь
Через Telegram или по email, минута. На счёт сразу падает 150 ₽.
Загружаете запись
Один файл или пачку — как удобнее. Можно просто перетащить мышкой в окно кабинета.
Мы распознаём речь
Из видео достаём звук, режем запись на куски и превращаем в текст. У каждого куска остаётся время начала.
Забираете текст
Читаете прямо в кабинете, копируете целиком или скачиваете файлом — .txt или .json с таймкодами.
Сколько стоит
Посчитаем на пальцах
Сколько минут речи насчитали в вашем файле, видно в кабинете после расшифровки — можно сверить с записью.
Деньги лежат на счёте и не сгорают в конце месяца. Ничего не загружали — ничего не списали.
При регистрации — 150 ₽ на счёт
Около 100 минут речи. Этого достаточно, чтобы прогнать свою запись и посмотреть, что за текст получается, прежде чем платить.
Пополнение пока вручную
Оплаты картой на сайте ещё нет. Оставляете заявку в Telegram — зачисляем на баланс руками.
Если денег на счёте не хватило
Файл всё равно распознаётся целиком — расшифровка не обрывается на полуслове. Открывается ровно столько, на сколько хватило баланса; хвост ждёт под замком и открывается после пополнения. Заново загружать и заново платить за уже открытое не нужно.
Что умеем и чего пока нет
Умеем
- ✓Русская речь с диктофона, из мессенджера, из видео.
- ✓Таймкод у каждого куска текста — по нему находится место в записи.
- ✓Звук из видео вытаскиваем сами, конвертировать заранее не надо.
- ✓Пачка файлов за один заход: мультивыбор и перетаскивание мышью, одновременно в работе до 12 файлов.
- ✓Текст можно скопировать или скачать: .txt и .json.
- ✓API по ключу — по той же цене, что в вебе.
Чего пока нет
- —Разделения по голосам у загруженных файлов. Текст идёт сплошняком, с таймкодами, без пометок, кто говорит. По спикерам делим только встречи внутри HEXT — там у каждого своя дорожка записи.
- —Других языков. Пока только русский.
- —Оплаты картой на сайте. Пополнение — заявкой в Telegram.
- —Файлов тяжелее 500 МБ. Для аудио это много, для видео с телефона — не всегда.
- —Текста без вычитки. Имена, термины и запись из кармана машина местами перевирает — глазами пройтись придётся.
Транскрибация по API
Отдаёте файл по ключу, забираете текст. Тариф тот же, что в вебе, — отдельный баланс под API заводить не надо. Ключ и документация лежат в кабинете.
Отправить файл
В ответ приходит номер задания. Готовность спрашиваете у /api/v1/jobs/<id>.
Одновременно в работе — до 12 заданий на аккаунт. Тринадцатая загрузка вернёт ошибку, а не встанет в очередь: отправьте файл, когда одно из заданий закончится.
Забрать текст
Формат на выбор: json с таймкодами по кускам, text сплошняком, srt и vtt — субтитрами.
Как называют расшифровку аудио
Ищут это по-разному: кто-то набирает «перевести аудио в текст», кто-то «расшифровка аудиозаписи», кто-то «транскрибация» или «распознавание речи». Задача одна: есть запись, нужен текст — и желательно со временем, чтобы потом искать по нему словом.
Расшифровать можно и руками: человек слушает запись и печатает. Это дольше, зато он разберёт плохой звук и пометит, кто где говорит. Машина считает 1,5 ₽ за минуту речи и отдаёт текст обычно за несколько минут — имена, термины и цифры после неё надо проверить глазами.
Если вам нужна не расшифровка готового файла, а встреча, которую сразу пишут и разбирают по участникам, — это видеочаты HEXT: там у каждого своя дорожка записи, и текст выходит с именами.
Вопросы и ответы
Какие форматы файлов вы поддерживаете?
Аудио: mp3, m4a, aac, wav, ogg, oga, opus, flac, wma, amr. Видео: mp4, mov, m4v, webm, mkv, avi, 3gp — звук из него вытащим сами. Один файл до 500 МБ.
Сколько стоит расшифровка?
1,5 ₽ за минуту речи, то есть 90 ₽ за час речи. Считаем только то время, когда в записи реально говорили: паузы и тишина в счёт не идут. Час записи, в котором говорили 40 минут, стоит 60 ₽.
Есть ли бесплатный лимит?
При регистрации кладём на счёт 150 ₽ — это около 100 минут речи. Тратятся они как угодно: одним длинным файлом или десятком голосовых.
Какой максимальный размер файла?
500 МБ. Часовой mp3 весит мегабайт сорок, так что на аудио этот потолок почти не достаётся. Упереться можно видео с телефона — тогда сожмите его или вытащите звук отдельной дорожкой.
Как быстро будет готов текст?
Обычно несколько минут — зависит от длины записи и от очереди. Ждать на странице не нужно: закройте вкладку и вернитесь, статус виден в кабинете.
Разделяете ли текст по спикерам?
У загруженных файлов — нет. Текст идёт сплошняком, с таймкодами, без пометок, кто именно говорит. Разделение по голосам работает только на встречах внутри HEXT: там у каждого участника своя дорожка записи.
На каком языке распознаёте речь?
Пока только русский. Другие языки не обещаем.
Что происходит с записью после расшифровки?
Аудио удаляем сразу после расшифровки, на сервере остаётся только текст. VPN для работы с сайтом не нужен.
Можно ли расшифровать голосовое сообщение из Telegram или кружочек?
Да. Сохраните голосовое (обычно это .ogg или .oga) или видеокружок и загрузите файл как обычный — из кружка возьмём звуковую дорожку.
Есть ли API?
Есть: POST на https://hext.ru/api/v1/transcribe, ключ в заголовке. Тариф тот же, что в вебе, отдельный баланс под API заводить не надо. Ключ и документация — в кабинете.
Проверьте на своём файле
Зарегистрируйтесь — на счёт упадёт 150 ₽, это около 100 минут речи. Загрузите запись и посмотрите, какой выходит текст. Может, до пополнения дело и не дойдёт.