< Кейсы резидентов >
Транскрибация видео с таймкодами без сервисов по подписке
Часовая запись встречи превращается в текст с таймкодами за несколько минут, не покидая компьютера. Разбираем, из чего собрана связка и где у неё границы.
Коротко
Запись встречи обрабатывается локально: субтитры Zoom парсятся напрямую, а если их нет — звук вытаскивается из видео и распознаётся на месте. На выходе текст с таймкодами, погрешность 5–10 секунд. Записи никуда не загружаются, ограничений по длине нет.
Каждую встречу клуба мы режем в двухминутный тизер. Чтобы его собрать, нужно сначала понять, что вообще было на записи и в какие минуты происходило интересное. Раньше на это уходило около трёх часов: отсмотр записи целиком, пометки по ходу, сверка таймкодов.
Попытка отдать эту работу готовому сервису провалилась на самом важном месте. Текст он выдавал, но таймкоды промахивались настолько, что проверять приходилось всё равно вручную — а это и есть основная часть работы.
Почему готовые сервисы не подошли
Если посмотреть, что предлагает поиск по запросу про транскрибацию, картина одинаковая: загрузите файл, оплатите минуты, получите текст. Для публичного вебинара это нормально. Для записи закрытой встречи — уже нет.
Вторая причина проще: оплата за минуты. Встреча идёт полтора-два часа, встреч несколько в месяц, и к ним добавляются интервью и записи курсов.
Как устроена связка
Скрипт получает на вход папку с записью и разбирается сам, с чем имеет дело.
Три варианта входных данных
- Есть субтитры Zoom с именами говорящих — разбираются напрямую, занимает секунды.
- Есть субтитры без имён — берутся они же, без разметки по спикерам.
- Нет ничего, кроме видео — звук извлекается из файла и распознаётся локально.
На выходе получается текстовый файл с таймкодами и заготовка для разбора, куда дальше подставляются вопросы: где ключевые темы, какие фрагменты годятся в нарезку, что осталось за кадром.
Что получилось в цифрах
Отдельно оказалось, что решение шире исходной задачи. Так же обрабатывается любая длинная запись — курс, вебинар, интервью.
Где границы
Распознавание речи не читает мысли: если на записи говорят одновременно или человек далеко от микрофона, текст поедет. Имена собственные и названия инструментов приходится править.
И главное ограничение честнее назвать сразу: монтаж это не заменяет. Скрипт готовит материал и подсказывает, где смотреть, а решение о том, что попадёт в тизер, остаётся за человеком.
Кому это имеет смысл повторять
Ориентир простой: если записей больше двух-трёх в месяц и они содержат то, что не хочется отдавать наружу, локальная обработка окупается за первый же месяц. Если запись одна и она публичная, готовый сервис быстрее.
Такие разборы мы делаем каждую неделю
AI Practiq — закрытый клуб предпринимателей, которые внедряют ИИ в свои задачи и делятся тем, что получилось и что сломалось. Оставьте контакты, расскажем, как устроено участие.
Ответим в Telegram в течение рабочего дня.
