< Кейсы резидентов >

Транскрибация видео с таймкодами без сервисов по подписке

Часовая запись встречи превращается в текст с таймкодами за несколько минут, не покидая компьютера. Разбираем, из чего собрана связка и где у неё границы.

5 августа 2026 8 мин чтения Тимур Яковлев
Транскрибация с таймкодами: часовая запись встречи в текст за минуты

Коротко

Запись встречи обрабатывается локально: субтитры Zoom парсятся напрямую, а если их нет — звук вытаскивается из видео и распознаётся на месте. На выходе текст с таймкодами, погрешность 5–10 секунд. Записи никуда не загружаются, ограничений по длине нет.

Каждую встречу клуба мы режем в двухминутный тизер. Чтобы его собрать, нужно сначала понять, что вообще было на записи и в какие минуты происходило интересное. Раньше на это уходило около трёх часов: отсмотр записи целиком, пометки по ходу, сверка таймкодов.

Попытка отдать эту работу готовому сервису провалилась на самом важном месте. Текст он выдавал, но таймкоды промахивались настолько, что проверять приходилось всё равно вручную — а это и есть основная часть работы.

Почему готовые сервисы не подошли

Если посмотреть, что предлагает поиск по запросу про транскрибацию, картина одинаковая: загрузите файл, оплатите минуты, получите текст. Для публичного вебинара это нормально. Для записи закрытой встречи — уже нет.

Запись встречи клуба содержит цифры чужих бизнесов и разбор конкретных ситуаций участников. Отправлять такое в стороннее хранилище — вопрос не удобства, а договорённостей с людьми, которые на этой встрече говорили.

Вторая причина проще: оплата за минуты. Встреча идёт полтора-два часа, встреч несколько в месяц, и к ним добавляются интервью и записи курсов.

Как устроена связка

Скрипт получает на вход папку с записью и разбирается сам, с чем имеет дело.

Три варианта входных данных

  • Есть субтитры Zoom с именами говорящих — разбираются напрямую, занимает секунды.
  • Есть субтитры без имён — берутся они же, без разметки по спикерам.
  • Нет ничего, кроме видео — звук извлекается из файла и распознаётся локально.

На выходе получается текстовый файл с таймкодами и заготовка для разбора, куда дальше подставляются вопросы: где ключевые темы, какие фрагменты годятся в нарезку, что осталось за кадром.

Разбор транскрипта: таймкоды, цитаты и пометки, чем фрагмент хорош
Так выглядит готовый разбор: таймкоды, реплика и пометка, чем фрагмент хорош. Дальше остаётся собрать нарезку.

Что получилось в цифрах

3 ч → 30 мин
на подготовку одного тизера
5–10 сек
погрешность таймкодов
0 ₽
за минуту обработки

Отдельно оказалось, что решение шире исходной задачи. Так же обрабатывается любая длинная запись — курс, вебинар, интервью.

Где границы

Распознавание речи не читает мысли: если на записи говорят одновременно или человек далеко от микрофона, текст поедет. Имена собственные и названия инструментов приходится править.

И главное ограничение честнее назвать сразу: монтаж это не заменяет. Скрипт готовит материал и подсказывает, где смотреть, а решение о том, что попадёт в тизер, остаётся за человеком.

Кому это имеет смысл повторять

Ориентир простой: если записей больше двух-трёх в месяц и они содержат то, что не хочется отдавать наружу, локальная обработка окупается за первый же месяц. Если запись одна и она публичная, готовый сервис быстрее.

Тимур Яковлев

Тимур Яковлев

Отвечает за контент и продукт в AI Practiq. Собирает внутренние инструменты клуба без опыта в разработке — от бота регистрации на мероприятия до пайплайна статей.

Такие разборы мы делаем каждую неделю

AI Practiq — закрытый клуб предпринимателей, которые внедряют ИИ в свои задачи и делятся тем, что получилось и что сломалось. Оставьте контакты, расскажем, как устроено участие.

Ответим в Telegram в течение рабочего дня.

Нажимая кнопку, вы соглашаетесь с политикой конфиденциальности.
Made on
Tilda