Video-use: скилл для монтажа видео в Codex и Claude Code, который убирает "э", "а" и паузы автоматически

Video-use: скилл для монтажа видео в Codex и Claude Code, который убирает "э", "а" и паузы автоматически

Приветствую! Уже неделю тестирую скилл для Codex и Claude Code под названием video-use. Полностью открытый проект, который превращает AI-агента в видеомонтажера.

По задумке разработчиков скилл умеет полноценный монтаж - склейки, цветокоррекция, субтитры, анимационные вставки. Но я использую его для более узкой задачи - вырезать из видео все "э", "а", "ы" и неловкие паузы между дублями. И, к моему удивлению, нейронка справляется с этим очень хорошо.

Что умеет video-use на самом деле

Загружаете сырое видео в папку, открываете чат с агентом и описываете задачу текстом. Работает для любого контента: говорящая голова, монтаж влогов, туториалы, интервью.

Основные функции:

  • Вырезает слова-паразиты ("умм", "э") и паузы между дублями
  • Автоматическая цветокоррекция каждого сегмента
  • Плавные аудио-фейды на каждой склейке, чтобы не было щелчков
  • Вшивание субтитров в заданном стиле
  • Генерация анимационных вставок через HyperFrames, Remotion или Manim

Меня же интересовала только первая функция - очистка речи от заминок и пауз. Просто пишу агенту: "убери все паузы, заминки и слова-паразиты из этого видео". Он анализирует аудиодорожку и вырезает проблемные места, оставляя естественный монтаж без резких склеек.

Как это устроено технически

Тут интересный подход. Модель не "смотрит" видео покадрово (это было бы дорого по токенам), а "читает" его через транскрипт.

Для расшифровки речи используется ElevenLabs Scribe - один запрос на источник дает временные метки по каждому слову, разделение по спикерам и звуковые события типа смеха или аплодисментов. Все дубли упаковываются в компактный текстовый файл, по которому агент и работает.

Визуальный анализ (филмстрип и waveform) подключается только в неоднозначных моментах - когда нужно сравнить дубли или проверить точку склейки. Это экономит огромное количество токенов по сравнению с покадровым разбором.

После рендера скилл сам проверяет результат на каждой точке склейки - ищет визуальные скачки, аудио-щелчки, скрытые субтитры. Показывает вам превью только после того, как проверка пройдена.

Мой опыт использования

За неделю прогнал через video-use несколько роликов - записи для канала, где я много запинался и делал паузы на подумать. Раньше вырезал такие моменты вручную в видеоредакторе, тратил по 20-30 минут на ролик.

С video-use процесс сократился до пары минут. Загружаю видео, пишу задачу, AI обрабатывает и выдает готовый результат. Склейки получаются плавные, без рывков и обрывов фраз.

Для расшифровки нужен API-ключ ElevenLabs, его прописываете при установке скилла.

Установка стандартная - даете агенту ссылку на репозиторий, просите настроить, он сам клонирует репо, ставит зависимости и регистрирует скилл. После этого просто закидываете видео в папку и работаете.

Ссылка на репозиторий: https://github.com/browser-use/video-use

Если делаете контент и задалбывает вручную вырезать все "эканья" - однозначно стоит попробовать. Экономит реально много времени.

Спасибо за внимание!

Больше практических гайдов по нейросетям публикую в своем Телеграм-канале. Если интересна тема AI без воды и с конкретными примерами - добро пожаловать!

1