Video-use: скилл для монтажа видео в Codex и Claude Code, который убирает "э", "а" и паузы автоматически
Приветствую! Уже неделю тестирую скилл для Codex и Claude Code под названием video-use. Полностью открытый проект, который превращает AI-агента в видеомонтажера.
По задумке разработчиков скилл умеет полноценный монтаж - склейки, цветокоррекция, субтитры, анимационные вставки. Но я использую его для более узкой задачи - вырезать из видео все "э", "а", "ы" и неловкие паузы между дублями. И, к моему удивлению, нейронка справляется с этим очень хорошо.
Что умеет video-use на самом деле
Загружаете сырое видео в папку, открываете чат с агентом и описываете задачу текстом. Работает для любого контента: говорящая голова, монтаж влогов, туториалы, интервью.
Основные функции:
- Вырезает слова-паразиты ("умм", "э") и паузы между дублями
- Автоматическая цветокоррекция каждого сегмента
- Плавные аудио-фейды на каждой склейке, чтобы не было щелчков
- Вшивание субтитров в заданном стиле
- Генерация анимационных вставок через HyperFrames, Remotion или Manim
Меня же интересовала только первая функция - очистка речи от заминок и пауз. Просто пишу агенту: "убери все паузы, заминки и слова-паразиты из этого видео". Он анализирует аудиодорожку и вырезает проблемные места, оставляя естественный монтаж без резких склеек.
Как это устроено технически
Тут интересный подход. Модель не "смотрит" видео покадрово (это было бы дорого по токенам), а "читает" его через транскрипт.
Для расшифровки речи используется ElevenLabs Scribe - один запрос на источник дает временные метки по каждому слову, разделение по спикерам и звуковые события типа смеха или аплодисментов. Все дубли упаковываются в компактный текстовый файл, по которому агент и работает.
Визуальный анализ (филмстрип и waveform) подключается только в неоднозначных моментах - когда нужно сравнить дубли или проверить точку склейки. Это экономит огромное количество токенов по сравнению с покадровым разбором.
После рендера скилл сам проверяет результат на каждой точке склейки - ищет визуальные скачки, аудио-щелчки, скрытые субтитры. Показывает вам превью только после того, как проверка пройдена.
Мой опыт использования
За неделю прогнал через video-use несколько роликов - записи для канала, где я много запинался и делал паузы на подумать. Раньше вырезал такие моменты вручную в видеоредакторе, тратил по 20-30 минут на ролик.
С video-use процесс сократился до пары минут. Загружаю видео, пишу задачу, AI обрабатывает и выдает готовый результат. Склейки получаются плавные, без рывков и обрывов фраз.
Для расшифровки нужен API-ключ ElevenLabs, его прописываете при установке скилла.
Установка стандартная - даете агенту ссылку на репозиторий, просите настроить, он сам клонирует репо, ставит зависимости и регистрирует скилл. После этого просто закидываете видео в папку и работаете.
Ссылка на репозиторий: https://github.com/browser-use/video-use
Если делаете контент и задалбывает вручную вырезать все "эканья" - однозначно стоит попробовать. Экономит реально много времени.
Спасибо за внимание!
Больше практических гайдов по нейросетям публикую в своем Телеграм-канале. Если интересна тема AI без воды и с конкретными примерами - добро пожаловать!