Gemini теперь ищет нужные моменты в видео: что полезного для монтажа и учёбы
1 сентября Google представила новый режим анализа видео в Gemini — agentic video understanding. Модель может возвращаться к отдельным фрагментам, изучать кадры, звук и расшифровку, чтобы найти ответ на ваш вопрос.
Обновление пригодится для длинных интервью, лекций и инструкций. Но с доступом пока есть нюанс: подтверждённый способ включить режим — через API.
Что изменилось
При обычном анализе видео кадры обрабатываются с заданным интервалом. В новом режиме Gemini сама выбирает, какие участки посмотреть подробнее. Например, найти момент демонстрации настройки и вернуться к нему за деталями.
Это полезно, когда общий пересказ не нужен: вы ищете конкретное действие, объяснение или эпизод для короткого ролика.
Где использовать: три практических сценария
Найти фрагменты интервью для коротких роликов
Вместо «выбери лучшие моменты» задайте критерии: тема, длина отрывка и законченная мысль. Например:
" Найди до пяти фрагментов по 30–60 секунд, где спикер рассказывает историю: проблема, действие, результат. Укажи начало и конец каждого отрывка. Выбирай истории, понятные без просмотра всего интервью. Не придумывай цитаты "
Получится задание на предварительный отбор материала. Перед монтажом всё равно нужно открыть найденные места: при обрезке легко потерять уточнение, которое меняет смысл фразы.
Разобрать урок с демонстрацией экрана
В видеоинструкциях часто звучит «нажимаем сюда». По одной расшифровке непонятно, куда именно. Здесь нужен разбор изображения вместе с речью:
" Найди, где преподаватель настраивает сводную таблицу. Укажи таймкод и перечисли действия по порядку. Раздели, что он говорит и что показывает на экране. Если название кнопки не читается, напиши об этом "
Так можно искать конкретный приём в длинном уроке и получать последовательность действий для повторения. Неразборчивые элементы лучше проверить в исходном видео.
Найти непонятные места в своей инструкции
Для проверки записи подойдёт такой запрос:
" Найди места, где действие начинается раньше объяснения, важный текст быстро исчезает или следующий шаг показан без пояснения. Укажи таймкоды и коротко опиши проблему. Не включай замечания, в которых не уверен "
Это способ получить дополнительные замечания перед публикацией. Особенно полезны конкретные указания: какой шаг пропущен и где пояснение запаздывает. Такие промты — примеры задач; качество отбора будет зависеть от самой записи.
Как включить и кому доступно
На 8 сентября документация указывает поддержку Gemini 3.8 Flash, 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. Можно передать видеофайл или ссылку на публичный YouTube-ролик.
В запросе через Interactions API для видео нужно указать `processing: "agentic"`, затем добавить свой вопрос. Точка входа для работы с Gemini API — [Google AI Studio](https://aistudio.google.com/).
В обычное приложение Gemini Google обещала добавить функцию позднее. Поэтому загрузка видео в чат ещё не подтверждает, что используется новый режим. Кроме того, России нет в официальном списке поддерживаемых регионов AI Studio и Gemini API.
Цена и скорость
По тестам Google, новый режим сокращает стоимость анализа **до 66%**, а расход токенов — **до 88%**. Отдельной платы за функцию нет: используется тарификация Gemini API.
Это максимальные показатели из тестов, а не гарантированная скидка на любой ролик. Цена конкретной задачи зависит от модели, объёма обработки и запроса.
Скорость тоже зависит от сценария. Для коротких клипов, где нужен быстрый ответ, документация предлагает рассмотреть обычный режим. Поиск и повторное обращение к фрагментам сами занимают время.
Моё мнение: полезно для длинных записей
Мне здесь интересен отбор материала для монтажа. Если регулярно работаешь с часовыми интервью, список подходящих эпизодов с таймкодами может убрать часть ручной перемотки. При этом выбор удачного фрагмента и его окончательные границы всё равно остаются за автором.
Для одной лекции я бы не стал настраивать API. Пока это скорее инструмент для тех, кто постоянно обрабатывает видео или подключает такую обработку к своему сервису. Для повседневного использования удобнее дождаться появления режима в приложении.
📌 Итоги: главное за 1 минуту
- Gemini может возвращаться к нужным участкам видео и разбирать их подробнее.
- Практические задачи: отбор фрагментов интервью, разбор видеоуроков и замечания к своим инструкциям.
- В запросе стоит задавать конкретные критерии и просить таймкоды. - Подтверждённый доступ — через API.
- Экономия до 66% заявлена Google по результатам её тестов.
- Мой вывод: интересно для регулярной работы с длинными записями; ради одного ролика настраивать API необязательно.
Другие инструменты для работы с текстом, изображениями и видео разбираю в своём Telegram-канале. Там же — промты и варианты бесплатных нейросетей под конкретные задачи.