Про то, как я оцифровал себя без ИИ, чтобы стать видеоблогером
В общем, мой каминг-аут: я человек, не созданный для камеры, но почему-то всё равно желающий творческого выброса и немного славы.
Именно поэтому я стал вести блог — про работу, хобби и всякое странное, что копится в голове. Ничего не продаю, просто рассказываю о своей практике и наблюдениях.
Изначально я выбрал ТГ и ВК как единственные площадки, где текст ещё хоть как-то котируется, и почти сразу больно ударился о проблему органического трафика.
Что ж, подумал я, бессмысленно «идти против ветра». Надо смотреть туда, где органики сильно больше и где есть шанс показаться новым людям.
А такие площадки сейчас почти полностью построены на видеоконтенте. По-другому никак: хочешь попасть в ранжирование алгоритмов — дай им вертикальный видос.
Так передо мной встала инженерная задача:
как стать видеоблогером, если я не умею сидеть перед камерой, не люблю долгий техпроцесс создания видео и в принципе не обладаю свободным временем, чтобы выделять отдельный день на съёмку и монтаж?
Короче, вводные такие, что если влезаешь в этот формат, то с головой. «А я женатый человек — мне нельзя в Бельдяжки».
Так я пришёл к идее создания своего виртуального аватара — системы, которая бы собирала мне видео из моих текстовых сценариев.
Идею генерации видео через ИИ я сразу отверг. Это крипово, ненадёжно и, как по мне, неуважительно к зрителю и читателю. Нейрослоп плодить не хочется.
Разведка существующих инструментов вроде 3D-витубер-аватаров тоже закончилась ничем. Кастомизация персонажа слабая, мимика примитивная, ощущение такое, будто ты выбираешь себе не цифровое лицо, а скин в Роблоксе.
Остался только один вариант — делать всё самому. То есть создать кастомного персонажа, который будет делать всё, что я захочу.
Архитектура проекта получилась примерно такой:
- After Effects — финальная сборка, таймлайн и рендер
- Photoshop — подготовка графических ассетов персонажа
- набор PSD/PNG-ассетов для рта, глаз, мимики и слайдов
- текстовый сценарий с управляющими тегами
- аудиодорожка с моим голосом
- файл разметки фраз из Audacity
- кастомная JSX-панель для After Effects, которая собирает проект из всего этого
Важное уточнение: под “без ИИ” я имею в виду, что видео, персонаж, речь, мимика и монтаж не генерируются нейросетью. Это обычная графика, ручные ассеты, мой голос и скрипты поверх After Effects.
Небольшое отступление. Помимо набора профнавыков вроде программирования и дизайна, я давно увлекаюсь анимацией и даже успел немного поработать на ТВ в новостном блоке. То есть видеомонтаж мне знаком. И я прекрасно понимаю, насколько долго делается кастомная анимация и почему лучше не трогать её без автоматизации.
Так я решил сделать свой движок лицевой анимации, который из текстового сценария расставляет мимику моего аватара, субтитры и собирает заготовку вертикального видео. А я потом быстро довожу её до ума в мелочах.
Ожидания по времени были простые:
то, что обычно занимало бы рабочий день, должно занимать пару часов. Столько я готов выделять на это хобби. Больше — уже не хобби, а новая работа без права на отдых.
Я почти сразу решил, что не буду делать вымышленного персонажа. Это же мой блог и мои мысли, поэтому честнее использовать своё настоящее изображение. Робот со своим лицом — это странно, но всё же честнее, чем прятаться за абстрактным маскотом.
Дальше начались тесты, пробы и сама разработка.
Я пошёл путём классической анимации: разделил персонажа на составляющие и начал заменять их под ситуацию. Сначала сделал набор основных положений губ для рта, потом набор глаз, потом появились более сложные штуки вроде случайного моргания.
Основные формы положений рта, которые покрывают почти весь алфавит (самое важное во всей анимации):
- пауза, нейтральное лицо - рот закрыт или почти закрыт
- м, п, б - губы плотно сомкнуты
- а, я - рот открыт широко, вертикально
- э, е, и, ы - рот растянут шире по горизонтали
- о, ё - округлый рот, среднее открытие
- у, ю - маленький округлый рот, губы вперёд
- ф, в - верхние зубы/губа, лёгкое прикусывание нижней губы
- ш, ж, ч, щ - узкий округлённый рот, почти “шипящий”
И вот появился первый прототип. Показываю его жене. Она внимательно смотрит и говорит, что всё это очень круто и технологично, но сам персонаж крайне кринжовый и будет пугать зрителя. Аватар слишком сильно попал в зловещую долину.
«То есть это будто бы ты, но ненастоящий», — цитата супруги.
Размышляя над этой проблемой, я пришёл к компромиссу: стилизовать изначально реалистичную фотографию под пиксельное ретро. Чтобы результат больше напоминал персонажа из игры, чем человека. Такому можно простить несовершенство анимации.
Тестовые показы всех удовлетворили. Аватар уже не пугал. А это, согласитесь, важный этап любого творческого проекта: сначала перестать пугать близких.
Виртуальный «я» уже умел шевелить ртом под буквы и показывать базовую мимику. Сначала я вручную помечал начала слов на таймлайне, а анимация строила набор ключевых кадров под каждую букву. Уже нифига себе уровень: по губам аватара можно было читать текст.
Но тут вскрылась проблема. Разметить 10–15 слов — вообще не вопрос. А вот текст для 30-секундного ролика меня вымотал. Всё ещё слишком много ручного труда.
Была попытка привязать ключевые кадры гласных к пикам звуковой дорожки, но в живой речи звуки часто слипаются. Если где-то в начале проглотишь букву, дальше вся разметка начинает деградировать по нарастающей.
Поэтому через несколько версий я пришёл к более рабочему варианту. В момент записи речи я явно оставлял большие паузы между предложениями. Это делило звук на сегменты-предложения. Потом программа соотносила предложения звука с предложениями текста, а анализатор пиков уже помогал примерно размечать буквы внутри фразы.
Так получилось, что губы не шевелились в паузах и примерно попадали в звуки слов. Не идеальный лип-синк, но достаточный для работы. И главное — почти без затрат для оператора. Разметить 10 предложений в звуке — это пара минут.
Так движок анимации дошёл до следующего уровня: речь аватара начала собираться в анимацию почти без ручной разметки.
А когда у тебя на руках появляется работающий движок, остановиться уже сложно. Он уже мог бы просто заменить диктора в новостях, но мне, конечно, стало мало. Я захотел сделать его не диктором, а настоящим актёром, чтобы он делал в кадре всякое по команде.
Поэтому дальше я сконцентрировался на том, чтобы персонаж понимал команды из текстового сценария. Мимика разрослась, появилась система движения по кадру, а сам сценарий начал управлять аватаром через теги.
Например, кусок сценария теперь выглядит примерно так:
Наблюдательный читатель мог заметить, что там есть ещё и теги слайдов. Они тоже предмет моей гордости. Программа сканирует длительность блоков речи и пауз, а потом автоматически расставляет на таймлайне заготовки для слайдов в верхней части видео.
Примеры тегов:
То есть получается уже настоящий сторителлинг: аватар говорит, слайды сменяются, титры появляются, мимика работает, а я не сижу восемь часов и не двигаю каждый слой руками.
Итак, цель удалось достичь: 30-секундный ролик из 10 предложений и 5–6 слайдов теперь собирается примерно за 1-2 часа, а не за день.
Что получилось автоматизировать:
- разбор сценария с тегами
- расстановку фраз по аудио
- переключение ассетов рта
- мимику глаз
- случайное и принудительное моргание
- движение персонажа по кадру
- генерацию слайдов
- субтитры
- сборку начальной композиции в After Effects
Что осталось ручным:
- запись голоса
- подготовка текста
- проверка таймингов
- финальная правка слайдов
- экспорт
- публикация
Правда, чтобы это сделать, пришлось по сути написать кастомный анимационный движок на JS поверх After Effects.
Кто-то может назвать меня безумным изобретателем, ведь проще было просто сесть перед камерой. Но я «таков и больше никаков».
И да, это настоящий киберпанк — ведь я буквально себя оцифровал.
Теперь мои заметки в новых соцсетях представляет «лучшая версия меня» — в меру пиксельная, насколько возможно, харизматичная, но, надеюсь, всё-таки душевная, потому что собирается моими руками, моими костылями и моим упрямством, а не случайной ИИ-генерацией.
Итогом этого эксперимента стали три вертикальных видео, собранных из контента, который я ранее писал в своём ТГ.
С большой опаской я выложил их на все доступные видеоплощадки:
- ВКонтакте (раздел Клипы)
- YouTube (раздел Shorts)
- Instagram (раздел Reels)
- TikTok
Прямые ссылки на ролики не вставляю, чтобы не превращать статью в самопромо. Но при желании их легко найти на YouTube по названию из скринов.
Результаты внезапно меня приятно удивили — суммарный охват превысил 7 тысяч просмотров за 2 недели с нулевых аккаунтов.
И несложный вывод по этому маленькому эксперименту: вертикальные видеоплощадки действительно могут дать начинающему автору первые тысячи просмотров без рекламного бюджета и без уже собранной аудитории.
Но разброс между площадками оказался большим.
В моём тесте YouTube Shorts и Instagram Reels дали основной объём просмотров, TikTok сработал нестабильно, а VK Клипы почти не взлетели. Выборка маленькая, поэтому это не исследование рынка, а скорее полевой дневник одного самодельного аватара.
Ну а я продолжу свои исследования.
В планах: адаптировать программу под горизонтальный формат, чтобы проверить уже длинный жанр видео.
Спасибо за внимание!
Крайне надеюсь, что этот эксперимент вдохновит кого-то на создание своего контента.