Про то, как я оцифровал себя без ИИ, чтобы стать видеоблогером

Про то, как я оцифровал себя без ИИ, чтобы стать видеоблогером

В общем, мой каминг-аут: я человек, не созданный для камеры, но почему-то всё равно желающий творческого выброса и немного славы.

Именно поэтому я стал вести блог — про работу, хобби и всякое странное, что копится в голове. Ничего не продаю, просто рассказываю о своей практике и наблюдениях.

Изначально я выбрал ТГ и ВК как единственные площадки, где текст ещё хоть как-то котируется, и почти сразу больно ударился о проблему органического трафика.

Что ж, подумал я, бессмысленно «идти против ветра». Надо смотреть туда, где органики сильно больше и где есть шанс показаться новым людям.

А такие площадки сейчас почти полностью построены на видеоконтенте. По-другому никак: хочешь попасть в ранжирование алгоритмов — дай им вертикальный видос.

Так передо мной встала инженерная задача:

как стать видеоблогером, если я не умею сидеть перед камерой, не люблю долгий техпроцесс создания видео и в принципе не обладаю свободным временем, чтобы выделять отдельный день на съёмку и монтаж?

Короче, вводные такие, что если влезаешь в этот формат, то с головой. «А я женатый человек — мне нельзя в Бельдяжки».

Так я пришёл к идее создания своего виртуального аватара — системы, которая бы собирала мне видео из моих текстовых сценариев.

Идею генерации видео через ИИ я сразу отверг. Это крипово, ненадёжно и, как по мне, неуважительно к зрителю и читателю. Нейрослоп плодить не хочется.

Разведка существующих инструментов вроде 3D-витубер-аватаров тоже закончилась ничем. Кастомизация персонажа слабая, мимика примитивная, ощущение такое, будто ты выбираешь себе не цифровое лицо, а скин в Роблоксе.

Остался только один вариант — делать всё самому. То есть создать кастомного персонажа, который будет делать всё, что я захочу.

Архитектура проекта получилась примерно такой:

  • After Effects — финальная сборка, таймлайн и рендер
  • Photoshop — подготовка графических ассетов персонажа
  • набор PSD/PNG-ассетов для рта, глаз, мимики и слайдов
  • текстовый сценарий с управляющими тегами
  • аудиодорожка с моим голосом
  • файл разметки фраз из Audacity
  • кастомная JSX-панель для After Effects, которая собирает проект из всего этого

Важное уточнение: под “без ИИ” я имею в виду, что видео, персонаж, речь, мимика и монтаж не генерируются нейросетью. Это обычная графика, ручные ассеты, мой голос и скрипты поверх After Effects.

Небольшое отступление. Помимо набора профнавыков вроде программирования и дизайна, я давно увлекаюсь анимацией и даже успел немного поработать на ТВ в новостном блоке. То есть видеомонтаж мне знаком. И я прекрасно понимаю, насколько долго делается кастомная анимация и почему лучше не трогать её без автоматизации.

Так я решил сделать свой движок лицевой анимации, который из текстового сценария расставляет мимику моего аватара, субтитры и собирает заготовку вертикального видео. А я потом быстро довожу её до ума в мелочах.

Ожидания по времени были простые:
то, что обычно занимало бы рабочий день, должно занимать пару часов. Столько я готов выделять на это хобби. Больше — уже не хобби, а новая работа без права на отдых.

Я почти сразу решил, что не буду делать вымышленного персонажа. Это же мой блог и мои мысли, поэтому честнее использовать своё настоящее изображение. Робот со своим лицом — это странно, но всё же честнее, чем прятаться за абстрактным маскотом.

Кадры из выпуска №2 
Кадры из выпуска №2 

Дальше начались тесты, пробы и сама разработка.

Я пошёл путём классической анимации: разделил персонажа на составляющие и начал заменять их под ситуацию. Сначала сделал набор основных положений губ для рта, потом набор глаз, потом появились более сложные штуки вроде случайного моргания.

Основные формы положений рта, которые покрывают почти весь алфавит (самое важное во всей анимации):

  • пауза, нейтральное лицо - рот закрыт или почти закрыт
  • м, п, б - губы плотно сомкнуты
  • а, я - рот открыт широко, вертикально
  • э, е, и, ы - рот растянут шире по горизонтали
  • о, ё - округлый рот, среднее открытие
  • у, ю - маленький округлый рот, губы вперёд
  • ф, в - верхние зубы/губа, лёгкое прикусывание нижней губы
  • ш, ж, ч, щ - узкий округлённый рот, почти “шипящий”
Раскладка аватара по слоям 
Раскладка аватара по слоям 

И вот появился первый прототип. Показываю его жене. Она внимательно смотрит и говорит, что всё это очень круто и технологично, но сам персонаж крайне кринжовый и будет пугать зрителя. Аватар слишком сильно попал в зловещую долину.

«То есть это будто бы ты, но ненастоящий», — цитата супруги.

Начальные пробы анимации, специально сохранил для всеобщего развлечения.

Размышляя над этой проблемой, я пришёл к компромиссу: стилизовать изначально реалистичную фотографию под пиксельное ретро. Чтобы результат больше напоминал персонажа из игры, чем человека. Такому можно простить несовершенство анимации.

Тестовые показы всех удовлетворили. Аватар уже не пугал. А это, согласитесь, важный этап любого творческого проекта: сначала перестать пугать близких.

Кадры из выпуска №3 
Кадры из выпуска №3 

Виртуальный «я» уже умел шевелить ртом под буквы и показывать базовую мимику. Сначала я вручную помечал начала слов на таймлайне, а анимация строила набор ключевых кадров под каждую букву. Уже нифига себе уровень: по губам аватара можно было читать текст.

Но тут вскрылась проблема. Разметить 10–15 слов — вообще не вопрос. А вот текст для 30-секундного ролика меня вымотал. Всё ещё слишком много ручного труда.

Была попытка привязать ключевые кадры гласных к пикам звуковой дорожки, но в живой речи звуки часто слипаются. Если где-то в начале проглотишь букву, дальше вся разметка начинает деградировать по нарастающей.

Поэтому через несколько версий я пришёл к более рабочему варианту. В момент записи речи я явно оставлял большие паузы между предложениями. Это делило звук на сегменты-предложения. Потом программа соотносила предложения звука с предложениями текста, а анализатор пиков уже помогал примерно размечать буквы внутри фразы.

Разметка предложений происходит сразу после записи в Audacity парой кликов — крайне быстро. 
Разметка предложений происходит сразу после записи в Audacity парой кликов — крайне быстро. 

Так получилось, что губы не шевелились в паузах и примерно попадали в звуки слов. Не идеальный лип-синк, но достаточный для работы. И главное — почти без затрат для оператора. Разметить 10 предложений в звуке — это пара минут.

Так движок анимации дошёл до следующего уровня: речь аватара начала собираться в анимацию почти без ручной разметки.

Скрин админ-панели, которая собирает из текста начальную болванку 
Скрин админ-панели, которая собирает из текста начальную болванку 

А когда у тебя на руках появляется работающий движок, остановиться уже сложно. Он уже мог бы просто заменить диктора в новостях, но мне, конечно, стало мало. Я захотел сделать его не диктором, а настоящим актёром, чтобы он делал в кадре всякое по команде.

Поэтому дальше я сконцентрировался на том, чтобы персонаж понимал команды из текстового сценария. Мимика разрослась, появилась система движения по кадру, а сам сценарий начал управлять аватаром через теги.

Например, кусок сценария теперь выглядит примерно так:

//ФРАЗА-1-начало// [слайд 1 шаблон 1] [пауза 0.3 размышление] Живём в какое-то [моргнуть] особенно безумное время. [пауза 0.4 недовольство] [слайд убрать] //ФРАЗА-1-конец//

Наблюдательный читатель мог заметить, что там есть ещё и теги слайдов. Они тоже предмет моей гордости. Программа сканирует длительность блоков речи и пауз, а потом автоматически расставляет на таймлайне заготовки для слайдов в верхней части видео.

Примеры тегов:

[пауза 0.3 размышление] — вставить паузу и включить мимику размышления [моргнуть] — принудительное моргание [слайд 1 шаблон 1] — создать слайд из шаблона [слайд убрать] — убрать текущий слайд

То есть получается уже настоящий сторителлинг: аватар говорит, слайды сменяются, титры появляются, мимика работает, а я не сижу восемь часов и не двигаю каждый слой руками.

Кадры из выпуска №1 
Кадры из выпуска №1 

Итак, цель удалось достичь: 30-секундный ролик из 10 предложений и 5–6 слайдов теперь собирается примерно за 1-2 часа, а не за день.

Что получилось автоматизировать:

  • разбор сценария с тегами
  • расстановку фраз по аудио
  • переключение ассетов рта
  • мимику глаз
  • случайное и принудительное моргание
  • движение персонажа по кадру
  • генерацию слайдов
  • субтитры
  • сборку начальной композиции в After Effects

Что осталось ручным:

  • запись голоса
  • подготовка текста
  • проверка таймингов
  • финальная правка слайдов
  • экспорт
  • публикация

Правда, чтобы это сделать, пришлось по сути написать кастомный анимационный движок на JS поверх After Effects.

Кто-то может назвать меня безумным изобретателем, ведь проще было просто сесть перед камерой. Но я «таков и больше никаков».

И да, это настоящий киберпанк — ведь я буквально себя оцифровал.

Теперь мои заметки в новых соцсетях представляет «лучшая версия меня» — в меру пиксельная, насколько возможно, харизматичная, но, надеюсь, всё-таки душевная, потому что собирается моими руками, моими костылями и моим упрямством, а не случайной ИИ-генерацией.

Итогом этого эксперимента стали три вертикальных видео, собранных из контента, который я ранее писал в своём ТГ.

С большой опаской я выложил их на все доступные видеоплощадки:

  • ВКонтакте (раздел Клипы)
  • YouTube (раздел Shorts)
  • Instagram (раздел Reels)
  • TikTok

Прямые ссылки на ролики не вставляю, чтобы не превращать статью в самопромо. Но при желании их легко найти на YouTube по названию из скринов.

Результаты внезапно меня приятно удивили — суммарный охват превысил 7 тысяч просмотров за 2 недели с нулевых аккаунтов.

//Результаты теста по соцсетям// [ВКонтакте / Клипы] Выпуск 001 — 10 просмотров Выпуск 002 — 94 просмотра Выпуск 003 — 39 просмотров Итого по ВКонтакте — 143 просмотра Вывод: почти не дал просмотров в этом тесте. [YouTube / Shorts] Выпуск 001 — 1036 просмотров Выпуск 002 — 1117 просмотров Выпуск 003 — 831 просмотр Итого по YouTube — 2984 просмотра Вывод: даёт просмотры. [Instagram / Reels] Выпуск 001 — 384 просмотра Выпуск 002 — 1250 просмотров Выпуск 003 — 1109 просмотров Итого по Instagram — 2743 просмотра Вывод: даёт просмотры. [TikTok] Выпуск 001 — 922 просмотра Выпуск 002 — 97 просмотров Выпуск 003 — 240 просмотров Итого по TikTok — 1259 просмотров Вывод: сработал нестабильно, но дал просмотры. [Итого по роликам] Выпуск 001 — 2352 просмотра Выпуск 002 — 2558 просмотров Выпуск 003 — 2219 просмотров Суммарный охват — 7129 просмотров
Статистика Ютуба 
Статистика Ютуба 

И несложный вывод по этому маленькому эксперименту: вертикальные видеоплощадки действительно могут дать начинающему автору первые тысячи просмотров без рекламного бюджета и без уже собранной аудитории.

Но разброс между площадками оказался большим.
В моём тесте YouTube Shorts и Instagram Reels дали основной объём просмотров, TikTok сработал нестабильно, а VK Клипы почти не взлетели. Выборка маленькая, поэтому это не исследование рынка, а скорее полевой дневник одного самодельного аватара.

Ну а я продолжу свои исследования.

В планах: адаптировать программу под горизонтальный формат, чтобы проверить уже длинный жанр видео.

Спасибо за внимание!
Крайне надеюсь, что этот эксперимент вдохновит кого-то на создание своего контента.

2