Как я делал арт на конкурс в GPT Image 2: 4 неудачные версии и одна финальная
Участвовал в конкурсе ИИ-иллюстраций в стиле мурал-арт. Жанр: персонаж «нарисован» на стене, но взаимодействует с реальным пространством — протягивает руку, вылезает из кирпича, касается прохожих.
Когда увидел чужие работы — честно растерялся. Дракон, продирающийся сквозь кирпич так, что хотелось потрогать чешую. Богатырь, прикуривающий сигарету живому человеку на балконе. Девочка с лейкой, поливающая прохожих.
Соревноваться по красоте бессмысленно. Нужно было найти смысл.
Как я искал идею
Сначала пошёл к Claude — попросил сгенерировать концепции для мурал-арта. Идеи были хорошие, но в каждой чего-то не хватало — не было той изюминки, с которой можно конкурировать с сильными работами.
Начал думать сам. Придумал изобразить кенгуру, которая нарисована на стене и просит милостыню, из стены торчит объемная сумка.
Вернулся к Claude — описал идею, попросил написать промпты. Он написал, я доработал вручную и пошёл генерировать в GPT Image 2.
Итерация 1 — базовая композиция
Просто кенгуру с сумкой. Технически мурал работает: плоский персонаж, объёмная сумка. Но смысла — ноль. Выглядит слишком просто и скучно.
Технически: чтобы GPT Image 2 держал разницу между плоским муралом и объёмным элементом, это нужно прописывать явно для каждого объекта в промпте. Без этого модель сама решает, что где — и обычно решает неправильно.
Итерация 2 — добавил прохожего
Появилось взаимодействие между стеной и реальным миром — это и есть механика жанра. Но всё равно было ощущение, что я рассказываю анекдот без панчлайна.
Технически: добавление нового персонажа в готовую сцену на первом изображении не сработало бы как нужно из-за ракурса и композиции. Нужно было сгенерировать всю сцену заново с учётом новых условий.
Итерация 3 — добавил кенгурёнка и женщин с сумками
Придумал следующее: сумка кенгуру биологически предназначена для детёныша. Если мама использует её для сбора денег — ему некуда деться. Добавил его рядом. И рядом добавил трёх женщин с дорогими сумками, которые насмехаются над кенгуру.
Появился второй смысловой слой. Но версия не удалась:
Проблема 1 — эмоции. Женщины смеются слишком явно и неестественно. Выглядит карикатурно, не так, как задумывал.
Проблема 2 — реальные бренды. GPT Image 2 сам нарисовал на сумках узнаваемые логотипы. Использовать их нельзя — ни юридически, ни этически. Это все же нечестно по отношению к брендам, да и речь тут не про бренды, а про проблемы современного общества.
Проблема 3 — слишком сжатая картинка, выглядит перезагруженно.
Итерация 4 — витрина, новые бренды, широкий формат
Добавил витрину бутика дорогих сумок на фоне, заменил бренды на вымышленные: Pravda, Façade, Mirage. Сделал широкоформатное изображение, убрал слишком явный смех у проходящих мимо девушек. Далее было много неудачных генераций, прикладываю одну из них, чтобы разобрать
Здесь уже возникли новые технические проблемы: кенгуру стал полностью объёмным и потерял плоскость стены. Девушки с сумками здесь как будто находятся за стеной и не видят основных персонажей. У кенгуру в сумке — гора денег, что противоречит смыслу сцены. Когда в промпте одновременно слишком много противоречивых условий — «этот плоский, этот объёмный, они в разных пространствах, но взаимодействуют» — модель жертвует одним из них. Обычно именно тем, которое сложнее всего удержать.
Итерация 5 — финал
Все элементы на месте: кенгуру-мурал, кенгурёнок рядом, витрина с вымышленными брендами, женщины с дорогими сумками — и бедная пожилая женщина, которая кладёт монету в сумку. Все равно не идеально, есть что исправить, но на тот момент уже пришло время сдачи работ.
Результат конкурса
Троих победителей выбирал алгоритм ИИ — в тройку я не попал. Но зато попал в тройку лучших по выбору живого человека.
Смысл считывается людьми лучше, чем алгоритмами. По крайней мере пока.
Пять технических выводов:
- Чем сложнее сцена, тем выше риск потерять контроль над отдельными условиями. Лучше не пытаться описать всё сразу в одном промпте. Я строил сцену поэтапно: сначала базовая композиция, потом каждый раз добавлял новый элемент и генерировал заново. Это помогает понять, на каком именно шаге что-то пошло не так.
- Иногда лучше при неудачной генерации переделать промпт полностью, иногда — прикрепить неудачное изображение и попросить нейросеть изменить конкретную деталь, оставив остальное без изменений.
- ИИ может не учесть юридические и этические нормы — пришлось придумывать, как заменить бренды и явно указывать это в промпте.
- ИИ может сгенерировать очень классные идеи, их вполне можно использовать, когда не хватает времени. Или можно этими идеями вдохновляться и придумать что-то свое.
- Текстовые нейросети прекрасно служат для того, чтобы генерировать промпты для изображений. Но данные промпты всегда лучше перечитывать и улучшать вручную.
Прикладываю финальный промпт, из которого получилась итоговая версия работы:
А как вы думаете, почему алгоритм ИИ выбрал других победителей, а живой человек — мою работу?
Пишу про такие кейсы в Telegram-канале о применении ИИ в реальной жизни — реальный опыт, без воды