Как я делал арт на конкурс в GPT Image 2: 4 неудачные версии и одна финальная

Участвовал в конкурсе ИИ-иллюстраций в стиле мурал-арт. Жанр: персонаж «нарисован» на стене, но взаимодействует с реальным пространством — протягивает руку, вылезает из кирпича, касается прохожих.

Когда увидел чужие работы — честно растерялся. Дракон, продирающийся сквозь кирпич так, что хотелось потрогать чешую. Богатырь, прикуривающий сигарету живому человеку на балконе. Девочка с лейкой, поливающая прохожих.

Соревноваться по красоте бессмысленно. Нужно было найти смысл.

Как я искал идею

Сначала пошёл к Claude — попросил сгенерировать концепции для мурал-арта. Идеи были хорошие, но в каждой чего-то не хватало — не было той изюминки, с которой можно конкурировать с сильными работами.

Начал думать сам. Придумал изобразить кенгуру, которая нарисована на стене и просит милостыню, из стены торчит объемная сумка.

Вернулся к Claude — описал идею, попросил написать промпты. Он написал, я доработал вручную и пошёл генерировать в GPT Image 2.

Итерация 1 — базовая композиция

Версия 1 - просто кенгуру с сумкой
Версия 1 - просто кенгуру с сумкой

Просто кенгуру с сумкой. Технически мурал работает: плоский персонаж, объёмная сумка. Но смысла — ноль. Выглядит слишком просто и скучно.

Технически: чтобы GPT Image 2 держал разницу между плоским муралом и объёмным элементом, это нужно прописывать явно для каждого объекта в промпте. Без этого модель сама решает, что где — и обычно решает неправильно.

Итерация 2 — добавил прохожего

Версия 2 - прохожий кладет монету в сумку
Версия 2 - прохожий кладет монету в сумку

Появилось взаимодействие между стеной и реальным миром — это и есть механика жанра. Но всё равно было ощущение, что я рассказываю анекдот без панчлайна.

Технически: добавление нового персонажа в готовую сцену на первом изображении не сработало бы как нужно из-за ракурса и композиции. Нужно было сгенерировать всю сцену заново с учётом новых условий.

Итерация 3 — добавил кенгурёнка и женщин с сумками

Придумал следующее: сумка кенгуру биологически предназначена для детёныша. Если мама использует её для сбора денег — ему некуда деться. Добавил его рядом. И рядом добавил трёх женщин с дорогими сумками, которые насмехаются над кенгуру.

Версия 3 - добавил кенгуренка, бедную женщину, женщин с сумочками
Версия 3 - добавил кенгуренка, бедную женщину, женщин с сумочками

Появился второй смысловой слой. Но версия не удалась:

Проблема 1 — эмоции. Женщины смеются слишком явно и неестественно. Выглядит карикатурно, не так, как задумывал.

Проблема 2 — реальные бренды. GPT Image 2 сам нарисовал на сумках узнаваемые логотипы. Использовать их нельзя — ни юридически, ни этически. Это все же нечестно по отношению к брендам, да и речь тут не про бренды, а про проблемы современного общества.

Проблема 3 — слишком сжатая картинка, выглядит перезагруженно.

Итерация 4 — витрина, новые бренды, широкий формат

Добавил витрину бутика дорогих сумок на фоне, заменил бренды на вымышленные: Pravda, Façade, Mirage. Сделал широкоформатное изображение, убрал слишком явный смех у проходящих мимо девушек. Далее было много неудачных генераций, прикладываю одну из них, чтобы разобрать

Версия 4 - полная, но все еще неудачная генерация
Версия 4 - полная, но все еще неудачная генерация

Здесь уже возникли новые технические проблемы: кенгуру стал полностью объёмным и потерял плоскость стены. Девушки с сумками здесь как будто находятся за стеной и не видят основных персонажей. У кенгуру в сумке — гора денег, что противоречит смыслу сцены. Когда в промпте одновременно слишком много противоречивых условий — «этот плоский, этот объёмный, они в разных пространствах, но взаимодействуют» — модель жертвует одним из них. Обычно именно тем, которое сложнее всего удержать.

Итерация 5 — финал

Финальная версия
Финальная версия

Все элементы на месте: кенгуру-мурал, кенгурёнок рядом, витрина с вымышленными брендами, женщины с дорогими сумками — и бедная пожилая женщина, которая кладёт монету в сумку. Все равно не идеально, есть что исправить, но на тот момент уже пришло время сдачи работ.

Результат конкурса

Троих победителей выбирал алгоритм ИИ — в тройку я не попал. Но зато попал в тройку лучших по выбору живого человека.

Смысл считывается людьми лучше, чем алгоритмами. По крайней мере пока.

Пять технических выводов:

  1. Чем сложнее сцена, тем выше риск потерять контроль над отдельными условиями. Лучше не пытаться описать всё сразу в одном промпте. Я строил сцену поэтапно: сначала базовая композиция, потом каждый раз добавлял новый элемент и генерировал заново. Это помогает понять, на каком именно шаге что-то пошло не так.
  2. Иногда лучше при неудачной генерации переделать промпт полностью, иногда — прикрепить неудачное изображение и попросить нейросеть изменить конкретную деталь, оставив остальное без изменений.
  3. ИИ может не учесть юридические и этические нормы — пришлось придумывать, как заменить бренды и явно указывать это в промпте.
  4. ИИ может сгенерировать очень классные идеи, их вполне можно использовать, когда не хватает времени. Или можно этими идеями вдохновляться и придумать что-то свое.
  5. Текстовые нейросети прекрасно служат для того, чтобы генерировать промпты для изображений. Но данные промпты всегда лучше перечитывать и улучшать вручную.

Прикладываю финальный промпт, из которого получилась итоговая версия работы:

Cinematic wide angle street photography, rainy evening, 16:9 composition. LEFT SIDE: Luxury boutique with warm golden lighting, elegant window display showing designer handbags on white pedestals, large golden "PRAVDA" signage in refined serif font (well visible and prominent), glass storefront reflecting street lights. CENTER: Old weathered brick wall with realistic street art - life-size kangaroo mother figure painted directly on the wall with natural brown/reddish-brown fur texture (in color, not monochrome), realistic fur details, wearing tattered dress, exhausted desperate expression, sad eyes, holding worn cardboard "HELP PLEASE" sign. Small frightened baby joey kangaroo with brown fur at bottom, cowering behind mother's leg, huge scared eyes looking up. IMPORTANT: Real 3D torn fabric pouch integrated INTO kangaroo's belly as natural marsupial pouch (part of kangaroo's body, not separate clothing item), worn patched fabric with holes, collecting coins. MURAL EFFECT (MOST IMPORTANT): The kangaroo and baby joey should be FLAT painted street art on the brick wall - a 2D mural, clearly painted on the wall surface with visible spray paint texture, NOT three-dimensional. However, the fabric pouch at the kangaroo's belly must be a REAL three-dimensional object - an actual worn torn burlap bag physically protruding from the wall (at least 4-6 inches deep), with clear shadows cast on the wall behind it, realistic fabric folds and texture. Only the pouch is 3D, everything else is flat painted mural. cangaroo must look realystic, not cartoon-like CENTER FOREGROUND: Elderly poor woman in worn grey coat and headscarf, weathered compassionate face with single tear, gently placing coin into kangaroo's fabric pouch with trembling wrinkled hands, simple cloth bag. RIGHT SIDE: Three wealthy elegant women in designer sunglasses and luxurious fur coats walking past at medium distance, one carrying black structured leather tote bag with visible "FAÇADE" logo in gold lettering another carrying cream quilted shoulder bag with visible "MIRAGE" branding in elegant script Women are leaning toward each other whispering, subtle smirk on lips, sidelong amused glance toward kangaroo, light mocking expression, sharing gossip about the scene. Wet rainy street, puddles reflecting golden boutique lights, moody overcast evening atmosphere, dramatic cinematic lighting contrast between warm shop interior and cold dark wet street, gritty urban texture, photorealistic, 8k quality, street photography aesthetic.

А как вы думаете, почему алгоритм ИИ выбрал других победителей, а живой человек — мою работу?

Пишу про такие кейсы в Telegram-канале о применении ИИ в реальной жизни — реальный опыт, без воды