ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Проверил GPT Image 2 на 5 задачах без перегенераций: сложная сцена, русский текст, точные количества и последовательное редактирование фото.

Тестирование ChatGPT для генерации изображений (ИИ GPT Image 2)
Тестирование ChatGPT для генерации изображений (ИИ GPT Image 2)

В поиске до сих пор встречаются инструкции, где для картинок предлагают выбирать GPT-4o или DALL·E и приводят фиксированные лимиты генераций. На 23 августа 2026 года актуальный режим OpenAI называется ChatGPT Images 2.0, а в API модель представлена как GPT Image 2. Поэтому я проверил текущую генерацию не на простых портретах, а на задачах, где важны точность промпта и сохранение исходника.

Для теста я использовал GPT Image 2 с доступом уровня Plus через агрегатор нейросетей без VPN. Было пять задач: сложная сцена с людьми и точным количеством объектов, русская афиша, предметная композиция, замена одного элемента на фотографии и три последовательные правки одного исходника. Повторных генераций не делал — ниже первые результаты каждого теста.

Главный вывод: сильная сторона GPT Image 2 не только в фотореализме. Гораздо полезнее то, как модель держит длинное техническое задание и насколько аккуратно меняет готовое изображение, не перерисовывая всё вокруг.

Стоит ли использовать ChatGPT для генерации изображений

Если нужно создать картинку в диалоге, а затем дорабатывать её обычными фразами, ChatGPT сейчас особенно интересен в задачах с большим числом условий.

По моим тестам:

  • Сложные промпты. Модель выдержала количество людей, роли, расположение объектов, свет и большую часть мелких требований в одной сцене.
  • Русский текст. Афиша с четырьмя заданными текстовыми блоками получилась без опечаток и лишних надписей.
  • Точные количества. Совпали цвета и число чашек, количество книг в стопках и расположение предметов.
  • Редактирование фото. Замена одной лампы прошла без заметного изменения человека, позы, стола и фоновой сцены.
  • Последовательные правки. После трёх изменений модель сохранила предыдущие правки и общий вид фотографии.

Граница тоже заметна: визуально правдоподобный специальный объект не обязательно фактически точен. Старинная иллюстрация папоротника выглядела убедительно, но как научный рисунок я бы её без проверки не использовал.

GPT Image 2 и ChatGPT Images 2.0 — почему встречаются два названия

В пользовательском интерфейсе OpenAI использует название ChatGPT Images 2.0 для актуальной генерации и редактирования изображений в ChatGPT. В каталоге API модель называется GPT Image 2 (gpt-image-2). OpenAI описывает её как модель для генерации и редактирования изображений с текстовыми и графическими входными данными.

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Это полезно помнить из-за устаревших гайдов. Сейчас картинку можно просто попросить создать в чате или открыть раздел «Картинки». Для редактирования можно загрузить существующее изображение и описать правку.

Отдельно OpenAI предлагает изображения с рассуждением — они доступны в Plus, Pro и Business. Результат куда достовернее бесплатного режима. В моих текстах использовался как раз этот режим.

Мои тесты GPT Image 2: пять задач без повторных генераций

Тесты собраны так, чтобы модель нельзя было оценить только по эстетике. В первом случае нужно одновременно удержать пять людей, конкретные действия, точные количества предметов, отражение и два источника света. В редактировании критерий другой: внести нужную правку и не испортить всё остальное.

Тест 1. Пять реставраторов, руки, взаимодействие и отражения

Промпт задавал ровно пять человек. Двое переносят позолоченную раму, женщина слева чистит скульптуру, мужчина на заднем плане работает с лампой возле картины, девушка справа пишет в блокноте. На столе требовались ровно две кисти, три банки с пигментами, увеличительный прибор и белая ткань.

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

В результате действительно пять человек, центральная пара держит раму с разных сторон, женщина работает со скульптурой, справа есть блокнот, а на столе соблюдены ключевые количества. Холодный свет из окна сочетается с тёплым искусственным, в стеклянной поверхности центральной рамы читаются отражения окна и людей. Руки и контакт с предметами выглядят естественно.

Слабое место — мужчина с лампой. Условие выполнено, но его действие читается менее однозначно, чем остальные роли. При большом числе микрозадач модель может сохранить нужный объект и позу, но не сделать действие идеально понятным зрителю.

Полный промпт:

Создай реалистичную репортажную фотографию пяти реставраторов в большой мастерской старого музея. Ровно пять человек. В центре двое аккуратно переносят крупную позолоченную раму, удерживая её с разных сторон. Слева женщина в хлопковых перчатках очищает маленькую скульптуру кистью. На заднем плане мужчина стоит на низкой стремянке и направляет лампу на картину. Справа девушка записывает что-то карандашом в блокнот, одновременно придерживая рулон защитной бумаги локтем. На длинном рабочем столе: ровно две кисти, три небольшие банки с пигментами, один увеличительный прибор и белая ткань. Большое окно справа даёт холодный дневной свет, настольные лампы — тёплый. В стекле одной картины должны быть естественные отражения людей и окна. Живые позы, реалистичные руки, следы рабочей пыли, натуральная кожа и ткань. Никаких дополнительных людей, предметов или текста. Кадр должен выглядеть как настоящая журнальная фотография.

Тест 2. Русский текст внутри изображения

Я попросил вертикальную афишу выставки и потребовал использовать только четыре заданных текстовых блока: «ВЕЩИ, КОТОРЫЕ МОЛЧАТ», «Выставка предметного дизайна», даты и «Дом архитектуры».

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

На готовой афише все надписи читаются и совпадают с запросом, лишнего текста нет. Иерархия тоже выдержана: крупный заголовок, небольшая подпись и два нижних блока. Полупрозрачный дымчатый стул при этом выглядит как музейная предметная съёмка.

Для обложек, афиш и простых рекламных макетов это уже полезный сценарий. Но один удачный постер не доказывает безошибочность длинных абзацев или мелкой инфографики — такой текст всё равно нужно вычитывать.

Полный промпт:

Создай вертикальную афишу выставки предметного дизайна в стиле современной культурной институции. Фон — молочно-белый. Главный объект — необычный стул из полупрозрачного дымчатого стекла, сфотографированный как музейный экспонат. Много воздуха, строгая сетка, выразительная типографика. Используй только этот текст: Вверху крупно: «ВЕЩИ, КОТОРЫЕ МОЛЧАТ» Под заголовком: «Выставка предметного дизайна» Внизу слева: «5 сентября — 12 октября» Внизу справа: «Дом архитектуры» Все надписи должны быть написаны точно, без ошибок и лишнего текста. Заголовок — главный элемент, остальные блоки заметно меньше. Дизайн спокойный, дорогой, современный, без декоративных эффектов.

Тест 3. Точное количество объектов

В деревянном шкафу я задал три полки и жёсткие количества: четыре чашки определённых цветов, один будильник, одну грушу, одну прозрачную вазу с веткой и три стопки книг — две, три и одна книга.

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

GPT Image 2 выполнил раскладку точно. Чашки стоят в нужном порядке, объекты на средней полке размещены слева, по центру и справа, число книг совпадает с промптом. Предметы не пересекаются, а свет слева и слабые отражения на дереве выглядят правдоподобно.

Это полезнее обычного теста «нарисуй шкаф»: для карточек товара, визуальных инструкций и композиций количество и взаимное расположение объектов иногда критичны.

Полный промпт:

Создай реалистичную предметную фотографию открытого деревянного шкафа с тремя полками, снятого строго спереди. Верхняя полка: ровно четыре фарфоровые чашки в один ряд — белая, синяя, зелёная, чёрная. Средняя полка: в центре старый латунный будильник. Слева от него лежит одна груша. Справа стоит прозрачная ваза с одной сухой веткой. Нижняя полка: ровно три одинаковые стопки книг. В левой — две книги, в центральной — три, в правой — одна. Никаких других предметов. Мягкий дневной свет слева. Полированное дерево даёт слабые естественные отражения. Все предметы должны физически правильно стоять на полках, не пересекаться и не менять заданное количество.

Тест 4. Изменить только один объект на готовой фотографии

Задача: заменить обычную настольную лампу на зелёный банковский светильник с латунной ножкой и ничего больше не менять.

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Визуально правка получилась почти локальной. Светильник встал на то же место, его свет согласован со сценой. Лицо, руки, поза мужчины, книги, бумаги и фон не получили заметных посторонних изменений. Для генеративного редактора это важный результат: модель не использовала правку как повод пересобрать весь кадр.

При этом OpenAI предупреждает, что выделение области не всегда точное и изменения могут выходить за её границы. Для коммерческих исходников результат стоит сравнивать с оригиналом, особенно по лицам, логотипам и мелким деталям.

Полный промпт и исходное изображение:

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото
Измени только один элемент исходной фотографии: замени настольную лампу на столе на небольшой зелёный банковский светильник с латунной ножкой. Сохрани без изменений всё остальное: человека, лицо, позу, руки, одежду, стол, бумаги, книги, фон, свет, тени, отражения, композицию и глубину резкости. Новый светильник должен стоять точно на месте старого и естественно вписываться в существующее освещение. Ничего больше не меняй.

Тест 5. Три последовательные правки одного изображения

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

На одном фото я последовательно попросил:

  1. Заменить только картину на старое ботаническое изображение папоротника.
  2. Заменить только белую рубашку на тёмно-синюю льняную.
  3. Добавить на край стола маленькую керамическую чашку с чёрным кофе.
ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Промпт:

Замени только картину на стене на большое старое ботаническое изображение папоротника в тонкой деревянной раме. Всё остальное оставь без изменений.
ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Промпт:

Теперь замени только рубашку человека на тёмно-синюю льняную. Лицо, поза, руки, фон, картина, свет и все предметы должны остаться прежними.
ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Промпт:

Добавь на край стола маленькую керамическую чашку с чёрным кофе. Не меняй ничего другого, включая человека, одежду, картину, расположение предметов, свет и композицию.

Каждая следующая правка сохранила предыдущую. После смены рубашки ботаническая картина осталась на месте; после добавления кофе сохранились и картина, и новая одежда. Лицо, поза, книга, фон и композиция визуально не «поплыли». Чашка получила подходящий масштаб, тень и освещение и не выглядит наклеенным объектом.

Оговорка — ботаническая гравюра правдоподобна визуально, но её биологическую точность я не проверял (надо бы загуглить виды папоротников..). Это хороший пример границы: реалистичный вид не равен фактической достоверности - проверяйте то, что режет глаз. Для схем, исторических деталей, растений, медицинских и технических объектов содержание нужно проверять отдельно.

Что тесты говорят о реальной работе с GPT Image 2

У модели проявился довольно ясный профиль. Лучше всего она смотрится там, где изображением нужно управлять через ограничения: количество, расположение, точные строки текста, сохранение лица или запрет менять остальную сцену.

Для меня наиболее практичны три вещи:

  • Instruction following: сложное ТЗ можно передать одним нормальным промптом, а не набором ключевых слов.
  • Точечное редактирование: команда «измени только X, всё остальное сохрани» в тестах действительно ограничивала правку.
  • Контекст между итерациями: несколько последовательных изменений можно делать в одном диалоге, не восстанавливая сцену заново.

Слабые места — пограничные. Действие человека может быть менее выразительным, чем требовалось, а специальный объект — убедительным, но не обязательно фактически точным. То есть GPT Image 2 я бы доверял как визуальному редактору, но не как источнику справочной истины.

Как создать картинку в ChatGPT и написать нормальный промпт

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

В актуальном ChatGPT можно написать запрос прямо в диалоге либо открыть раздел «Картинки». Для редактирования загрузите существующее изображение и опишите, что изменить; при необходимости выделите область. OpenAI также позволяет выбрать соотношение сторон или указать его в запросе.

Для генерации с нуля достаточно четырёх блоков:

сцена + обязательные объекты и действия + свет/стиль + ограничения

Например:

Реалистичная предметная фотография деревянного шкафа строго спереди. На верхней полке ровно четыре чашки: белая, синяя, зелёная и чёрная. Мягкий дневной свет слева. Никаких других предметов.

Если нужен текст, перечисляйте точные строки и отдельно запретите добавлять что-то ещё:

Используй только этот текст: «...». Все надписи должны быть написаны точно, без ошибок и лишних слов.

Для редактирования особенно хорошо сработала конструкция:

Измени только [объект]. Сохрани без изменений [лицо, позу, фон, свет, остальные предметы]. Ничего больше не меняй.

Она задаёт не только действие, но и зону, которую модель не должна трогать. А вот длинные наборы из 8K, masterpiece, ultra detailed и десятков эпитетов сами по себе точность задания не повышают.

Бесплатная генерация, Plus, лимиты и доступ из России

По актуальной справке OpenAI, ChatGPT Images 2.0 доступны на всех тарифах, включая бесплатный. Платные планы дают более высокие лимиты, а изображения с рассуждением доступны в Plus, Pro и Business. На Free генерация изображений имеет отдельные ограничения. OpenAI не фиксирует в справке универсальное число картинок в сутки, гарантированное всем пользователям.

ChatGPT Plus на момент проверки стоит $20 в месяц. OpenAI отдельно пишет, что лимиты Plus могут меняться, поэтому цифры вроде «ровно 50 картинок за три часа» я бы не использовал как постоянную характеристику тарифа. API в подписку Plus не входит и оплачивается отдельно.

Для России ситуация отдельная. Россия отсутствует в актуальном списке поддерживаемых OpenAI стран; компания предупреждает, что доступ из неподдерживаемого региона может привести к блокировке или приостановке аккаунта.

Мои тесты проводились через агрегатор с доступом к GPT Image 2 без VPN, а не через прямую регистрацию российского аккаунта в OpenAI.

Кому я бы выбрал GPT Image 2, а когда сравнивал бы другие генераторы

GPT Image 2 особенно логичен, если картинка — часть диалога: создать основу, указать конкретную ошибку, заменить предмет, сохранить лицо, затем внести ещё одну правку. По этим тестам такой итерационный workflow выглядит убедительнее обычной схемы «новый промпт — новая картинка с нуля».

ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото

Я бы рассматривал его в первую очередь для обложек и постеров с коротким текстом, фотореалистичных сцен со сложным ТЗ, предметных композиций с точным количеством объектов и редактирования существующих фотографий.

Другие генераторы стоит сравнивать, если главный критерий — конкретная художественная эстетика, массовая пакетная генерация, специализированный production-пайплайн или стоимость через API. Мои пять тестов эти сценарии не измеряют, поэтому объявлять GPT Image 2 «лучшей нейросетью для картинок вообще» было бы необоснованно.

Итог

После этого теста я бы выбирал ChatGPT для генерации изображений прежде всего тогда, когда картинку нужно контролировать словами, а не просто получить красивый первый вариант. GPT Image 2 хорошо выдержал сложную сцену, точные количества, русский текст и несколько точечных правок без заметного разрушения исходника.

Проверять всё же стоит две вещи: фактически значимые детали и сохранность исходника после редактирования. С этой оговоркой ChatGPT Images 2.0 уже выглядит не только как генератор иллюстраций, но и как практичный редактор для повседневного контента.

Реклама. ООО «ДИДЖИТАЛ ГЕНИУС». ИНН 7813681158