ChatGPT для генерации изображений: тест GPT Image 2 на сложных промптах и редактировании фото
Проверил GPT Image 2 на 5 задачах без перегенераций: сложная сцена, русский текст, точные количества и последовательное редактирование фото.
В поиске до сих пор встречаются инструкции, где для картинок предлагают выбирать GPT-4o или DALL·E и приводят фиксированные лимиты генераций. На 23 августа 2026 года актуальный режим OpenAI называется ChatGPT Images 2.0, а в API модель представлена как GPT Image 2. Поэтому я проверил текущую генерацию не на простых портретах, а на задачах, где важны точность промпта и сохранение исходника.
Для теста я использовал GPT Image 2 с доступом уровня Plus через агрегатор нейросетей без VPN. Было пять задач: сложная сцена с людьми и точным количеством объектов, русская афиша, предметная композиция, замена одного элемента на фотографии и три последовательные правки одного исходника. Повторных генераций не делал — ниже первые результаты каждого теста.
Главный вывод: сильная сторона GPT Image 2 не только в фотореализме. Гораздо полезнее то, как модель держит длинное техническое задание и насколько аккуратно меняет готовое изображение, не перерисовывая всё вокруг.
Стоит ли использовать ChatGPT для генерации изображений
Если нужно создать картинку в диалоге, а затем дорабатывать её обычными фразами, ChatGPT сейчас особенно интересен в задачах с большим числом условий.
По моим тестам:
- Сложные промпты. Модель выдержала количество людей, роли, расположение объектов, свет и большую часть мелких требований в одной сцене.
- Русский текст. Афиша с четырьмя заданными текстовыми блоками получилась без опечаток и лишних надписей.
- Точные количества. Совпали цвета и число чашек, количество книг в стопках и расположение предметов.
- Редактирование фото. Замена одной лампы прошла без заметного изменения человека, позы, стола и фоновой сцены.
- Последовательные правки. После трёх изменений модель сохранила предыдущие правки и общий вид фотографии.
Граница тоже заметна: визуально правдоподобный специальный объект не обязательно фактически точен. Старинная иллюстрация папоротника выглядела убедительно, но как научный рисунок я бы её без проверки не использовал.
GPT Image 2 и ChatGPT Images 2.0 — почему встречаются два названия
В пользовательском интерфейсе OpenAI использует название ChatGPT Images 2.0 для актуальной генерации и редактирования изображений в ChatGPT. В каталоге API модель называется GPT Image 2 (gpt-image-2). OpenAI описывает её как модель для генерации и редактирования изображений с текстовыми и графическими входными данными.
Это полезно помнить из-за устаревших гайдов. Сейчас картинку можно просто попросить создать в чате или открыть раздел «Картинки». Для редактирования можно загрузить существующее изображение и описать правку.
Отдельно OpenAI предлагает изображения с рассуждением — они доступны в Plus, Pro и Business. Результат куда достовернее бесплатного режима. В моих текстах использовался как раз этот режим.
Мои тесты GPT Image 2: пять задач без повторных генераций
Тесты собраны так, чтобы модель нельзя было оценить только по эстетике. В первом случае нужно одновременно удержать пять людей, конкретные действия, точные количества предметов, отражение и два источника света. В редактировании критерий другой: внести нужную правку и не испортить всё остальное.
Тест 1. Пять реставраторов, руки, взаимодействие и отражения
Промпт задавал ровно пять человек. Двое переносят позолоченную раму, женщина слева чистит скульптуру, мужчина на заднем плане работает с лампой возле картины, девушка справа пишет в блокноте. На столе требовались ровно две кисти, три банки с пигментами, увеличительный прибор и белая ткань.
В результате действительно пять человек, центральная пара держит раму с разных сторон, женщина работает со скульптурой, справа есть блокнот, а на столе соблюдены ключевые количества. Холодный свет из окна сочетается с тёплым искусственным, в стеклянной поверхности центральной рамы читаются отражения окна и людей. Руки и контакт с предметами выглядят естественно.
Слабое место — мужчина с лампой. Условие выполнено, но его действие читается менее однозначно, чем остальные роли. При большом числе микрозадач модель может сохранить нужный объект и позу, но не сделать действие идеально понятным зрителю.
Полный промпт:
Тест 2. Русский текст внутри изображения
Я попросил вертикальную афишу выставки и потребовал использовать только четыре заданных текстовых блока: «ВЕЩИ, КОТОРЫЕ МОЛЧАТ», «Выставка предметного дизайна», даты и «Дом архитектуры».
На готовой афише все надписи читаются и совпадают с запросом, лишнего текста нет. Иерархия тоже выдержана: крупный заголовок, небольшая подпись и два нижних блока. Полупрозрачный дымчатый стул при этом выглядит как музейная предметная съёмка.
Для обложек, афиш и простых рекламных макетов это уже полезный сценарий. Но один удачный постер не доказывает безошибочность длинных абзацев или мелкой инфографики — такой текст всё равно нужно вычитывать.
Полный промпт:
Тест 3. Точное количество объектов
В деревянном шкафу я задал три полки и жёсткие количества: четыре чашки определённых цветов, один будильник, одну грушу, одну прозрачную вазу с веткой и три стопки книг — две, три и одна книга.
GPT Image 2 выполнил раскладку точно. Чашки стоят в нужном порядке, объекты на средней полке размещены слева, по центру и справа, число книг совпадает с промптом. Предметы не пересекаются, а свет слева и слабые отражения на дереве выглядят правдоподобно.
Это полезнее обычного теста «нарисуй шкаф»: для карточек товара, визуальных инструкций и композиций количество и взаимное расположение объектов иногда критичны.
Полный промпт:
Тест 4. Изменить только один объект на готовой фотографии
Задача: заменить обычную настольную лампу на зелёный банковский светильник с латунной ножкой и ничего больше не менять.
Визуально правка получилась почти локальной. Светильник встал на то же место, его свет согласован со сценой. Лицо, руки, поза мужчины, книги, бумаги и фон не получили заметных посторонних изменений. Для генеративного редактора это важный результат: модель не использовала правку как повод пересобрать весь кадр.
При этом OpenAI предупреждает, что выделение области не всегда точное и изменения могут выходить за её границы. Для коммерческих исходников результат стоит сравнивать с оригиналом, особенно по лицам, логотипам и мелким деталям.
Полный промпт и исходное изображение:
Тест 5. Три последовательные правки одного изображения
На одном фото я последовательно попросил:
- Заменить только картину на старое ботаническое изображение папоротника.
- Заменить только белую рубашку на тёмно-синюю льняную.
- Добавить на край стола маленькую керамическую чашку с чёрным кофе.
Промпт:
Промпт:
Промпт:
Каждая следующая правка сохранила предыдущую. После смены рубашки ботаническая картина осталась на месте; после добавления кофе сохранились и картина, и новая одежда. Лицо, поза, книга, фон и композиция визуально не «поплыли». Чашка получила подходящий масштаб, тень и освещение и не выглядит наклеенным объектом.
Оговорка — ботаническая гравюра правдоподобна визуально, но её биологическую точность я не проверял (надо бы загуглить виды папоротников..). Это хороший пример границы: реалистичный вид не равен фактической достоверности - проверяйте то, что режет глаз. Для схем, исторических деталей, растений, медицинских и технических объектов содержание нужно проверять отдельно.
Что тесты говорят о реальной работе с GPT Image 2
У модели проявился довольно ясный профиль. Лучше всего она смотрится там, где изображением нужно управлять через ограничения: количество, расположение, точные строки текста, сохранение лица или запрет менять остальную сцену.
Для меня наиболее практичны три вещи:
- Instruction following: сложное ТЗ можно передать одним нормальным промптом, а не набором ключевых слов.
- Точечное редактирование: команда «измени только X, всё остальное сохрани» в тестах действительно ограничивала правку.
- Контекст между итерациями: несколько последовательных изменений можно делать в одном диалоге, не восстанавливая сцену заново.
Слабые места — пограничные. Действие человека может быть менее выразительным, чем требовалось, а специальный объект — убедительным, но не обязательно фактически точным. То есть GPT Image 2 я бы доверял как визуальному редактору, но не как источнику справочной истины.
Как создать картинку в ChatGPT и написать нормальный промпт
В актуальном ChatGPT можно написать запрос прямо в диалоге либо открыть раздел «Картинки». Для редактирования загрузите существующее изображение и опишите, что изменить; при необходимости выделите область. OpenAI также позволяет выбрать соотношение сторон или указать его в запросе.
Для генерации с нуля достаточно четырёх блоков:
Например:
Если нужен текст, перечисляйте точные строки и отдельно запретите добавлять что-то ещё:
Используй только этот текст: «...». Все надписи должны быть написаны точно, без ошибок и лишних слов.
Для редактирования особенно хорошо сработала конструкция:
Она задаёт не только действие, но и зону, которую модель не должна трогать. А вот длинные наборы из 8K, masterpiece, ultra detailed и десятков эпитетов сами по себе точность задания не повышают.
Бесплатная генерация, Plus, лимиты и доступ из России
По актуальной справке OpenAI, ChatGPT Images 2.0 доступны на всех тарифах, включая бесплатный. Платные планы дают более высокие лимиты, а изображения с рассуждением доступны в Plus, Pro и Business. На Free генерация изображений имеет отдельные ограничения. OpenAI не фиксирует в справке универсальное число картинок в сутки, гарантированное всем пользователям.
ChatGPT Plus на момент проверки стоит $20 в месяц. OpenAI отдельно пишет, что лимиты Plus могут меняться, поэтому цифры вроде «ровно 50 картинок за три часа» я бы не использовал как постоянную характеристику тарифа. API в подписку Plus не входит и оплачивается отдельно.
Для России ситуация отдельная. Россия отсутствует в актуальном списке поддерживаемых OpenAI стран; компания предупреждает, что доступ из неподдерживаемого региона может привести к блокировке или приостановке аккаунта.
Мои тесты проводились через агрегатор с доступом к GPT Image 2 без VPN, а не через прямую регистрацию российского аккаунта в OpenAI.
Кому я бы выбрал GPT Image 2, а когда сравнивал бы другие генераторы
GPT Image 2 особенно логичен, если картинка — часть диалога: создать основу, указать конкретную ошибку, заменить предмет, сохранить лицо, затем внести ещё одну правку. По этим тестам такой итерационный workflow выглядит убедительнее обычной схемы «новый промпт — новая картинка с нуля».
Я бы рассматривал его в первую очередь для обложек и постеров с коротким текстом, фотореалистичных сцен со сложным ТЗ, предметных композиций с точным количеством объектов и редактирования существующих фотографий.
Другие генераторы стоит сравнивать, если главный критерий — конкретная художественная эстетика, массовая пакетная генерация, специализированный production-пайплайн или стоимость через API. Мои пять тестов эти сценарии не измеряют, поэтому объявлять GPT Image 2 «лучшей нейросетью для картинок вообще» было бы необоснованно.
Итог
После этого теста я бы выбирал ChatGPT для генерации изображений прежде всего тогда, когда картинку нужно контролировать словами, а не просто получить красивый первый вариант. GPT Image 2 хорошо выдержал сложную сцену, точные количества, русский текст и несколько точечных правок без заметного разрушения исходника.
Проверять всё же стоит две вещи: фактически значимые детали и сохранность исходника после редактирования. С этой оговоркой ChatGPT Images 2.0 уже выглядит не только как генератор иллюстраций, но и как практичный редактор для повседневного контента.
Реклама. ООО «ДИДЖИТАЛ ГЕНИУС». ИНН 7813681158