OpenAI GPT-Image-2 - первые утечки и изображения
4 апреля 2026 года OpenAI раздала всем желающим доступ к своей следующей модели генерации изображений.
LMSYS Chatbot Arena - это площадка, где пользователи слепо сравнивают модели, не зная их названий, и голосуют за лучший результат. Скажем так - это процедура для снятия объективных метрик. Но 4 апреля несколько пользователей заметили в арене три незнакомых имени в разделе генерации изображений:
- packingtape-alpha
- maskingtape-alpha
- gaffertape-alpha
Кодовые названия временные. Стандартная практика OpenAI (да и других разработчиков) для предрелизного теста - расшаривать свои модели на LMArena.
Что показали тесты
И результаты, откровенно говоря, неудобные для конкурентов.
Рендеринг текста. Исторически слабое место всех диффузионных моделей. GPT-Image-2 с этим справляется иначе.
Очень солидная часть моей работы - связана с контентом.
И вот 🔥это🔥 решение - экономит мне до 150$ в месяц. А по промокоду NEIROSKUF еще заберите горячую скидку в 15% на любой тариф
В сравнительных тестах packingtape-alpha корректно отрисовал время на циферблате и читаемый текст на стикере («call Mina at 9»). NBP (Nano Banana Pro) на том же промпте - неверное время.
Географически корректная карта мира с читаемыми подписями стран и рельефных объектов. Для генеративной модели - это нетривиально, потому что требует структурированных пространственных знаний, а не просто текстурного матчинга.
Модель стабильно воспроизводит сложные UI: сгенерированный YouTube-интерфейс с тесно стоящими превью, читаемыми заголовками («$0 to $10B», «Black Holes Explained», «The World in 2040») и корректной топологией страницы. Не просто похоже на YouTube - а именно YouTube, пиксель в пиксель по логике.
Анатомическая диаграмма мышц бедра с подписями - тест на то, умеет ли модель работать с точной технической графикой. Судя по скринам - умеет.
GPT-5х с нативной генерацией изображений - уже резко выбился из ряда диффузионных моделей именно за счёт того, что в нём текстовый и визуальный каналы работают внутри одного трансформера, а не как отдельные пайплайны.
GPT-Image-2, судя по всему, продолжает ту же линию, но глубже. Несколько паттернов в результатах указывают на это:
- Модель не просто рисует стол с предметами, она расставляет логически связанные объекты с учётом физики (солнечные блики на стакане с водой, тени).
- Карты, анатомия, интерфейсы - всё это требует не стилистической, а фактологической точности.
- Модель явно обучена на задачах, где текст в изображении критичен.
Архитектурно - это почти наверняка дальнейшая интеграция языкового и визуального в один сквозной поток токенов, без промежуточных кодировщиков.
Если GPT-Image-2 выйдет с теми характеристиками, которые видны в тестах арены - рынок инструментов для генерации изображений получит нового сильного игрока.
Причём не по красивости или художественности, а по точности: текст, карты, UI, технические схемы. Именно этот сегмент - коммерческие задачи, где нужна не эстетика, а корректность - пока остаётся слабым местом всей индустрии.
Дата релиза неизвестна.