Шесть нейросетей рисовали по описанию наш двор: иномарку у подъезда осилили две
Двор, через который я хожу к парковке, за последние лет тридцать не изменился вообще: лавочка у подъезда, на ней почти всегда кто-то сидит, между тополями верёвка с бельём, чуть в стороне вкопанная рама для выбивания ковров. Мимо неё я хожу дважды в день и однажды поймал себя на мысли, что не помню, когда последний раз видел, чтобы ею пользовались.
Есть расхожая мысль, что картинки, нарисованные по описанию, от настоящих фотографий уже не отличить. По качеству — почти да: пальцы давно на месте, свет живой, штукатурка облезает правдоподобно. Отличается не картинка, а содержание. Я отдал один и тот же запрос про этот двор шести нейросетям — и получил шесть аккуратных, убедительных дворов, в каждом из которых часть заказанного тихо заменили на что-то другое.
Как я тестировал: один запрос, шесть нейросетей для генерации изображений
Запрос я писал один раз и дальше не трогал — на английском, потому что модели с ним работают ровнее. В нём было пять проверяемых пунктов: двор российской пятиэтажки летом, снято на телефон; деревянная лавочка у подъезда, на ней сидит пожилая женщина; между двумя деревьями верёвка с бельём; металлическая рама для выбивания ковров, на ней ковёр; у дома припаркована старая иномарка.
Пять пунктов выбраны не случайно. Лавочка, бабушка и бельё есть в любой стране мира — это проверка на то, что модель вообще понимает задачу. Рама для ковров — предмет без прямого западного аналога, его нужно знать. «Старая иномарка» — прямое противоречие тому, что обычно стоит в кадре с подписью «российский двор». А «пятиэтажка» — единственный пункт, который можно просто пересчитать.
Участников шесть, все — нейросети для генерации изображений разных вендоров: GPT Image 2 (та самая генерация фото в чате GPT от OpenAI), Nano Banana Pro (nano banana — картиночная модель Gemini от Google), Qwen 2 от Alibaba, Seedream v4 от ByteDance, Grok Imagine (картинки у нейросети Grok от xAI) и FLUX.2 Max от Black Forest Labs. По одному прогону на модель, без вторых попыток и без правок результата: перегенерировать до красивого — значит подгонять тест под ожидание.
Гонял всё в одном окне, в агрегаторе Veruna AI, где эти модели лежат рядом и переключаются в одном чате. Честно про ограничение: половина участников теста открывается только на старших тарифах — на среднем флагманов в списке просто нет, и я это выяснил не из описания, а когда полез их искать. Способ не единственный — то же самое собирается напрямую у разработчиков моделей, если VPN и зарубежная карта не проблема; мне было лень заводить шесть аккаунтов ради одного дня.
Что нейросети рисуют по описанию без ошибок: лавочка, бабушка, бельё
Первые три пункта закрыли все шесть из шести. Лавочка у подъезда — есть везде, пожилая женщина на ней — тоже, бельё на верёвке — тоже.
Дальше начинаются мелочи. Платок на голову женщине добавила половина моделей, хотя в запросе его не было: в мировом запасе фотографий «пожилая женщина, Россия, двор» платок встречается чаще, чем без него, — вот его и выдали в комплекте. «Между двумя деревьями» соблюдено не везде: у трёх моделей верёвка идёт от дерева к стене дома или к столбу. Мелочь, но показательная — в запросе стояла конкретная конструкция, а нарисован общий смысл «бельё сушится во дворе».
Отдельно отмечу Qwen 2: у неё двор получился самым достоверным из шести. Яркое разноцветное бельё на прищепках, деревянная лавка на чугунных ножках, объявление на двери подъезда, трещины на отмостке. Если бы мне показали эту картинку без контекста, я бы не усомнился.
Старая иномарка: две из шести, остальные пригнали отечественный автопром
Слово «иномарка» стояло в запросе прямым текстом. Нарисовали её две модели.
Nano Banana Pro поставила у дома ржавую Audi 100 — с фирменными кольцами на решётке, с выгоревшей краской, ровно ту машину, которая в таком дворе и стояла бы. Grok Imagine выдал зелёный Volkswagen Passat, тоже без вопросов.
Остальные четыре молча поправили меня. GPT Image 2 — синяя «Нива». Qwen 2, Seedream v4 и FLUX.2 Max — «Жигули» разных лет и цветов: бежевые, голубые, белые. Ни одна модель не сообщила, что заменила заказанное; все четыре нарисовали это с той же уверенностью, с какой рисовали лавочку.
Тут стоит остановиться, потому что это не ошибка распознавания. Слово было понято — просто в кадрах, которые модель видела под подписью «российский двор», у подъезда стоит «Лада». Прямое указание проиграло статистике.
Рама для выбивания ковров: пять из шести и одна бельевая сушилка
Рама — самый локальный предмет в списке. Пять моделей нарисовали узнаваемую конструкцию: сваренные буквой «А» или вкопанные П-образные трубы, на них перекинут ковёр. У FLUX.2 Max рама вышла спорной — гнутая хромированная труба, ближе к раме, чем к сушилке, но не та вкопанная конструкция, которую я имел в виду. Засчитал, оговорившись.
А Qwen 2, которая нарисовала самый достоверный двор из шести, повесила ковёр на складную бельевую сушилку. Ту самую, алюминиевую, которая стоит на балконе у половины страны. Рядом, кстати, пририсовала синюю пластиковую штуку, похожую на выбивалку, — то есть про сам ритуал выбивания ковра модель что-то знает, а вот предмет подставила из соседней категории: «на этом сушат» вместо «по этому бьют».
Разница между этими двумя провалами важнее, чем кажется. Иномарку модель заменила потому, что знала «правильный» ответ лучше меня. Раму — потому что не знала вообще и подставила ближайший похожий объект. Со стороны оба случая выглядят одинаково: аккуратная картинка, ноль сомнений.
Пять этажей: ноль из шести
Единственный пункт, который проверяется арифметикой, не взял никто.
Дом целиком, с крышей, влез в кадр у одной модели — Seedream v4. Этажей в нём четыре. У остальных пяти дом обрезан по верхней границе кадра: считать нечего, но и пяти этажей не видно ни на одной картинке. Честная формулировка тут — «ноль из шести подтверждённых», а не «все нарисовали четыре»: пять моделей просто увели крышу за край.
Ничего удивительного, если помнить, как это устроено: модель не считает этажи, она рисует «дом, похожий на дом из таких кадров». Числительное для неё — не количество, а описание настроения: «пятиэтажка» означает примерно «невысокий советский жилой дом», и в этом смысле все шесть справились. Полезный вывод для любого, кто заказывает картинку с числом: цифру придётся проверять глазами. Пять яблок, три окна, четыре человека за столом — то же самое.
Чего никто не заказывал: палец на объективе и номер, который не читается
Самое занятное в тесте — не провалы, а инициатива.
Seedream v4 поняла «снято на телефон» буквально и добавила в угол кадра смазанный палец, наползающий на объектив. Приём, который снимает недоверие лучше любого зерна: так выглядит половина фотографий в моей галерее.
Grok Imagine выдал машине российский номерной знак — правильного формата, с рамкой, на нужном месте. Написана на нём кириллическая абракадабра, которая не читается вообще. Заодно Grok поставил у лавочки детский трёхколёсный велосипед и самокат, Nano Banana Pro — песочницу с пластиковыми игрушками, GPT Image 2 — граффити на стене подъезда и решётки на окнах первого этажа. Ничего из этого в запросе не было, и всё это ровно то, что действительно валяется в таких дворах.
Получается смешное: там, где модель добавляет от себя, она попадает точнее, чем там, где выполняет прямое указание. Отсебятина берётся из того же массива кадров, что и всё остальное, — а массив про наши дворы, оказывается, знает много верного. Кроме того, что в нём никогда не стоит иномарка.
Как создать картинку ИИ по описанию и получить то, что задумал
Прогон был один, выводов из него ровно четыре — и все проверяемые.
Считайте, что типичное вы уже заказали. Лавочку, бельё, бабушку можно было не описывать: они появились бы всё равно. Текст запроса стоит тратить не на очевидное, а на то, что от типичного отличается.
Деталь, которая противоречит ожиданию, называйте дважды и по-разному. «Старая иномарка» проиграла один раз. «Старая иномарка, немецкая или японская, не отечественная» — уже прямое исключение, а не пожелание. Правило простое: чем дальше деталь от среднего кадра по теме, тем настойчивее её приходится повторять.**Числа и надписи не заказывайте — проверяйте. Этажи, количество предметов, текст на вывеске и номере: модель рисует их как узор, а не как информацию. Если картинка идёт в дело — в презентацию, на баннер, в карточку, — каждую цифру и каждую букву в кадре надо смотреть глазами.
Проверяйте результат по собственному запросу, как по чек-листу. Я разложил шесть картинок и прошёл по пяти пунктам подряд — расхождения нашлись у всех шести, хотя с первого взгляда все шесть выглядят нормально. Общее ощущение «похоже» — плохой критерий: оно как раз и собрано из того типичного, которое модель дорисовала сама.
Что в итоге
Модель работает не как фотограф, а как составитель фоторобота. Ей описывают приметы, она собирает лицо из самых частых черт: нос как у большинства, глаза как у большинства. Получается похоже — и одновременно ни на кого конкретно. Скажешь «нос с горбинкой» — учтёт, если горбинка не спорит с типовым лицом; заспорит — тихо усреднит.
Ни один из шести дворов не выглядит подделкой. Каждый выглядит как чей-то реальный двор — просто не как тот, мимо которого я хожу к парковке. Рама там до сих пор стоит вкопанная, и ковров на ней я по-прежнему не вижу.
Ещё разборы и новости про нейросети выкладываю в канале t.me/veruna_ai_news.