Семь нейросетей писали русский текст на картинке. Вывеску осилили шесть, объявление на двери — три
Вывеска «РЕМОНТ ОБУВИ» — двенадцать знаков. Объявление «Открыто с 10:00 до 20:00» — двадцать четыре. Обе надписи стояли в одном и том же запросе, обе одинаково простые для человека с маркером в руке. Первую правильно нарисовали шесть моделей из семи, вторую — три.
Причём провалы у всех разные и по-своему обидные: где-то «д» превратилась в «а», где-то «до 20:00» стало «до 26-80», а одна модель вместо вывески выдала «ОУЧНЫЙ КИВЫЙ» — буквы русские, слов нет.
Как устроен тест: один запрос на генерацию изображений, семь моделей
Одна сцена, три надписи разной длины, семь моделей, по одному прогону на каждую — без вторых попыток и без выбора удачного варианта из нескольких.
Запрос для всех был одинаковый: витрина маленькой мастерской по ремонту обуви на первом этаже жилого дома; над входом вывеска с надписью русскими буквами «РЕМОНТ ОБУВИ»; на стеклянной двери белый лист с надписью «Открыто с 10:00 до 20:00»; на витрине ценник «от 500 руб.»; дневной свет, снято на телефон.
Проверялось ровно одно: совпадает ли текст на картинке с заданным посимвольно. Не «похоже ли на русский», не «красиво ли», а буква в букву.
Участники — семь нейросетей для генерации изображений: GPT Image 2 (генерация изображений в чате GPT от OpenAI), Nano Banana Pro (та самая nano banana, генерация изображений у Gemini от Google), FLUX.2 Max (старшая нейросеть FLUX от Black Forest Labs), Seedream v4 (ByteDance), Qwen 2 (Alibaba), Grok Imagine (картиночный режим нейросети Grok от xAI) и Ideogram v3 — последний интересен отдельно, потому что позиционируется как специалист именно по тексту на изображениях. Гонялось всё в одном окне, через агрегатор Veruna Ai, где эти модели лежат рядом, — правда, половина участников открывается только на старших тарифах, на среднем их просто нет в списке.
Кто сколько вывез
Три из трёх взяли GPT Image 2 и Nano Banana Pro. У обеих вывеска, объявление и ценник совпали посимвольно, включая двоеточия во времени и точку в сокращении «руб.». У GPT Image 2 вдобавок на водосточной трубе висят обрывки чужих объявлений с телефоном «8-952-…» — деталь, которую никто не заказывал, но которая делает кадр похожим на настоящую съёмку.
Дальше начинается интересное.
FLUX.2 Max идеально вывел вывеску и объявление, а на ценнике сломался иначе, чем остальные: вместо «от 500 руб.» написал в две строки «от 500.» и «500 руб.» — продублировал число, будто не смог решить, где заканчивается фраза.
Qwen 2 дал самый достоверный по антуражу кадр — ржавая советская вывеска, облупившаяся краска — и всё же уронил одну букву: на двери написано «ао 20:00» вместо «до 20:00». Одна буква из двадцати четырёх, но объявление уже не текст, а опечатка на стекле.
Seedream v4 потерял «о» в ценнике («т 500 руб.») и деформировал «ы» в слове «Открыто» до неузнаваемости.
Специалист по тексту проиграл универсалам
Ideogram v3 — модель, чья заявленная сильная сторона именно надписи на картинках. Вывеску она сделала лучше всех по исполнению: аккуратная синяя табличка, ровные буквы, никаких артефактов. Ценник тоже верный.
А объявление на двери у неё выглядит так: «Открыте», «с 1?:00», «до 26-80». Время развалилось полностью — двоеточие превратилось в дефис, «20» стало «26», «00» стало «80».
То есть в зачёте специалист по тексту оказался ровно на уровне универсальных Qwen 2 и FLUX.2 Max и проиграл GPT Image 2 и Nano Banana Pro, которые ничего особенного про текст не обещают.
«ОУЧНЫЙ КИВЫЙ»: как нейросеть Grok написала несуществующие слова
Отдельная история — Grok Imagine. Вместо «РЕМОНТ ОБУВИ» на вывеске написано «ОУЧНЫЙ КИВЫЙ»: буквы кириллические, начертание уверенное, слов не существует. Объявление на двери — нечитаемая мелочь. При этом ценник «от 500 руб.» модель вывела правильно.
Палец в углу кадра, кстати, никто не заказывал. Ровно то же самое было в прошлом тесте у другой модели: просьбу «снято на телефон» некоторые понимают буквально и добавляют в кадр руку с телефоном.
Дело не в кириллице
Если разложить результат не по моделям, а по надписям, картина становится однозначной.
Вывеску «РЕМОНТ ОБУВИ» — двенадцать знаков, набрана крупно — правильно воспроизвели шесть моделей из семи. Ценник «от 500 руб.» почти той же длины, одиннадцать знаков, но набран мелко — его вывели пятеро. Объявление «Открыто с 10:00 до 20:00», двадцать четыре знака мелким шрифтом, осилили только трое.
Первая и вторая надписи почти одинаковой длины, но ценник набран мелко — и он уже сложнее вывески. Третья вдвое длиннее и тоже мелкая — и с ней справились меньше половины участников.
Тип поломок это подтверждает. Никто не написал латиницей вместо кириллицы, никто не перевёл текст на английский — модели прекрасно понимают, какой алфавит нужен. Ломается не язык, а исполнение мелкой длинной строки: буква подменяется на графически похожую («д» → «а»), цифровая группа рассыпается («20:00» → «26-80»), символ пропадает («от» → «т»), фрагмент дублируется («от 500.» + «500 руб.»).
Что делать, если нужно создать изображение по описанию с надписью
Крупный текст заказывать можно, мелкий — нельзя. Вывеска, заголовок на постере, короткое слово на упаковке — это модели тянут. Всё, что в кадре выглядит как мелкий шрифт — объявление, состав, адрес, время работы, — почти наверняка придётся переделывать.
Разбивайте длинное на короткое. Если фраза нужна целиком, лучше просить её частями: «Открыто» отдельной строкой, «10:00–20:00» отдельной. Три коротких блока проходят заметно чаще, чем одна строка на двадцать четыре знака.
Проверяйте каждый символ, а не общее впечатление. Все ошибки в этом тесте — на уровне одной буквы или одной цифры. С расстояния кадр выглядит безупречно; «ао 20:00» видно, только если специально всматриваться. Для карточки товара или баннера это означает переделку после публикации.
Не выбирайте модель по обещаниям. Единственный способ узнать, кто справится с вашей конкретной надписью, — прогнать её на нескольких моделях и сравнить. Заявленная специализация, как показал Ideogram, гарантией не является.
Текст поверх картинки надёжнее текста внутри картинки. Если задача позволяет, сгенерируйте картинку по тексту без надписей, а сами буквы поставьте сверху в редакторе. Тогда они будут ровно теми, которые вы напечатали.
Общий вывод простой. Спор «умеют ли нейросети в русский» на сегодня закрыт: умеют, и неплохо. Открытым остался другой вопрос — сколько знаков подряд они удержат, прежде чем начнут путать буквы. По этому тесту граница проходит где-то между коротким ценником и обычным объявлением на двери подъезда.
Ещё разборы и новости про нейросети выкладываю в канале t.me/veruna_ai_news.