Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

9 июля пользователь r/Bard описал, что нано банана стала хуже держать лица, игнорировать инструкции и работать с референсами. 13 июля в r/GoogleFlow появился противоположный контр-отчёт: автор сообщил о более чем 100 сгенерированных изображениях без тех же сообщений об ошибках.

Оба наблюдения могут быть честными. Но ни одно не отвечает на главный рабочий вопрос: испортилась ли модель, или изменились условия, в которых её запускали? Для команды, которая получает нестабильные визуалы в дедлайне, это разница между баг-репортом, сменой инструмента и бесполезной перепиской о «качестве».

Сначала разделите названия

30 июня Google представила Nano Banana 2 Lite как быстрый и экономичный вариант Gemini Image для задач скорости и масштаба. В документации для разработчиков эта модель называется gemini-3.1-flash-lite-image.

Из этого не следует, что любой результат с бытовым именем Nano Banana относится именно к ней. Nano Banana 2, 2 Lite и Pro нельзя записывать в одну колонку таблицы. Тем более нельзя считать, что результат в Flow и результат через публичный API получены в одинаковых условиях.

Это не утверждение о скрытом устройстве Flow. Просто без фиксации поверхности, доступного tier, аккаунта и идентификатора модели сравнение неидентифицируемо. Слово «Banana» в заметках о тесте слишком широкое, чтобы по нему искать регресс.

Что показала жалоба, а что нет

В июльской жалобе речь шла не об одном артефакте. Пользователь отметил три класса проблем: инструкция не выполняется, лицо хуже сохраняется между изображениями, референс перестаёт работать ожидаемым образом. Пост получил 9 голосов.

Это полезный сигнал для воспроизведения, но не измеренный инцидент платформы. Неизвестны точный набор изображений, формулировки, режимы, последовательность попыток и условия аккаунта. Из такого отчёта нельзя вывести массовый downgrade.

Контр-отчёт через четыре дня тоже не является опровержением. Его автор получил более 100 изображений без обсуждавшихся сообщений об ошибках, а пост получил 13 голосов. Это показывает лишь, что при его входных данных и в его условиях проблема не проявилась. Он не говорит, что другие аккаунты, референсы и запросы обязаны вести себя так же.

Здесь и происходит важный поворот. Интуитивно хочется выбрать сторону: либо «всё сломали», либо «у меня работает, значит жалоба надуманна». Практически ценнее признать третью версию: наблюдения описывают разные срезы одной системы.

Тест, который превращает спор в решение

Минимальный regression harness не требует большого бенчмарка. Он требует дисциплины.

Зафиксируйте один reference set и один prompt. Отдельно запишите:

  • выбранную модель или её доступное название;
  • поверхность запуска: Flow или API;
  • tier аккаунта;
  • aspect ratio;
  • дату и время серии;
  • все выходные изображения.

Сделайте по 20 запусков до и после предполагаемого изменения условий. Если «до» уже недоступно, сравнивайте две явно названные конфигурации, а не память о том, как результат выглядел неделю назад.

Для каждого запуска нужен один исход, а не общий вердикт «плохо»:

  • Исход: face • Что фиксировать: Сохранилась ли нужная идентичность лица
  • Исход: reference • Что фиксировать: Сработал ли референс как источник требуемых признаков
  • Исход: instruction • Что фиксировать: Выполнена ли проверяемая часть инструкции
  • Исход: safety • Что фиксировать: Есть ли блокировка или безопасный отказ
  • Исход: transport • Что фиксировать: Возникла ли техническая ошибка доставки или запуска

Такой журнал не докажет внутреннюю причину поведения Flow. Зато он отделит разные симптомы. Ошибка транспорта не равна ухудшению визуального качества. Safety-исход не равен провалу референса. А один неудачный портрет не равен регрессу модели.

Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

Самое сильное возражение

Можно справедливо сказать, что 20 прогонов мало и генеративная система вариативна. Это верно. Такой тест не превращает локальное наблюдение в независимую оценку всей модели.

Но альтернатива хуже не потому, что она «не научная», а потому, что в ней вообще не видно предмета спора. Без одинакового prompt, референса и условий нельзя отличить дрейф входа от смены модели, а случайный удачный или неудачный набор изображений становится аргументом сам по себе.

Поэтому 20 запусков нужны не для окончательного приговора Google. Они нужны для следующего действия.

  • Если в одной зафиксированной конфигурации повторяются face, reference или instruction, оформляйте баг-репорт с входами, выходами и распределением исходов.
  • Если проблема проявляется только на одной поверхности или tier, не называйте её регрессом всей Nano Banana. Описывайте границу проявления.
  • Если ломается только конкретный референс или формулировка, сначала ремонтируйте вход: у вас есть гипотеза о prompt/reference drift.
  • Если для проекта важнее предсказуемость, а не поиск причины, запускайте тот же вход в нескольких image-моделях и сравнивайте сохранённые исходы. Это можно организовать через воспроизводимый кросс-модельный тест в provod.ai, не выдавая сравнение за объяснение причин поведения Flow.

Полезная формулировка для команды звучит скучнее, чем «нано банана стала хуже», но экономит время: «В Flow, при таком аккаунте, таком референсе и таком prompt в 20 попытках повторился такой-то тип отказа». С ней можно менять инструмент осознанно, чинить вход или передавать проблему дальше.

Нано банана. Июльская жалоба и контр-отчёт — как отличить регресс от смены модели

Если дедлайн близок, что вы выберете: потратить время на доказательство локального регресса или перейти на сравнение нескольких моделей с тем же входом?

provod.ai — генерация изображений без отдельного медиасервиса

Создавайте визуалы в том же контуре, где команда работает с текстом и кодом: один кабинет и баланс упрощают производство баннеров, иллюстраций, концептов и продуктовой графики.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Генерации идут по официальной цене модели 1:1: provod.ai не добавляет собственную наценку к стоимости изображения.

Добавьте изображения в рабочий процесс: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

11