Midjourney, подвинься: Alibaba выкатила нейросеть, которая (наконец-то!) умеет писать. Протестировал Qwen-Image за вас

Привет, VC! Иван Алмазов на связи. Каждый, кто хоть раз пытался сгенерировать в Midjourney постер или обложку книги, знает эту боль: нейросеть выдает шедевральную картинку и... инопланетные каракули вместо текста. Мы смирились и дорисовывали буквы в Photoshop. Но, кажется, этому пришел конец.

Команда Qwen из Alibaba (да, те самые, что сделали крутую видеомодель) выкатила своего генератора изображений — Qwen-Image. Главный козырь — он якобы идеально рендерит текст. Я не поверил на слово и пошел тестировать. Делюсь первыми впечатлениями.

Midjourney, подвинься: Alibaba выкатила нейросеть, которая (наконец-то!) умеет писать. Протестировал Qwen-Image за вас

Что за зверь этот Qwen-Image?

Если коротко, это тяжеловес. В основе лежит модель на 20 миллиардов параметров, что ставит ее в один ряд с гигантами индустрии. Разработчики делают две громкие заявки:

  1. Идеальный рендеринг текста. Причем не просто одного слова, а многострочных макетов, абзацев, на разных языках (включая сложный китайский).
  2. Продвинутое редактирование. Перенос стиля, добавление и удаление объектов, коррекция позы персонажа — все внутри одной сессии.

Звучит как список желаний любого дизайнера. Но давайте к главному.

Тест №1: Текст, который не стыдно показать людям

Это была моя главная цель. Я решил проверить Qwen-Image на задачах, где Midjourney и Stable Diffusion стабильно лажают.

Задача A: Обложка книги. Я скормил промпт в духе: «Обложка книги в стиле киберпанк, темные тона, неоновый свет. Название 'Город Теней', внизу мелким шрифтом имя автора 'Иван Алмазов'».

Результат: Вау. Это первое, что пришло в голову. Qwen-Image не просто написал текст без ошибок, он правильно расположил его: крупное название, мелкое имя автора. Он даже попытался вписать буквы в перспективу обложки. Это уровень, недостижимый для конкурентов на данный момент.

Задача Б: Вывеска магазина. Здесь я усложнил задачу, добавив двуязычный контент: «Фотография вывески уютного книжного магазина ночью. Неоновая надпись 'The Book Nook', под ней на русском 'Книжная Лавка 24/7'».

Результат: Снова в яблочко. Оба языка написаны корректно. Нейросеть правильно поняла, что «The Book Nook» — это основной бренд и сделала его крупнее, а «Книжная Лавка» — уточнение. Никакой абракадабры.

Что еще умеет: Редактирование «на лету»

Помимо текста, я бегло пробежался по другим фичам. Вот что показалось интересным:

  • Перенос стиля: Можно загрузить картинку и попросить применить ее стиль к новой генерации. Работает неплохо, хотя иногда «додумывает» лишнего.
  • Добавление/удаление: Можно выделить область и попросить «убрать этот столб» или «добавить сюда кота». Справляется на уровне DALL-E 3, что уже хорошо.
  • Коррекция позы: Самая сырая фича, на мой взгляд. Иногда ломает анатомию, но потенциал огромный.

Вердикт: Убийца Midjourney или очередной хайп?

Убийца? Пока рано говорить. По общему качеству картинки, художественности и проработке деталей Midjourney все еще задает планку.

Но вот в чем Qwen-Image уже победил, так это в нише коммерческого дизайна. Создание баннеров, постеров, обложек, мокапов — везде, где текст является неотъемлемой частью изображения, эта нейросеть уделывает конкурентов одной левой. Она экономит часы, которые раньше уходили на ручную доработку в графических редакторах.

Кому стоит попробовать прямо сейчас:

  • Маркетологам и SMM-специалистам.
  • Дизайнерам.
  • Всем, кто устал бороться с текстовой дислексией нейросетей.

Ссылка на демо, кстати, вот тут.

Тестирование новых инструментов, которые могут реально ускорить работу — это то, чем мы постоянно занимаемся в Кнопке*. Я убежден, что главный навык сегодня — не уметь делать что-то руками, а знать, какая нейросеть сделает это за тебя.

1