SD Studio: свой Midjourney на своей видеокарте — и без подписки
Зачем
Платные нейросети для генерации изображений съедают бюджет. Midjourney — от $10/мес, DALL-E — платный API, и всё это с ограничениями. Stable Diffusion бесплатный и крутой, но чтобы получить нормальную картинку, нужно разбираться в тегах, самплерах, шагах, LoRA и ещё десятке параметров.
Как работает
Нужны два сервиса в локальной сети: Stable Diffusion WebUI (A1111) и любой LLM-сервер — Ollama, llama.cpp или LM Studio. SD Studio связывает их в один пайплайн.
Генерация по тексту. Выбрал пресет (набор модели, LoRA, настроек), написал описание на человеческом языке — LLM превращает его в SD-промпт с нужными тегами и негативным промптом. Нажал Generate — получил картинку.
Умное удаление объектов. Нарисовал маску поверх объекта — LLM vision анализирует, что вокруг, и автоматически заполняет фон. Без ручного описания.
Изменение части изображения.
Мульти-сценовая композиция. Описал сцену с несколькими персонажами — LLM разбивает на отдельных персонажей, генерирует фон и каждого отдельно, вырезает через Rembg, вставляет на фон и прогоняет через inpaint для бесшовного результата.
Пайплайны. Объединил несколько пресетов в цепочку: первый генерирует основу, второй дорабатывает детали. Разные модели сильны в разном — так можно совместить богатую фантазию одной модели с качеством рендера другой.
Сессии. Вся история генераций сохраняется. Можно вернуться к любому шагу, перегенерировать, экспортировать.
Технически
Go + Wails v2 (десктоп-фреймворк), Vue 3 на фронтенде, SQLite для хранения. Не Electron — бинарник компактный, работает быстро. Подключается к API Stable Diffusion WebUI и любому OpenAI-совместимому LLM.
Работает на macOS, Linux, Windows. Данные не покидают машину — приватность по умолчанию.
Open source, AGPL v3.
GitHub: https://github.com/Zazza/sd-ai