Перейти к содержимому

Stable Diffusion 2026: open-source нейросеть для картинок (SDXL, SD 3.5, ComfyUI, Automatic1111)

Автор: Silvana · Дата: 09.08.2026 · Verified: 01.09.2026 · Reading time: 24 минут · Prerequisite: —

Stable Diffusion — семейство open-weight нейросетей для генерации картинок от Stability AI, с открытой публикацией весов с 2022 года и огромной экосистемой из тысяч дообученных моделей. Актуальные модели 2026 — SDXL Base/Turbo, SD 3 Medium и SD 3.5 Large/Medium/Large Turbo. Основные интерфейсы — AUTOMATIC1111 WebUI, ComfyUI, InvokeAI, Fooocus, Forge. Ниже — разбор моделей, UI/рантаймов, расширений (LoRA, ControlNet, IP-Adapter) и хостингов (Hugging Face, Civitai).

  • Stable Diffusion — семейство open-weight моделей генерации изображений от Stability AI, лондонской компании, запустившей открытую AI-революцию в изображении в 2022 году. С первого релиза (SD 1.4 в августе 2022) веса моделей публикуются свободно, что позволило сформироваться экосистеме из тысяч дообученных моделей, LoRA, плагинов, интерфейсов.
  • Актуальные модели 2026 (проверено 10.08.2026, huggingface.co/stabilityai и stability.ai/stable-image): SDXL Base / Turbo (стабильная работа, огромная экосистема), SD 3 Medium и SD 3.5 Large / Medium / Large Turbo (новое поколение архитектуры MMDiT), плюс AMD NPU-оптимизированные варианты (sdxl-base-amdnpu, sdxl-turbo-amdnpu, sd-turbo-amdnpu, stable-diffusion-3-medium-amdnpu, stable-diffusion-3.5-medium-amdnpu). Stable Video Diffusion (stable-video-diffusion-img2vid) исторически публиковалась на Hugging Face; статус активной разработки на 10.08.2026 на stability.ai/stable-image явно не выведен — сверять модель-карту перед выбором для нового проекта.
  • Основные UI/рантаймы: AUTOMATIC1111 Web UI — самый известный, зрелый, богатый плагинами. ComfyUI — node-based, для сложных пайплайнов. InvokeAI — user-friendly, коммерческая версия. Fooocus — упрощённый, для новичков. Forge — форк A1111 с оптимизациями.
  • Ключевые расширения: LoRA — лёгкая дообученная модель под стиль/персонажа/объект. ControlNet — точный контроль композиции через canny, depth, openpose, scribble. IP-Adapter — перенос стиля/содержания через референс-изображение. Textual Inversion — вложение концепций (устаревает).
  • Хостинги моделей: Hugging Face (официальный источник от Stability AI и других лабораторий), Civitai (community-хаб, тысячи checkpoint/LoRA от энтузиастов, есть NSFW-модели с юр-рисками).
  • Требования к железу: 8 GB VRAM — SD 1.5 работает, SDXL с оптимизациями. 12 GB VRAM — SDXL комфортно, SD 3.5 с optimisations. 16 GB VRAM — SD 3.5 комфортно. 24 GB VRAM — Flux [dev], большие LoRA, интенсивные пайплайны.
  • Варианты запуска: локально (свой GPU), облако (RunPod, Vast.ai — почасовая аренда), managed API (Stability API, replicate.com).
  • Полностью открытая и бесплатная в базе (веса — Apache 2.0 или CreativeML Open RAIL-M, зависит от версии). Community-модели на Civitai — разные лицензии, юр-риски отдельных категорий контента (особенно NSFW) — на пользователя.

Stable Diffusion — первое серьёзное open-source-семейство моделей для генерации изображений. Запущено Stability AI в августе 2022 года: релиз SD 1.4 с открытыми весами был событием, сравнимым с открытием исходников Linux — впервые качественный генератор изображений стал доступен любому без подписки, без API, без ограничений вендора.

История:

  • Август 2022 — SD 1.4: первая публичная версия, работала на 4 GB VRAM.
  • Октябрь 2022 — SD 1.5: улучшенное качество, стала долговечным «стандартом сообщества». До сих пор популярна для лёгких задач, старых LoRA.
  • Ноябрь 2022 — SD 2.0/2.1: новая архитектура, но сообщество приняло прохладно (потеря совместимости с 1.5-LoRA).
  • Июль 2023 — SDXL 1.0: значительный скачок качества, разрешение 1024×1024 из коробки, стал новым стандартом.
  • Февраль 2024 — SDXL Turbo: distilled-версия для быстрой генерации (1-4 шага).
  • Июнь 2024 — SD 3 Medium: новая архитектура Multimodal Diffusion Transformer (MMDiT), лучше следование промптам.
  • Октябрь 2024 — SD 3.5 Large, Medium, Turbo: актуальное поколение к 2026, три модели под разные железные бюджеты.
  • 2025 — Stability AI и мире. Ключевые фаундеры (Rombach, Blattmann, Esser) ушли в Black Forest Labs делать Flux. Stability AI продолжает выпускать модели, но лидерство в open-image переехало к BFL. SD-экосистема остаётся мощной за счёт огромного community-legacy — тысячи checkpoint, LoRA, ControlNet-моделей, наработанных с 2022 года.

Позиционирование. Stable Diffusion — не «лучшая модель на рынке» (по чистому качеству Flux 1.1 [pro] и Midjourney V7 обгоняют SD 3.5). Это платформа: открытые веса + гигантская экосистема + свобода делать что угодно.

Зачем это тебе:

  1. Приватность и on-premise. Всё на твоём железе или в твоём облаке. Никакие промпты и изображения не уходят вендору.
  2. Fine-tuning. Через LoRA, DreamBooth, TI ты обучаешь модель на своих данных за 1-3 часа. Твой персонаж, твой стиль, твой продукт.
  3. Специализированные модели с Civitai. Тысячи community-checkpoint под конкретные ниши: anime (Waifu Diffusion, Anything), realistic (Realistic Vision, Juggernaut), architectural, fashion. Часто дают лучший результат в своей нише, чем универсальные модели.
  4. ControlNet и точный контроль. Композиция кадра, поза человека, глубина сцены, референс-скетч — всё контролируется точно через ControlNet-препроцессоры.
  5. Экономика при большом объёме. Локальный запуск на своём GPU — стоимость только электричества. При тысячах генераций в месяц — заметно дешевле любого API.
  6. Автоматизация. Все интерфейсы имеют API (A1111 API, ComfyUI API), легко интегрируется в свои скрипты, боты, сервисы.

SDXL 1.0.

  • Разрешение: 1024×1024 base, до 2048×2048 через тайлинг или refiner.
  • VRAM: 12 GB комфортно, 8 GB с оптимизациями.
  • Скорость: 5-15 секунд на генерацию на RTX 4090.
  • Экосистема: гигантская. Тысячи checkpoint (SDXL-based dreamshaper, juggernaut, realistic-vision-xl), LoRA под всё, ControlNet-модели.
  • Использование: универсальный workhorse, стабильная работа, много готовых материалов.

SD 3.5 Large.

  • Разрешение: 1024×1024 base, до 2048×2048 через тайлинг.
  • VRAM: 16-24 GB комфортно.
  • Архитектура: MMDiT, лучшее следование промптам, чем SDXL.
  • Экосистема: моложе SDXL, LoRA-фонд меньше, ControlNet-модели ограничены (постепенно наращивается).
  • Использование: когда нужен baseline лучше SDXL и есть достаточное VRAM.

SD 3.5 Medium.

  • Компромисс: качество между SDXL и SD 3.5 Large, но заметно меньше VRAM (~10 GB).
  • Использование: для GPU 12 GB VRAM без ущерба качеству.

SD 3.5 Large Turbo.

  • Distilled-версия SD 3.5 Large. 4 шага вместо 30-50. В в разы быстрее.
  • Качество чуть ниже, чем у full-версии.
  • Использование: массовые генерации, батчи, прототипы.

SDXL Turbo (легаси-версия, 2024).

  • Distilled SDXL. 1-4 шага генерации.
  • Скорость: 1-2 секунды на RTX 4090.
  • Использование: real-time генерация, интерактивные приложения.

Legacy SD 1.5.

  • Разрешение: 512×512 base.
  • VRAM: 4-6 GB.
  • До сих пор широко используется в community — тысячи 1.5-LoRA, старые ComfyUI-workflows.
  • Использование: лёгкие задачи, слабое железо, работа со старыми checkpoint.

AUTOMATIC1111 Web UI (A1111).

Самый популярный интерфейс, стартовавший в конце 2022 года. Устанавливается в один клик, поддерживает все базовые задачи: text2img, img2img, inpainting, outpainting, upscaling, LoRA, ControlNet, extensions.

Плюсы: зрелый, огромная документация, тысячи плагинов, богатая настройка.

Минусы: под тяжёлые пайплайны (несколько ControlNet, комбинации LoRA) UI становится громоздким.

Репозиторий: github.com/AUTOMATIC1111/stable-diffusion-webui

ComfyUI.

Node-based интерфейс. Каждый шаг пайплайна — это нода, соединённая с другими. Позволяет строить сколь угодно сложные пайплайны.

Плюсы: максимальная гибкость, отлично для продвинутых workflows (регионально контролируемая генерация, комбинации моделей, IP-Adapter + ControlNet + LoRA одновременно), низкое потребление VRAM за счёт умного управления памятью.

Минусы: крутая кривая обучения, не для новичка.

Репозиторий: github.com/comfyanonymous/ComfyUI

Forge.

Форк AUTOMATIC1111 с оптимизациями памяти и скорости. Часто выбирают, когда A1111 не хватает VRAM.

InvokeAI.

Коммерческий продукт (есть free-версия), user-friendly UI, встроенный canvas для inpainting/outpainting как в Photoshop. Хорош для дизайнеров, которым важна интерактивная работа над одним изображением.

Fooocus.

Максимально упрощённый UI. Целевая аудитория — новички. Красивые defaults, автоматический prompt engineering. За счёт упрощения — меньше контроля.

Draw Things (macOS/iOS).

Native приложение для Apple-устройств. Использует Metal API, оптимизировано под M-series чипы. Позволяет запустить SD прямо на iPhone.

LoRA (Low-Rank Adaptation).

Лёгкая дообученная модель, которая «расширяет» базовую модель под конкретный стиль/персонажа/объект. Файл LoRA — 10-500 MB против нескольких GB базовой модели.

Как использовать: скачиваешь LoRA с Civitai или Hugging Face, кладёшь в папку models/Lora/ внутри своего UI. В промпте пишешь <lora:название:вес> (например <lora:my_style:0.8>).

Как обучить свой LoRA:

  1. Собери датасет 20-50 изображений одного стиля/объекта/персонажа.
  2. Подготовь captions (BLIP-interrogator сгенерирует автоматически).
  3. Инструмент — kohya-ss (github.com/kohya-ss/sd-scripts). Настройки: rank 16-64, 1000-3000 шагов, learning rate 1e-4.
  4. Тренировка 1-3 часа на A100, дольше на слабых GPU.

Есть облачные сервисы для обучения LoRA без своего железа: fal.ai training, replicate training, Civitai training. Стоимость — 3-10$ за обучение.

ControlNet.

Модели, дающие точный контроль над композицией. Ты подаёшь ControlNet референс-изображение (canny edges, depth map, openpose skeleton) — модель генерирует новую картинку, следующую этой структуре.

Основные типы препроцессоров:

  • Canny — edge detection, контуры.
  • Depth — карта глубины.
  • OpenPose — скелет человека (поза).
  • Scribble — грубый скетч.
  • Normal Map — карта нормалей поверхностей.
  • Segmentation — сегментация областей.
  • Lineart — line drawing.
  • Reference — прямой референс изображения.

Использование: рисуешь грубый скетч → ControlNet Scribble превращает в детализированное изображение. Фотографируешь позу → ControlNet OpenPose переносит её на сгенерированного персонажа. Даёшь фото интерьера → ControlNet Depth генерирует новую комнату той же геометрии.

IP-Adapter.

Модуль, принимающий референс-изображение и переносящий его стиль/содержание на новые генерации. Аналог Style Reference и Character Reference из Midjourney, но с большей гибкостью.

Варианты: IP-Adapter (стандартный), IP-Adapter-Face (для лиц), IP-Adapter-Plus (усиленное влияние референса), IP-Adapter-FaceID (идентификация лица).

Использование: даёшь фото человека — IP-Adapter-Face генерирует того же человека в разных сценах.

Textual Inversion (TI).

Раннее решение для встраивания концепций в модель через оптимизацию embedding-вектора. Файлы ~5-50 KB. Постепенно уступает LoRA (LoRA точнее и надёжнее), но в старых checkpoint SD 1.5 всё ещё используется.

Hypernetworks.

Устаревшее решение, встречается в старых материалах. Заменено на LoRA.

Hugging Face.

Официальный источник Stable Diffusion моделей от Stability AI: huggingface.co/stabilityai.

Здесь публикуются (проверено 10.08.2026, huggingface.co/stabilityai):

  • stable-diffusion-3.5-large — актуальная SD 3.5 Large.
  • stable-diffusion-3.5-large-turbo — быстрый вариант SD 3.5 Large.
  • stable-diffusion-3.5-medium — средний размер.
  • stable-diffusion-3-medium — SD 3 Medium.
  • stable-diffusion-xl-base-1.0 — SDXL Base.
  • sdxl-turbo — SDXL Turbo.
  • AMD NPU-варианты: sdxl-base-amdnpu, sdxl-turbo-amdnpu, sd-turbo-amdnpu, stable-diffusion-3-medium-amdnpu, stable-diffusion-3.5-medium-amdnpu.
  • stable-video-diffusion-img2vid — SVD для видео (сверять активность разработки в model card перед стартом нового проекта).

Также на Hugging Face — model cards, лицензии, документация от Stability AI.

Civitai (civitai.com).

Крупнейший community-хаб. Тысячи моделей и LoRA от энтузиастов сообщества.

Ключевые категории:

  • Checkpoints (базовые модели): dreamshaper (universal), realistic-vision (фото-реализм), juggernaut (SDXL-based универсал), pony-diffusion (аниме-специализация), photon (natural photos).
  • LoRA: стили (film photography, oil painting, cyberpunk), персонажи (аниме-герои, реальные знаменитости — юр-риски), концепции (одежда, окружение, эффекты).
  • Embeddings (TI): легаси, но всё ещё есть.
  • ControlNet models: дополнительные варианты препроцессоров.

Юридические риски на Civitai:

  • NSFW-модели — Civitai разрешает NSFW-контент в отдельной категории. Скачивание и использование таких моделей может нарушать законодательство твоей страны (в РФ действуют ограничения на распространение и хранение отдельных категорий, включая связанные с несовершеннолетними — это категорически запрещено). Ответственность на пользователе.
  • Модели, обученные на реальных людях (знаменитостях, публичных фигурах) — юр-серая зона по правам на образ. Публичное использование таких генераций может привести к судебным искам.
  • Модели, обученные без согласия художников — многие иллюстраторы возражают против обучения на их работах. Использование таких моделей может нарушать этические нормы и (в отдельных юрисдикциях) авторские права.

Практическое правило: для коммерческого использования выбирай модели с явно указанной лицензией (Apache, MIT, CreativeML Open RAIL-M с коммерческими условиями). Community-модели с расплывчатыми лицензиями — на свой юр-риск.

Минимум:

  • NVIDIA GPU 6-8 GB VRAM: SD 1.5 работает нативно, SDXL — с оптимизациями (fp16, model offload).
  • NVIDIA GPU 12 GB VRAM: SDXL комфортно, SD 3.5 Medium.
  • NVIDIA GPU 16-24 GB VRAM: SD 3.5 Large, Flux [dev], большие LoRA-пайплайны.
  • NVIDIA GPU 48+ GB VRAM: обучение LoRA с большими rank, множественные ControlNet.

Apple Silicon:

  • M1/M2: SD 1.5, SDXL с оптимизациями. Скорость заметно ниже NVIDIA, но работает.
  • M3/M4 Pro/Max: SDXL, SD 3.5 Medium. Через MPS (Metal Performance Shaders) или через ComfyUI-mps.

AMD GPU:

  • Работает через ROCm (Linux), DirectML (Windows). Скорость и стабильность ниже NVIDIA, но реально.

Без GPU (CPU only):

  • Технически возможно, практически невыносимо медленно (несколько минут на генерацию). Не рекомендуется.

Облачные варианты для тех, у кого нет своего железа:

  • RunPod: аренда GPU от $0.3/час (RTX 3090) до $2/час (H100). Ставишь ComfyUI, работаешь.
  • Vast.ai: дешевле аналог, часто крипто-оплата.
  • Google Colab: есть free tier, но с ограничениями на использование SD (Google периодически блокирует SD-репозитории). Работает нестабильно.
  • Kaggle: бесплатные T4 30 часов/неделю, работает.

Для новичка. Ставим ComfyUI на Windows/Linux/macOS с NVIDIA GPU.

Шаг 1. Скачай ComfyUI:

Окно терминала
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI

Шаг 2. Установи зависимости (нужен Python 3.10+):

Окно терминала
pip install -r requirements.txt

Шаг 3. Скачай базовую модель:

  • Иди на huggingface.co/stabilityai/stable-diffusion-3.5-medium (или SDXL, если 12 GB VRAM).
  • Скачай sd3.5_medium.safetensors.
  • Положи в ComfyUI/models/checkpoints/.

Шаг 4. Запусти:

Окно терминала
python main.py

Шаг 5. Открой браузер: http://localhost:8188.

Шаг 6. Загрузи default workflow через меню Load Default. Впиши промпт, нажми Queue Prompt.

Шаг 7. Добавь LoRA/ControlNet по мере необходимости. LoRA-файлы → models/loras/. ControlNet-модели → models/controlnet/.

Если не хочется возиться с self-hosting, есть API-провайдеры Stable Diffusion:

  • Stability API (stability.ai/api): официальный API Stability AI. Оплата per-generation, тарифы на platform.stability.ai. Поддерживает все актуальные SD-модели.
  • Replicate (replicate.com): платформа моделей, включает все версии SD. Оплата per-generation.
  • fal.ai: аналогично, специализация на быстром inference.
  • DreamStudio (dreamstudio.ai): веб-интерфейс от Stability AI, credit-based подписка.
  • RunwayML: веб-интерфейс с SD и другими генераторами, для дизайнеров.

Оплата всех этих сервисов — иностранной картой. Из РФ доступ есть, но оплата — через посредников или иностранную карту.

КритерийStable Diffusion 3.5 LargeFlux 1.1 [pro]Midjourney V7
Открытостьopen-weightзакрытая + open [dev]закрытая
Self-hostingда, зрелая экосистемада, через [dev]нет
Fine-tuning (LoRA)зрелая, тысячи LoRAмолодая, десятки LoRAнет
Community modelsтысячи на Civitaiдесятки на HF/Civitaiнет
ControlNetзрелый, много моделеймолодой, ограниченные моделинет
Качество baseсильноесильнейшеесильнейшее
Художественная эстетиказависит от checkpointсильныйсильнейший
Экосистема (UIs, plugins)AUTOMATIC1111, ComfyUI, InvokeAI, Fooocus, ForgeComfyUI, Diffusersweb + Discord
Стоимость (self-host)только GPUтолько GPUнедоступно
Стоимость (API)$0.02-0.05/gen$0.04-0.08/gen~$0.03/gen в подписке

Практический выбор:

  • SD 3.5 — если приоритет: зрелая экосистема + community-модели + гибкость.
  • Flux — если приоритет: качество + текст + rectified flow архитектура + новизна.
  • Midjourney — если приоритет: художественность + character/style consistency + удобство без self-hosting.

Многие продвинутые пользователи используют все три параллельно: SD для fine-tuned pipelines и старых LoRA, Flux для нового качества, Midjourney для художественных проектов.

Stable Diffusion — семейство open-weight моделей генерации изображений от Stability AI. С 2022 года веса публикуются свободно, что породило гигантскую экосистему: тысячи дообученных моделей, LoRA, ControlNet, интерфейсов. Актуальные версии 2026 (проверено 10.08.2026 на huggingface.co/stabilityai): SD 3.5 Large / Large Turbo / Medium (новое поколение MMDiT-архитектуры), SD 3 Medium, SDXL Base / Turbo (стабильные workhorse), Stable Video Diffusion (для видео — сверять активность разработки в model card).

Локально на своём GPU (NVIDIA 6+ GB VRAM минимум). Скачиваешь ComfyUI или AUTOMATIC1111 (оба бесплатные, open-source), скачиваешь веса модели с Hugging Face (тоже бесплатно), запускаешь. Полный setup — около часа. Никаких подписок, никакой оплаты. Только стоимость электричества. Альтернатива: облачные free-tier сервисы вроде Google Colab (нестабильно) или Kaggle (30 часов T4 в неделю).

AUTOMATIC1111 — для новичков и стандартных задач. Простой UI в стиле «поля и кнопки». Богатая настройка, много расширений. ComfyUI — для продвинутых пользователей и сложных пайплайнов. Node-based интерфейс, максимальная гибкость. Лучше подходит для комбинаций ControlNet + LoRA + IP-Adapter. Практически: начни с A1111 или Fooocus (для новичка), переходи на ComfyUI, когда упрёшься в ограничения. Многие профессионалы используют оба параллельно.

Два основных источника. Hugging Face — официальный источник от Stability AI и других лабораторий (huggingface.co/stabilityai). Здесь официальные checkpoint с прозрачными лицензиями. Civitai (civitai.com) — крупнейший community-хаб. Тысячи checkpoint и LoRA от энтузиастов, включая специализированные модели под конкретные ниши (аниме, реализм, анатомия, стили). Помни: Civitai-модели с расплывчатыми лицензиями — на твой юр-риск для коммерческого использования.

LoRA (Low-Rank Adaptation) — способ дообучить базовую модель под конкретный стиль, персонажа, объект без переобучения всей модели. Файл LoRA — 10-500 MB (против нескольких GB базовой модели). Использование: скачиваешь LoRA, кладёшь в папку models/Lora/ внутри UI, в промпте пишешь <lora:название:вес>. Обучить свой LoRA можно за 1-3 часа на A100 через kohya-ss или облачные сервисы (fal.ai training, replicate training). Стоимость обучения — 3-10$.

Что такое ControlNet и когда его использовать?

Заголовок раздела «Что такое ControlNet и когда его использовать?»

ControlNet — модели, дающие точный контроль над композицией. Ты подаёшь референс-изображение (canny edges, depth map, openpose skeleton, scribble), ControlNet заставляет генерацию следовать этой структуре. Использование: перенос позы человека с одного фото на другого персонажа (OpenPose), генерация нового интерьера в той же геометрии (Depth), превращение грубого скетча в детализированное изображение (Scribble). Незаменим для точного композиционного контроля.

6-8 GB VRAM — SD 1.5 работает нативно, SDXL с оптимизациями (fp16, model offload). Медленно, но работает. 12 GB VRAM — SDXL комфортно, SD 3.5 Medium. Хороший старт для большинства задач. 16-24 GB VRAM — SD 3.5 Large, Flux [dev], большие LoRA-пайплайны. Комфортная работа. 48+ GB VRAM — обучение LoRA с большими rank, множественные ControlNet одновременно.

Да. Native поддержка Apple Silicon (M1/M2/M3/M4) через Metal Performance Shaders (MPS). ComfyUI, A1111, Draw Things (native macOS/iOS приложение) — всё работает. Скорость: M1 в разы медленнее RTX 4090, M4 Max — примерно как RTX 3060. Для лёгкой работы подходит, для интенсивной — лучше NVIDIA.

Есть ли юр-риски использования моделей с Civitai?

Заголовок раздела «Есть ли юр-риски использования моделей с Civitai?»

Да, несколько категорий рисков. NSFW-модели — их скачивание и использование может нарушать законодательство твоей страны (в РФ действуют ограничения на распространение и хранение отдельных категорий контента). Модели, обученные на реальных людях (знаменитостях) — юр-серая зона по правам на образ. Модели, обученные без согласия художников — этические и (в отдельных юрисдикциях) авторские вопросы. Для коммерческого использования выбирай модели с прозрачной лицензией (Apache, MIT, CreativeML Open RAIL-M с коммерческими условиями).

Как обучить свою модель на своих изображениях?

Заголовок раздела «Как обучить свою модель на своих изображениях?»

Через LoRA-тренировку. Собираешь 20-50 изображений одного стиля/персонажа/продукта, готовишь captions (BLIP-interrogator автоматически), настраиваешь параметры (rank 16-64, 1000-3000 шагов, learning rate 1e-4), запускаешь тренировку на GPU. Инструменты: kohya-ss (github.com/kohya-ss/sd-scripts) локально, или облачные сервисы fal.ai training / replicate training / Civitai training (3-10$ за обучение). Результат — файл LoRA (10-500 MB), который используешь вместе с базовой моделью.

По чистому качеству базовых генераций: Flux 1.1 [pro] и Midjourney V7 обычно обгоняют SD 3.5 Large. Но SD 3.5 через специализированные checkpoint (например Juggernaut XL Realistic для фото, Pony Diffusion для аниме) может давать топ-результаты в конкретной нише. Плюс SD 3.5 может использовать наработанные годами LoRA, ControlNet, IP-Adapter пайплайны — это добавляет качества через специализацию, недоступную в закрытых моделях.

Сколько стоит использовать Stable Diffusion через API?

Заголовок раздела «Сколько стоит использовать Stable Diffusion через API?»

Stability API (stability.ai/api): порядок 0.02-0.05$ за генерацию для SDXL, чуть дороже для SD 3.5. Точные ставки — на platform.stability.ai. Replicate: аналогично 0.03-0.05$ за генерацию. fal.ai: 0.01-0.05$ в зависимости от модели. При 500 генерациях в месяц — 10-25$. При self-hosting на своём GPU — стоимость только электричества (обычно 5-15$/мес при активной работе).

Checkpoint — это полная модель (несколько GB), дообученная под конкретный стиль/тему. В отличие от LoRA (легковесное расширение), checkpoint — самостоятельная модель, которую загружают вместо базовой SD/SDXL. Примеры: DreamShaper (универсальный), Realistic Vision (фото-реализм), Juggernaut XL (SDXL-based fashion/portrait), Pony Diffusion (аниме). Использование: скачиваешь .safetensors файл (2-7 GB), кладёшь в models/checkpoints/, выбираешь в UI.

Можно ли использовать Stable Diffusion коммерчески?

Заголовок раздела «Можно ли использовать Stable Diffusion коммерчески?»

Официальные модели от Stability AI имеют лицензию CreativeML Open RAIL-M (или Apache 2.0 для отдельных моделей вроде SDXL Turbo). Она разрешает коммерческое использование с некоторыми оговорками (нельзя использовать для генерации нарушающего закон контента и т. п.). Для крупных компаний (доход больше 1M$/год) Stability предлагает Enterprise License. Community-модели с Civitai — лицензии разные, проверяй индивидуально для каждой.

Что делать, если генерации получаются с артефактами (лишние пальцы, кривые лица)?

Заголовок раздела «Что делать, если генерации получаются с артефактами (лишние пальцы, кривые лица)?»

Классические проблемы SD. Решения: (1) используй специализированный checkpoint под свою задачу (для лиц — Realistic Vision, для рук — специальные LoRA). (2) Добавь negative prompts: bad anatomy, extra fingers, malformed hands, deformed face. (3) Используй ControlNet OpenPose для рук с точной позой. (4) Постобработка через inpainting — выделяешь проблемную область и перегенерируешь только её. (5) Перейди на SD 3.5 Large или Flux — новые модели значительно лучше в анатомии.

Несколько способов. (1) Используй SDXL Turbo или SD 3.5 Large Turbo — 4 шага вместо 30-50, в разы быстрее. (2) Уменьши разрешение — генерируй в 768×768, апскейль до 1024×1024 отдельно. (3) Меньше шагов (20 вместо 50) — качество страдает незначительно. (4) Используй xFormers оптимизации в A1111. (5) Обнови GPU-драйверы. (6) Для массовых задач — batch generation вместо по одной.

Актуально на 10.08.2026. Модели, цены и условия доступа меняются часто. Перед бизнес-решением всегда сверяйся с первоисточником — все ссылки в разделе Sources ниже.