Stable Diffusion — что это, как работает и версии
Stable Diffusion — это open-source-нейросеть text-to-image, которая превращает текстовый промпт в картинку: она начинает со случайного шума и пошагово расшумляет его в сжатом латентном пространстве. Модель выпустила Stability AI в августе 2022 года с открытыми весами — именно она сделала качественную генерацию изображений доступной на обычных видеокартах и породила инструменты вроде /glossary/lora, /glossary/controlnet и /glossary/ip-adapter.
Что такое Stable Diffusion?
Stable Diffusion — это text-to-image-нейросеть на глубоком обучении: вы вводите текстовый /glossary/prompt, а она генерирует подходящую картинку. Это /glossary/diffusion-модель, то есть она учится обращать процесс зашумления — стартует с чистого случайного шума и постепенно убирает его, пока не проступит связное изображение. Её отличие на момент запуска — веса опубликовали открыто под свободной лицензией, так что скачать и запустить модель мог кто угодно. Её создали исследователи группы CompVis из LMU Munich вместе с Runway, а профинансировала и выпустила Stability AI в августе 2022 года, опираясь на статью 2022 года «High-Resolution Image Synthesis with Latent Diffusion Models» (arxiv.org/abs/2112.10752).
Как работает Stable Diffusion
Главный приём в том, что Stable Diffusion — латентная диффузионная модель: вместо расшумления миллионов пикселей напрямую она работает в маленьком сжатом «латентном» пространстве. Вариационный автоэнкодер (VAE) ужимает изображение 512×512 до латентной сетки 64×64 — примерно в 48 раз меньше чисел, — поэтому тяжёлое расшумление становится достаточно дешёвым, чтобы уместиться на обычной видеокарте. CLIP-энкодер текста превращает ваш промпт в числа, которые направляют процесс, U-Net-/glossary/sampler убирает шум за серию шагов, и наконец VAE-декодер разворачивает очищенный латент обратно в изображение полного разрешения.
Работу делают три компонента вместе, и знание их объясняет большинство настроек, которые вам встретятся:

- Энкодер текста (CLIP) — превращает ваш /glossary/prompt в эмбеддинг, на который опирается модель.
- U-Net-денойзер — сеть, которая на каждом шаге предсказывает и убирает шум под управлением /glossary/cfg.
- VAE — сжимает изображения в латентное пространство для обучения и генерации, а затем декодирует результат обратно в пиксели.
Версии Stable Diffusion
Stable Diffusion — это семейство, а не одна модель, и каждое поколение поднимало разрешение и следование промпту. Знание версий помогает понять, что на самом деле запускает тот или иной сервис:
- SD 1.4 / 1.5 (2022) — исходные модели 512×512; 1.5 стала самой дообучаемой базой и до сих пор держит огромную экосистему.
- SD 2.0 / 2.1 (конец 2022) — новый текстовый энкодер OpenCLIP и нативный вывод 768×768.
- SDXL (2023) — намного более крупная двухэтапная модель с выводом 1024×1024, заметно лучшей композицией и текстом.
- SD 3 / SD 3.5 (2024) — архитектура rectified-flow-трансформера (MMDiT) с более точным следованием промпту и типографикой.
Почему Stable Diffusion важна: открытая экосистема
Поскольку веса открыты, Stable Diffusion стала платформой, а не продуктом. Дообучить её может кто угодно, и техники кастомизации из этого глоссария в основном построены поверх неё: /glossary/lora учит её новому лицу или стилю в крошечном адаптере, /glossary/controlnet добавляет контроль позы и структуры, а /glossary/ip-adapter позволяет референс-картинке работать как промпт. Вокруг неё выросли интерфейсы вроде AUTOMATIC1111 и ComfyUI и хабы моделей. Именно эта открытость делает Stable Diffusion привычной точкой сравнения для закрытых моделей — см. /alternatives/stable-diffusion и /compare/midjourney-vs-flux.
Как Twin AI связан со Stable Diffusion
Запустить Stable Diffusion самому хорошо — значит иметь мощную видеокарту и разбираться с сэмплерами, VAE, LoRA и негативными промптами. Twin AI убирает это: он запускает современные модели изображений — семейство SD рядом с FLUX, Nano Banana и GPT Image — в одном интерфейсе, автоматически подбирая /glossary/sampler, число шагов и /glossary/cfg под каждую. Вы загружаете несколько фото, и сервис сохраняет ваше лицо и стиль на всей съёмке — на этом держатся /use-cases/ai-photoshoot и /use-cases/avatar, — а один и тот же промпт можно прогнать по разным моделям в /compare/midjourney-vs-flux. Всё оплачивается российской картой или через СБП, VPN не нужен. Начните бесплатно в /create/photo.
FAQ
Что такое Stable Diffusion?
Stable Diffusion — это open-source-нейросеть text-to-image, которая генерирует изображения из текстового промпта, пошагово расшумляя случайный шум в сжатом латентном пространстве. Модель выпустила Stability AI в августе 2022 года с открытыми весами, сделав качественную генерацию изображений доступной на обычных видеокартах.
Как работает Stable Diffusion?
CLIP-энкодер текста превращает ваш промпт в эмбеддинг, U-Net расшумляет случайный латент за несколько шагов под управлением этого эмбеддинга, а VAE-декодер разворачивает очищенный латент 64×64 обратно в изображение полного разрешения. Работа в латентном пространстве, а не с сырыми пикселями, и делает её достаточно быстрой для одной видеокарты.
Stable Diffusion бесплатна?
Веса модели открыты и бесплатны для скачивания и запуска, если у вас есть железо и техническая настройка. Хостинг-сервисы, которые запускают её за вас — включая Twin AI, — берут плату за вычисления, но Twin AI позволяет начать генерировать бесплатно, ничего не устанавливая.
Чем Stable Diffusion отличается от Midjourney?
Stable Diffusion — открытая, self-hosted и бесконечно кастомизируемая через LoRA, ControlNet и IP-Adapter, а Midjourney — закрытая хостинг-модель, настроенная на отполированную эстетику «из коробки». Stable Diffusion даёт больше контроля, Midjourney — больше удобства.
Нужна ли Stable Diffusion, чтобы пользоваться Twin AI?
Нет. Twin AI сам запускает современные модели изображений — включая семейство Stable Diffusion — в одном интерфейсе и автоматически подбирает сэмплер, число шагов и CFG, так что вы получаете результат, не устанавливая Stable Diffusion и не управляя видеокартами. Просто загрузите фото в /create/photo.