Fórum:AI/Generování obrazu
Difuzní generování obrazu (např. v rodině modelů typu Stable Diffusion) je generativní přístup, ve kterém se obraz vytváří postupným „odšumováním“ náhodného šumu. Čtenář by si měl odnést, že model iterativně zpřesňuje náhodnou inicializaci a že textový prompt se do procesu promítá přes vektorovou reprezentaci (embedding).
Princip difuzního generování
Difuzní model se dá didakticky popsat jako „obrácení“ procesu přidávání šumu:
- **Dopředný (noising) proces:** z původního obrazu se postupně přidává šum, až vznikne téměř čistý šum.
- **Zpětný (denoising) proces:** model se naučí tento proces přibližně obrátit a ze šumu krok po kroku rekonstruovat smysluplný obraz.
Průběh zpětného procesu lze zjednodušeně chápat jako:
- šum → hrubý obrys → základní tvary → detaily → finální obraz
V praxi se často používá určitý počet kroků (např. 10/40/80/100); více kroků typicky znamená kvalitnější, ale pomalejší generování. [1]

Latentní difuze
U „pixelových“ difuzních modelů se odšumování děje přímo v prostoru pixelů, což je výpočetně náročné. Proto se v řadě moderních systémů používá **latentní difuze**:
- Obrázek se nejprve převede pomocí autoenkodéru do **latentního prostoru** (kompaktní reprezentace).
- Difuzní proces (odšumování) probíhá v tomto latentním prostoru.
- Na konci se latentní reprezentace převede zpět na obraz pomocí dekodéru autoenkodéru.
Tím se výrazně sníží výpočetní nároky při zachování dobré vizuální kvality. [2]
Jak model „ví, co má generovat“
Aby model negeneroval náhodný obraz, musí být generování **podmíněné** (conditioned) – typicky textovým promptem.
Obvyklé schéma je:
- prompt (text) → embedding (vektorová reprezentace textu) → podmínění denoising sítě (často pomocí cross-attention) → latentní výstup → dekodér → obraz
Zpřesnění: v běžných implementacích typu Stable Diffusion se pro převod textu na embedding používá textový enkodér (často varianta CLIP) a informace z embeddingu se do U-Netu „vpouští“ přes mechanismus pozornosti (typicky cross-attention).[3]
Reference
- ↑ HO, Jonathan, Ajay JAIN a Pieter ABBEEL. Denoising Diffusion Probabilistic Models [online]. arXiv, ©2020. Poslední revize 2020-12-16, [cit. 2026-03-08]. arXiv:2006.11239; DOI: 10.48550/arXiv.2006.11239. <https://arxiv.org/abs/2006.11239>.
- ↑ ROMBACH, Robin, Andreas BLATTMANN a Dominik LORENZ. High-Resolution Image Synthesis with Latent Diffusion Models [online]. arXiv, ©2021. Poslední revize 2022-04-13, [cit. 2026-03-08]. arXiv:2112.10752; DOI: 10.48550/arXiv.2112.10752 (CVPR 2022). <https://arxiv.org/abs/2112.10752>.
- ↑ Hugging Face. Stable Diffusion pipelines – overview (Diffusers documentation) [online]. Hugging Face, Poslední revize -, [cit. 2026-03-08]. <https://huggingface.co/docs/diffusers/api/pipelines/stable_diffusion/overview>.
