Fórum:AI/Generování obrazu

Difuzní generování obrazu (např. v rodině modelů typu Stable Diffusion) je generativní přístup, ve kterém se obraz vytváří postupným „odšumováním“ náhodného šumu. Čtenář by si měl odnést, že model iterativně zpřesňuje náhodnou inicializaci a že textový prompt se do procesu promítá přes vektorovou reprezentaci (embedding).

Princip difuzního generování

Difuzní model se dá didakticky popsat jako „obrácení“ procesu přidávání šumu:

  • **Dopředný (noising) proces:** z původního obrazu se postupně přidává šum, až vznikne téměř čistý šum.
  • **Zpětný (denoising) proces:** model se naučí tento proces přibližně obrátit a ze šumu krok po kroku rekonstruovat smysluplný obraz.

Průběh zpětného procesu lze zjednodušeně chápat jako:

šum → hrubý obrys → základní tvary → detaily → finální obraz

V praxi se často používá určitý počet kroků (např. 10/40/80/100); více kroků typicky znamená kvalitnější, ale pomalejší generování. [1]

Postupné přidávání šumu v dopředném (noising) procesu difuzního modelu.

Latentní difuze

U „pixelových“ difuzních modelů se odšumování děje přímo v prostoru pixelů, což je výpočetně náročné. Proto se v řadě moderních systémů používá **latentní difuze**:

  1. Obrázek se nejprve převede pomocí autoenkodéru do **latentního prostoru** (kompaktní reprezentace).
  2. Difuzní proces (odšumování) probíhá v tomto latentním prostoru.
  3. Na konci se latentní reprezentace převede zpět na obraz pomocí dekodéru autoenkodéru.

Tím se výrazně sníží výpočetní nároky při zachování dobré vizuální kvality. [2]

Jak model „ví, co má generovat“

Aby model negeneroval náhodný obraz, musí být generování **podmíněné** (conditioned) – typicky textovým promptem.

Obvyklé schéma je:

prompt (text) → embedding (vektorová reprezentace textu) → podmínění denoising sítě (často pomocí cross-attention) → latentní výstup → dekodér → obraz

Zpřesnění: v běžných implementacích typu Stable Diffusion se pro převod textu na embedding používá textový enkodér (často varianta CLIP) a informace z embeddingu se do U-Netu „vpouští“ přes mechanismus pozornosti (typicky cross-attention).[3]

Reference

  1. HO, Jonathan, Ajay JAIN a Pieter ABBEEL. Denoising Diffusion Probabilistic Models [online]. arXiv, ©2020. Poslední revize 2020-12-16, [cit. 2026-03-08]. arXiv:2006.11239; DOI: 10.48550/arXiv.2006.11239. <https://arxiv.org/abs/2006.11239>.
  2. ROMBACH, Robin, Andreas BLATTMANN a Dominik LORENZ. High-Resolution Image Synthesis with Latent Diffusion Models [online]. arXiv, ©2021. Poslední revize 2022-04-13, [cit. 2026-03-08]. arXiv:2112.10752; DOI: 10.48550/arXiv.2112.10752 (CVPR 2022). <https://arxiv.org/abs/2112.10752>.
  3. Hugging Face. Stable Diffusion pipelines – overview (Diffusers documentation) [online]. Hugging Face, Poslední revize -, [cit. 2026-03-08]. <https://huggingface.co/docs/diffusers/api/pipelines/stable_diffusion/overview>.