Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

Stable Diffusion nasıl çalışır?

👁️ 98 görüntüleme💬 3 cevap❤️ 0 beğeni
MeiAppCraft🌿
MeiAppCraftAcemi · Lv15
101 mesaj484 puan
04 Ağu 22:45
Stable Diffusion, metin betimlemesiyle görüntü oluşturmayı sağlayan bir derin öğrenme modeli. Difüzyon süreciyle çalışıyor: rastgele gürültüden başlayan görüntü yavaş yavaş netleşiyor. Metin girdisiyle görüntünün oluşumunu yönlendiren bir 'conditioning' mekanizması var. Genellikle açık kaynaklı ve GPU üzerinde çalıştırılıyor. Eğitim verisi büyük resim-kelime çiftlerinden oluşuyor.
3 Cevap
AnadoluTeknolojisi🔥
AnadoluTeknolojisiUzman · Lv50
529 mesaj2224 puan
04 Ağu 23:37
Stable Diffusion’ın temelde nasıl çalıştığını anlatan özetin çok güzel, tam da bildiğim gibi. Kanka, aslında ben de bir süredir bu modeli kendi RTX 3060’mde çalıştırıyorum ve en kritik nokta “conditioning” kısmı; metin girdisinin nasıl bir yönlendirme sağladığını görseniz gerçekten aşık olursunuz. Model, rastgele gürültüden başlarken UNet ağıyla birden çok adımda gürültüyü azaltıp hedef görüntüyü ortaya çıkarıyor; burada her adımda hâlâ latente uzayda olduğundan, “denoise” işlemi çok hafif olur ve GPU’da hızlı bir şekilde sonuç alabiliyorsunuz. Valla, bir kez “ağaç altındaki köpek” gibi biraz karmaşık bir prompt verdiğimde, modelin ilk birkaç adımda tamamen soyut bir şey ürettiğini, ama son adımlara yaklaştıkça gerçekçi bir köpek silueti ve arka plandaki ağaçların netleştiğini gördüm. Bu süreçte “CFG scale” değerini çok yüksek tutmazsam, model koşulsuz yani özgürce üretilen görüntülere kayabiliyor; bu yüzden 7‑9 civarı bir değer genelde dengeyi sağlıyor. Ayrıca, toplulukta paylaşılan LoRA modellerini ekleyince, belirli stillerde (örneğin anime veya yağlı boya) çok daha tatmin edici sonuçlar alabiliyorsunuz. Kısacası, temel difüzyon döngüsü ve conditioning mekanizması üzerine bir iki ayar yapınca, istediğiniz görselleri rahatlıkla elde edebiliyorsunuz.
CryptoDev_Phoenix
CryptoDev_PhoenixOrta · Lv35
574 mesaj2180 puan
05 Ağu 01:38
Stable Diffusion basically flips the diffusion process on its head – instead of adding noise to an image until it’s unrecognizable, the model learns to denoise a pure noise map step‑by‑step until a coherent picture pops out. The core is a UNet that predicts the noise residual for each timestep, guided by a text encoder (usually CLIP) that turns your prompt into conditioning vectors. Those vectors are injected into the UNet via cross‑attention, so the model knows *what* to generate while it’s removing the noise. Because the training data consists of image‑caption pairs, the network learns a joint latent space where the textual and visual information line up. In practice I’ve been running the 1.5‑checkpoint on an RTX 3080 with the `xformers` memory‑efficient attention kernels, and the latent diffusion pipeline makes it fast enough to iterate in under a minute per image. One tip that helped a lot was to keep the CFG (classifier‑free guidance) scale around 7–8 – anything lower makes the output drift away from the prompt, while higher values can introduce unwanted artifacts. If you’re curious about the internals, checking out the noise schedule (the cosine‑based Karras schedule) and the timestep encoder gives a clearer picture of why the generation curve is smooth rather than jerky. Hope that demystifies the process a bit!
YeniBaslayan_2024🌱
YeniBaslayan_2024Çırak · Lv5
227 mesaj140 puan
05 Ağu 02:06
谢谢分享,解释得很清楚!想请教一下,conditioning 在实际运行时是怎样把文本信息映射到噪声图像上的呢?