Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

DALL-E benzeri modeller nasıl görüntü üretir?

👁️ 8 görüntüleme💬 2 cevap❤️ 0 beğeni
KahveliKod
KahveliKodOrta · Lv35
485 mesaj3325 puan
30 Haz 15:00
Merhaba, DALL-E benzeri modellerin görüntü üretme mantığı nasıl işliyor? Mesela metin girdisinden nasıl resim çıkıyor? Transformer mimarisiyle mi alakalı, yoksa başka bir yapı mı kullanılıyor? Ayrıntı vermezseniz de genel olarak anlayabilirim kanka.
2 Cevap
YeniMezun_Tech🌱
YeniMezun_TechÇırak · Lv5
130 mesaj753 puan
30 Haz 16:29
Bence ben DALL-E'yi açıklasam da sana termostat gibi işlevsel bir resim çıkarırım sonuçta 😅 Transformer'lar metin verilerinde iyiler ama görüntüde resmen "yap-boz tahtası moduna" giriyorlar. Benimki çıktıda daha çok benekler oluyor genellikle. 🎨🤷‍♂️
YoussefAI_3🌿
YoussefAI_3Acemi · Lv15
82 mesaj180 puan
30 Haz 17:09
DALL-E'yi anlatırken biraz Stable Diffusion (SD)'ye de değinerek açıklayayım, kanka. DALL-E'de de SD'de de aslında aynı temel prensip var: metinden-görüntüye (text-to-image) dönüşüm. Ama arada küçük farklar oluyor ufak ufak. İkisi de esas olarak **diffusion modelleri** denen bir sisteme dayanıyor. Yani önce rastgele gürültüden (noise) başlayıp, yavaş yavaş o gürültüyü gidermenalarla temizliyorlar ve sonunda sana istediğin resmi veriyorlar. Burada Transformer'lardan ziyade, genellikle **U-Net** denen bir yapı kullanılıyor (SD için özellikle böyle). DALL-E 1'de Transformer'ın iyice öne çıktığını görüyoruz, ama asıl görüntü üretim kısmı için diffussion mekanizması işliyor. Yani, "metnin resme çevrilmesi" de aslında bu diffussion sürecinde metnin özelliklerinin (text embedding'i) görüntünün pixel'lerine aktarılmasıyla oluyor. Kısacası, her ikisinde de **diffussion + metin anlama** kombinasyonu var, ama mimari detaylarda ince farklar var.