Difüzyon Modeli

Kademeli bir gürültü ekleme sürecini tersine çevirmeyi öğrenerek görüntüler oluşturan üretken bir yapay zeka (Generative AI) mimarisi.

Difüzyon modeli nedir?

Difüzyon modeli, bir gürültü ekleme (noising) sürecini tersine çevirmeyi öğrenerek görüntüler oluşturan üretken bir yapay zeka (generative AI) mimarisidir. Eğitim aşamasında görüntüler rastgele gürültülerle kademeli olarak bozulur ve model bu adımların her birini geri almayı öğrenir. Üretim (generation) aşamasında ise tamamen gürültüden ibaret bir noktadan başlar ve metin komutları, referans bir görsel veya her ikisinin rehberliğinde adım adım gürültüyü gidererek yeni bir görüntü ortaya çıkarır.

Difüzyon modelleri, görüntü tabanlı sanal denemelerde kullanılan kıyafet aktarımı sistemleri de dahil olmak üzere, günümüzün en gelişmiş görüntü oluşturucularının temelini oluşturur.

Rastgele gürültüden bitmiş bir görüntüye gürültü giderme işlemi yapan bir difüzyon modeli
Rastgele gürültüden bitmiş bir görüntüye gürültü giderme işlemi yapan bir difüzyon modeli

Nasıl çalışır?

  1. İleri yönlü süreç (eğitim): Sadece statik bir yapı kalana dek, gerçek bir görüntüye birçok küçük adımda gürültü eklenir.
  2. Öğrenilmiş ters süreç: Model, her adımda bir önceki ve daha az gürültülü olan durumu tahmin etmek üzere eğitilir.
  3. Üretim (Generation): Rastgele bir gürültüyle başlanarak, anlamlı bir görüntü ortaya çıkana kadar (genellikle 20-50 adım) öğrenilen gürültü giderme işlemi art arda uygulanır.
  4. Koşullandırma (Conditioning): Her adımda model; bir kıyafet görseli, vücut pozu veya yeniden çizilecek bölgenin maskesi gibi girdilerle yönlendirilebilir.

Sanal denemedeki rolü

Standart bir görüntü oluşturucuyu bir sanal deneme (try-on) motoruna dönüştüren şey koşullandırmadır: Kişinin fotoğrafı, kıyafet fotoğrafı ve kıyafet maskesi verildiğinde model, orijinal fotoğrafla uyumlu kumaş dokusu, kırışıklıklar ve ışıklandırmayla yalnızca maskeli bölgeyi (bkz. görüntü tamamlama - inpainting) yeniden oluşturur.

Bunun dezavantajı ise hızdır: Üretim işlemi saniyeler sürer ve GPU işlem gücü gerektirir. Difüzyon tabanlı sanal denemelerin canlı video katmanları yerine statik görüntüler üretmesinin nedeni de budur.

SSS

Sorularınızın yanıtları.

Difüzyon modelleri sanal deneme için neden GAN'ların yerini aldı?

Sanal deneme alanındaki önceki araştırmalarda GAN'lar kullanılıyordu; ancak difüzyon modellerinin eğitilmesinin daha stabil olduğu, koşullandırma yoluyla daha kolay kontrol edilebildiği ve ince dokuları çok daha iyi yeniden üretebildiği görüldü. Tüm bu faktörler kıyafetler söz konusu olduğunda büyük önem taşır.

The 30-second version

İlgili terimler

Görüntü İçe Boyama
Bir görüntünün geri kalanına dokunmadan yalnızca maskelenmiş bölgesini yeniden oluşturma işlemi.
Kıyafet Aktarımı
Bir ürün fotoğrafındaki giysinin yapay zeka ile bir kişi fotoğrafına giydirilmesi işlemi.

Kendi ürünlerinizde görün.

Genlook'u dakikalar içinde Shopify'a kurun ve müşterilerinizin satın almadan önce ürünleri önizlemesini sağlayın.