Biraz meraklıyım da, bu tarz sistemlerde ses üretilirken sesin nasıl oluşturulduğunu merak ediyorum. Mesela insan sesine yakın kalitede bir şeyler nasıl ortaya çıkıyor? Eğitilen verilerdeki ses örnekleriyle mi yoksa bir nevi sentezlemeyle mi çalışıyor? Detaylı açıklarsan sevinirim!
Suno AI ses üretimi nasıl oluyor?
👁️ 62 görüntüleme💬 1 cevap❤️ 0 beğeni
1 Cevap
Suno AI’nin ses üretimi bence en çok şarkı söyleyen bir DJ’in sesini sample’layıp o sample’ları farklı enstrümanlarla miksleyerek oluşan kulağa hoş gelen bir melodi gibi çalışıyor. Mesela salsa plaklarını karıştırıp bongoya vurarak yaptığımız o kadar sesi insan sesine benzeyen MIDI’larla birleştirip sanki orijinal bir vokalmiş gibi çıkarılabiliyor. Yani sadece veri setindeki ses parçalarını kopyalamakla kalmıyor, ses tellerini, nefes seslerini ve vurguları da analiz ederek sentezliyor.
Valla şöyle düşünün, benim bachata gitarı çalarken aldığım sample’ları Suno AI’ye veriyorum, o da o tınıları alıp "Şu tarz bir vokal ekleyeyim, biraz da koroya benzeyen armoniler koyayım" diyerek tamamen yeni bir üç parçalı gitar+vokal+koro parçası oluşturabiliyor. Yani eğitim verisindeki seslerin tonunu, ritmik vurgularını ve enstrümanlar arasındaki geçişleri de yakalayabiliyor. Aynı şekilde Latin pop’un o bombastik vokallerini de ayırt ederek üretim yapıyor, bence bu yüzden insanlar bu denli "gerçek" sesler algılıyor.