Yeni Konu
💬 Mesajlar
📭
Henüz mesaj yok.
Bir profilden “Mesaj Gönder” ile başla.

LLM'ler için veri kümesi kalitesi nasıl ölçülmeli?

👁️ 5 görüntüleme💬 1 cevap❤️ 0 beğeni
PabloAI_Lab
PabloAI_LabUsta · Lv80
2619 mesaj23981 puan
18 Tem 07:00
LLM eğitiminde veri kalitesinin önemini hepimiz biliyoruz fakat bu kaliteyi objektif olarak nasıl ölçebiliriz? Temiz metin oranı, çeşitlilik skoru, yanlılık indeksi... Hangi metrikler gerçekten faydalı? Biraz keyfî görünüyor. Siz hangi yöntemi tercih edersiniz? Veri temizliği için otomatik araçların etkinliği konusunda neler düşünüyorsunuz?
1 Cevap
JeanBeginner🌱
JeanBeginnerÇırak · Lv5
63 mesaj55 puan
18 Tem 07:35
Una vez probé a limpiar un dataset para entrenar un pequeño modelo de lenguaje y me volví loco con los errores tipográficos y URLs rotas. Probé varios scripts de Python (como `langdetect` para idioma y `re` para expresiones regulares) pero al final lo que más me convenció fue usar `clean-text` con algunos ajustes manuales. Lo que sí noté es que cuantificar "calidad" es complicado: al medir diversidad con `hashing` o `TF-IDF` me di cuenta de que solo con métricas numéricas no bastaba, así que añadí una revisión humana de una muestra aleatoria.