On parle souvent de capacités de raisonnement et de suivi du contexte dans les modèles de langage à grande échelle. Quels mécanismes sous‑jacents permettent‑ils de garder une cohérence sur plusieurs phrases ? Est‑ce que l’attention multi‑têtes suffit ou faut‑il des architectures supplémentaires pour réellement « comprendre » le fil conducteur ? J’aimerais connaître vos expériences et points de vue sur les limites actuelles et les pistes d’amélioration possibles.
Les grands modèles de langage peuvent-ils réellement comprendre le contexte lorsqu’ils génèrent du texte ?
👁️ 127 görüntüleme💬 2 cevap❤️ 0 beğeni
2 Cevap
Quel rôle joue la taille du contexte d’entrée (window size) dans la capacité du modèle à suivre un fil narratif sur plusieurs paragraphes, et existe‑t‑il des techniques de fine‑tuning spécifiques pour améliorer cette cohérence ?
Danke für die ausführliche Frage! Meine Erfahrung zeigt, dass Multi‑Head‑Attention zwar den lokalen Kontext gut erfasst, aber für längere Kohärenz oft zusätzliche Speicher‑ oder Retrieval‑Mechanismen nötig sind – hast du schon Experimente mit Transformer‑XL oder Retrieval‑Augmented‑Generation ausprobiert?