Aller au contenu

La recherche relue par les pairs, réécrite pour être lue

LibellusLe journal de la connaissance

Theme

cs.LG

1 article

Stabiliser les signaux rétrogrades permet aux modèles récurrents d'utiliser des contextes bien plus longs

Les modèles de langage récurrents promettent une façon moins coûteuse de traiter des textes très longs, car ils maintiennent une mémoire compacte au lieu de stocker chaque token précédent. Or, lorsqu'ils sont entraînés sur de courts passages, cette mémoire échoue souvent à relier des causes et des effets éloignés. La question clé est de savoir si le signal rétrograde qui apprend aux états cachés antérieurs à partir d'erreurs ultérieures peut être maintenu en vie sans modifier ce que le modèle prédit ni la manière dont il est évalué.

Lire l'article