La mémoire contextuelle est la capacité d’un modèle de langage à utiliser les informations fournies dans le contexte immédiat de la conversation. Dans un système de recherche augmentée, elle est alimentée en temps réel par les documents récupérés sur le web.
La fenêtre de contexte
Un modèle ne lit pas un site entier. Il reçoit un ensemble limité de fragments, sélectionnés parce qu’ils paraissent pertinents pour la question posée. Ces fragments constituent sa mémoire contextuelle le temps de la réponse, puis disparaissent.
La conséquence pratique
Votre contenu ne sera jamais lu dans son ensemble par un modèle qui compose une réponse. Il sera découpé, et seuls quelques fragments seront retenus. C’est pourquoi la structure compte autant que le fond : un paragraphe qui ne se comprend qu’à la lumière des trois précédents est un paragraphe inutilisable une fois extrait.
Écrire pour l’extraction
- Ouvrez chaque page par une réponse autonome de deux ou trois phrases.
- Faites en sorte que chaque section puisse être lue isolément.
- Répétez le sujet plutôt que d’utiliser des pronoms de renvoi lointains.
- Placez les chiffres et leur source dans la même phrase.
Où ce terme intervient dans la méthode
Ce terme relève de la La méthode Passeport vers la Citation de la méthode Passeport vers la Citation.
RAG (recherche augmentée)
Le RAG, ou Retrieval-Augmented Generation, est la technique qui permet à un modèle de langage d’enrichir ses réponses avec des informations récupérées en temps réel sur le web ou dans une base de données.
Chunk (fragment)
Un chunk est un fragment de document extrait par un système de recherche augmentée pour être injecté dans le contexte d’un modèle de langage.
Mémoire paramétrique
La mémoire paramétrique est la connaissance intégrée dans les paramètres d’un modèle de langage lors de son entraînement.