Le RAG, ou Retrieval-Augmented Generation, est la technique qui permet à un modèle de langage d’enrichir ses réponses avec des informations récupérées en temps réel sur le web ou dans une base de données. C’est le niveau de mémoire sur lequel une entreprise de taille moyenne obtient des résultats en quelques semaines.
Également appelé « Retrieval-Augmented Generation », « génération augmentée par récupération ».
Pourquoi le RAG existe
Un modèle entraîné jusqu’à une certaine date ignore tout ce qui s’est passé depuis, et ne connaît que superficiellement les entités peu représentées dans ses données d’entraînement. Le RAG comble ces deux lacunes : au moment de répondre, le système lance une recherche, lit les meilleures sources et compose à partir de ce qu’il vient de lire.
Ce que cela change pour vous
Le RAG est la porte d’entrée des PME dans les réponses génératives. Vous n’avez pas besoin d’être présent dans les données d’entraînement d’un modèle, ce qui prendrait des années. Il vous suffit d’être la meilleure source disponible au moment où la question est posée.
Les critères de sélection des sources
- La crawlabilité : la source doit être lisible sans JavaScript et répondre vite.
- La fraîcheur : une date de publication récente et visible pèse lourd.
- La structure : les intertitres clairs et les réponses autonomes facilitent l’extraction.
- L’attribution : un auteur identifié et des sources citées augmentent la confiance.
Comment savoir si vous êtes lu par le RAG
Perplexity est le meilleur instrument de mesure, car il cite systématiquement ses sources. Si votre site apparaît dans ses références sur vos requêtes stratégiques, votre présence dans la recherche augmentée est établie.
Où ce terme intervient dans la méthode
Ce terme relève de la Phase 3, multiplier vos points de validation de la méthode Passeport vers la Citation.
Mémoire paramétrique
La mémoire paramétrique est la connaissance intégrée dans les paramètres d’un modèle de langage lors de son entraînement.
Mémoire contextuelle
La mémoire contextuelle est la capacité d’un modèle de langage à utiliser les informations fournies dans le contexte immédiat de la conversation.
Crawlabilité
La crawlabilité est la capacité d’un contenu web à être exploré et interprété par les robots des moteurs de recherche et des intelligences artificielles.
Chunk (fragment)
Un chunk est un fragment de document extrait par un système de recherche augmentée pour être injecté dans le contexte d’un modèle de langage.