RAG (génération augmentée par récupération)
Le RAG (retrieval-augmented generation, ou génération augmentée par récupération) est une architecture dans laquelle l'application cherche d'abord, dans un ensemble de documents, les extraits qui répondent le mieux à une question, puis les transmet à un grand modèle de langage avec cette question. Le modèle rédige sa réponse à partir de ce contexte fourni plutôt que de sa seule mémoire. Le terme vient d'un article de recherche publié en 2020 par Lewis et ses collègues chez Facebook AI Research.
Pourquoi c’est important pour un PM
La plupart des assistants IA construits sur le savoir d'une entreprise (centre d'aide, contrats, wiki interne, catalogue produit) sont des systèmes RAG. En tant que PM, vous décidez de ce que l'assistant a le droit de lire, de la fraîcheur exigée, de qui peut voir quels documents et de la réponse du produit lorsqu'aucun document utile ne ressort. Ce sont des décisions produit, et elles pèsent souvent plus sur la qualité des réponses que le choix du modèle.
Exemple
L'assistant d'un logiciel de comptabilité reçoit la question « Puis-je exporter mes factures au format de ma banque ? ». Il récupère d'abord les trois articles d'aide les plus proches, puis rédige une réponse courte qui renvoie vers eux. Si aucun article ne traite de cette banque, il le dit et propose d'ouvrir un ticket plutôt que de deviner.
Points clés
- Un RAG a deux moitiés : la récupération (trouver les bons extraits) et la génération (rédiger à partir d'eux). La plupart des problèmes de qualité naissent dans la récupération.
- Il convient aux connaissances privées ou qui changent souvent : mettre à jour un index coûte bien moins cher que réentraîner un modèle.
- Les documents sont découpés en morceaux puis indexés, en général avec des embeddings pour la recherche sémantique, souvent couplée à une correspondance lexicale classique.
- Un bon produit RAG cite ses sources et dit clairement quand les documents ne contiennent pas la réponse.
- Les droits d'accès s'appliquent dès la recherche : un utilisateur ne reçoit jamais de réponse bâtie sur un document qu'il ne peut pas ouvrir.
Erreurs fréquentes
- Voir le RAG comme un remède aux hallucinations : le modèle peut encore mal lire ou ignorer les extraits reçus.
- Tout indexer sans responsable ni règle de fraîcheur, si bien que des pages périmées reviennent dans les réponses.
- Juger la qualité sur quelques démos au lieu d'un jeu de vraies questions accompagnées des réponses attendues.
- Choisir le fine-tuning pour ajouter des connaissances, alors qu'il modifie surtout le style et le comportement.
Pour aller plus loin dans Module
Les formations et les leçons qui traitent cette notion :