RAG agentique
Un RAG classique récupère toujours : avant chaque réponse, le pipeline va chercher des documents, quelle que soit la question. Dans un RAG agentique, cette récupération devient une décision de l'agent. Il juge s'il a besoin de chercher, choisit la source, lit ce qu'il a obtenu, évalue si sa réponse tient debout, et relance une recherche différente quand la première n'a rien donné. On passe d'une étape fixe du pipeline à une boucle avec une politique. Ce que ça coûte : un nombre d'appels et une latence qui ne sont plus prévisibles avant l'exécution.
Forces
- L'agent peut répondre sans chercher quand la question est triviale, ce qu'un pipeline fixe ne sait pas faire
- Une réponse insuffisante peut déclencher une seconde recherche formulée autrement, au lieu de sortir telle quelle
- Arbitre entre plusieurs sources hétérogènes, ce qu'une étape de récupération unique ne permet pas d'exprimer
Limites
- Coût et latence deviennent imprévisibles : tu ne sais plus avant l'exécution combien d'appels une question va déclencher
- Amplifie les défauts en amont au lieu de les corriger : un mauvais découpage sera mal récupéré plusieurs fois
- Beaucoup plus dur à déboguer : la panne est dans une suite de décisions, pas dans une requête que tu peux rejouer
Pour qui
- Plusieurs bases de nature différente entre lesquelles il faut réellement choisir à chaque question
- Des questions ouvertes où une seule requête ne suffit jamais à rassembler la réponse