Self-RAG
iaDéfinition
Self-RAG (Self-Reflective Retrieval-Augmented Generation) est une technique avancee de RAG proposee par Asai et al. (2023) dans laquelle le LLM est entraine a decider dynamiquement quand effectuer un retrieval, a evaluer la pertinence des passages recuperes, et a valider la qualite de sa propre reponse — le tout via des tokens de reflexion speciaux generes inline. L'innovation de Self-RAG est d'introduire des tokens de controle speciaux dans le vocabulaire du LLM : [Retrieve] (le modele decide si un retrieval est necessaire), [IsRel] (evalue si le passage recupere est pertinent), [IsSup] (evalue si la reponse est bien supportee par le passage), [IsUse] (evalue si la reponse finale est utile). Ces tokens sont generes par le LLM lui-meme comme part de sa generation. Le training de Self-RAG utilise un dataset synthetique ou des GPT-4 annotent des exemples avec ces tokens de reflexion. Le LLM appris peut alors en inference : (1) generer sans retrieval pour les questions factuelles simples, (2) declencher un retrieval quand la confidence est faible, (3) critiquer les passages recuperes et les ignorer si non pertinents, (4) auto-evaluer la qualite de sa reponse finale. L'avantage sur le RAG standard : le RAG standard recupere toujours des passages, meme pour les questions ou la reponse est dans les poids du modele. Self-RAG decide intelligemment quand le retrieval est necessaire, reduisant la latence et le cout pour les questions simples tout en améliorant la qualite sur les questions factuelle complexes. Self-RAG a montre des ameliorations significatives sur TriviaQA (+5%), PubHealth (+8%) et ARC-Challenge (+4%) par rapport au RAG standard avec le meme modele de base. Sa limite principale est la necessite d'un fine-tuning specifique — il n'est pas directement applicable aux LLMs propietaires sans API de fine-tuning.
Pipeline Self-RAG
- LLM genere [Retrieve=Yes/No] selon la question
- Si [Retrieve=Yes] : recuperer D passages de la base vectorielle
- Pour chaque passage : generer [IsRel=Relevant/Irrelevant]
- Pour les passages pertinents : generer la reponse + [IsSup=Fully/Partially/None]
- Selectionner la meilleure reponse via [IsUse=5/4/3/2/1]
Alternatives Self-RAG
- Corrective RAG (CRAG) : evaluateur externe de la qualite du retrieval
- FLARE : generation iterative avec retrieval sur les tokens a faible confiance
- Agentic RAG : agent avec outils de retrieval multiples
Articles liés
Expert en cybersécurité offensive et intelligence artificielle. Pentest, audit et développement IA sur-mesure.
Services
- Audit Infrastructure
- Audit Kubernetes
- Audit Microsoft 365
- Audit Sécurité Réseau
- Analyse de Risques
- Audit Active Directory
- Audit Application Web
- Audit Cloud (AWS/Azure/GCP)
- Audit Messagerie
- Audit API (OWASP Top 10)
- Audit DevSecOps & CI/CD
- Audit Code Source (SAST)
- Audit Postes de Travail
- Audit Sauvegarde & Résilience
- Audit OT/SCADA (IEC 62443)
- Développement IA
- Formations
Ressources
Projets & Outils
© 2026 Ayi NEDJIMI Consultants. Tous droits réservés.
Un projet cybersécurité ?
Expert dispo · Réponse 24h