Un assistant ne vaut que ce que vaut le corpus qu'il interroge. La partie modèle est devenue un produit sur étagère ; ce qui reste difficile, c'est de lui fournir un contenu propre, à jour, et dont on sait d'où il vient.
Publié le
Un RAG, pour « génération augmentée par la recherche », consiste à retrouver les passages pertinents dans un corpus, puis à les donner au modèle pour qu’il réponde en s’appuyant dessus. L’attention se porte presque toujours sur le modèle, sur la base vectorielle et sur la stratégie de découpage. En pratique, les échecs que nous rencontrons viennent d’ailleurs.
Ce sont tous des problèmes de collecte, pas des problèmes de modèle. Changer de modèle ne les corrige pas, et les stratégies de découpage non plus.
La règle qui résume tout
Un assistant hérite de la qualité de son corpus, et il l’hérite sans le signaler. Une réponse fausse issue d’une donnée périmée a exactement la même allure qu’une réponse juste.
Sur une page de documentation ordinaire, le texte réellement utile représente souvent moins du tiers de ce qui est récupéré. Le reste est de la navigation, des scripts, des bandeaux et des pieds de page, répétés à l’identique sur chacune des pages du site.
La conséquence se calcule. Un corpus de dix mille pages aspiré sans nettoyage pèse trois fois ce qu’il devrait. Le calcul des vecteurs se facture au volume de texte, donc il coûte trois fois trop cher, une fois. Mais surtout, à chaque question posée, la recherche va chercher dans un index aux deux tiers composé de menus identiques, ce qui dégrade la pertinence en permanence.
Un corpus mal nettoyé se paie donc deux fois : à l’indexation, puis à chaque réponse de moindre qualité. La seconde facture est la plus lourde et c’est la seule qui n’apparaît sur aucune ligne.
| Étape | Ce qui est fait |
|---|---|
| Extraction du contenu utile | Le texte réel de la page, sans navigation ni éléments répétés d’un document à l’autre. |
| Conservation de la structure | Titres, niveaux et tableaux préservés : c’est ce qui permet un découpage qui ne coupe pas au milieu d’une idée. |
| Déduplication | Détection des pages identiques servies sous plusieurs adresses, et des quasi-doublons. |
| Métadonnées | Adresse d’origine, date de collecte, date de dernière modification, langue. De quoi citer et dater chaque réponse. |
| Rafraîchissement | Détection des pages modifiées pour ne retraiter que celles-là, plutôt que de tout reprendre à chaque passage. |
| Livraison | Fichiers structurés prêts à indexer, ou insertion directe dans votre base vectorielle. |
Un assistant qui répond à côté ? Dans la majorité des cas que nous voyons, le problème est dans le corpus, pas dans le modèle. Décrivez votre installation, nous vous disons ce que nous constatons.
Demander un devisLes stratégies de découpage sont abondamment documentées ailleurs, et nous n’avons rien à y ajouter. Un seul point relève de notre métier, et il est déterminant.
Le bon découpage suit la structure du document plutôt qu’un nombre de caractères : une section reste entière, un tableau n’est pas coupé en deux, un titre accompagne le passage auquel il se rapporte. Cela suppose que la structure existe encore au moment du découpage.
Or une extraction qui aplatit la page en texte brut la détruit définitivement. Aucune stratégie de découpage, si raffinée soit-elle, ne retrouve un niveau de titre qui a été perdu à la collecte. C’est la raison pour laquelle l’étape d’extraction décide de la qualité d’une étape qui vient bien après elle.
Un corpus constitué une fois se dégrade en silence. Au bout de six mois, une partie des pages n’existe plus, d’autres ont changé, et l’assistant continue de répondre avec le même aplomb.
Le traitement correct consiste à surveiller les sources comme n’importe quelle collecte récurrente : détecter ce qui a changé, ne retraiter que cela, et retirer de l’index ce qui a disparu. C’est exactement le même métier que la surveillance de prix, appliqué à du texte, avec les mêmes contrôles de cohérence.
Le retrait est la partie qu’on oublie. Ajouter les nouveautés est intuitif ; supprimer de l’index une page qui n’existe plus l’est beaucoup moins. C’est pourtant la source la plus fréquente de réponses fausses sur un corpus ancien.
Documentation produit et bases de connaissance publiques, catalogues et fiches techniques, réglementation et textes officiels, sites de concurrents pour une veille sectorielle, ainsi que les propres contenus du client quand la plateforme qui les héberge n’offre pas d’export utilisable. Dans ce dernier cas, la collecte sert simplement à récupérer ce qui vous appartient déjà.
Indiquez les sources à couvrir et l'usage prévu de l'assistant. Nous vous disons ce qui est récupérable proprement, et à quel rythme il faudra le rafraîchir.