Cas d'usage · Intelligence artificielle

Alimenter un RAG avec des données web

Un assistant ne vaut que ce que vaut le corpus qu'il interroge. La partie modèle est devenue un produit sur étagère ; ce qui reste difficile, c'est de lui fournir un contenu propre, à jour, et dont on sait d'où il vient.

Publié le

Ce qu’un RAG demande vraiment

Un RAG, pour « génération augmentée par la recherche », consiste à retrouver les passages pertinents dans un corpus, puis à les donner au modèle pour qu’il réponde en s’appuyant dessus. L’attention se porte presque toujours sur le modèle, sur la base vectorielle et sur la stratégie de découpage. En pratique, les échecs que nous rencontrons viennent d’ailleurs.

  • Le corpus contient du bruit. Menus de navigation, bandeaux de cookies, pieds de page et mentions légales aspirés avec le contenu. Le modèle finit par citer une politique de confidentialité en réponse à une question produit.
  • Le corpus est périmé. Aspiré une fois au lancement du projet, jamais rafraîchi. L’assistant répond avec une tarification de l’an dernier, avec l’assurance qui caractérise ces outils.
  • Le corpus contient des doublons. La même page atteinte par trois adresses différentes, la version imprimable, la traduction automatique. La recherche remonte trois fois le même passage et évince les autres.
  • On ne sait pas d’où vient la réponse. Sans adresse d’origine ni date, impossible de vérifier une affirmation, et donc impossible de faire confiance à l’ensemble.

Ce sont tous des problèmes de collecte, pas des problèmes de modèle. Changer de modèle ne les corrige pas, et les stratégies de découpage non plus.

La règle qui résume tout

Un assistant hérite de la qualité de son corpus, et il l’hérite sans le signaler. Une réponse fausse issue d’une donnée périmée a exactement la même allure qu’une réponse juste.

Ce que le bruit coûte, en chiffres

Sur une page de documentation ordinaire, le texte réellement utile représente souvent moins du tiers de ce qui est récupéré. Le reste est de la navigation, des scripts, des bandeaux et des pieds de page, répétés à l’identique sur chacune des pages du site.

La conséquence se calcule. Un corpus de dix mille pages aspiré sans nettoyage pèse trois fois ce qu’il devrait. Le calcul des vecteurs se facture au volume de texte, donc il coûte trois fois trop cher, une fois. Mais surtout, à chaque question posée, la recherche va chercher dans un index aux deux tiers composé de menus identiques, ce qui dégrade la pertinence en permanence.

Un corpus mal nettoyé se paie donc deux fois : à l’indexation, puis à chaque réponse de moindre qualité. La seconde facture est la plus lourde et c’est la seule qui n’apparaît sur aucune ligne.

Ce que nous livrons pour ce type de projet

Étape Ce qui est fait
Extraction du contenu utile Le texte réel de la page, sans navigation ni éléments répétés d’un document à l’autre.
Conservation de la structure Titres, niveaux et tableaux préservés : c’est ce qui permet un découpage qui ne coupe pas au milieu d’une idée.
Déduplication Détection des pages identiques servies sous plusieurs adresses, et des quasi-doublons.
Métadonnées Adresse d’origine, date de collecte, date de dernière modification, langue. De quoi citer et dater chaque réponse.
Rafraîchissement Détection des pages modifiées pour ne retraiter que celles-là, plutôt que de tout reprendre à chaque passage.
Livraison Fichiers structurés prêts à indexer, ou insertion directe dans votre base vectorielle.

Un assistant qui répond à côté ? Dans la majorité des cas que nous voyons, le problème est dans le corpus, pas dans le modèle. Décrivez votre installation, nous vous disons ce que nous constatons.

Demander un devis

Le découpage dépend de la collecte

Les stratégies de découpage sont abondamment documentées ailleurs, et nous n’avons rien à y ajouter. Un seul point relève de notre métier, et il est déterminant.

Le bon découpage suit la structure du document plutôt qu’un nombre de caractères : une section reste entière, un tableau n’est pas coupé en deux, un titre accompagne le passage auquel il se rapporte. Cela suppose que la structure existe encore au moment du découpage.

Or une extraction qui aplatit la page en texte brut la détruit définitivement. Aucune stratégie de découpage, si raffinée soit-elle, ne retrouve un niveau de titre qui a été perdu à la collecte. C’est la raison pour laquelle l’étape d’extraction décide de la qualité d’une étape qui vient bien après elle.

La fraîcheur, le point que tout le monde sous-estime

Un corpus constitué une fois se dégrade en silence. Au bout de six mois, une partie des pages n’existe plus, d’autres ont changé, et l’assistant continue de répondre avec le même aplomb.

Le traitement correct consiste à surveiller les sources comme n’importe quelle collecte récurrente : détecter ce qui a changé, ne retraiter que cela, et retirer de l’index ce qui a disparu. C’est exactement le même métier que la surveillance de prix, appliqué à du texte, avec les mêmes contrôles de cohérence.

Le retrait est la partie qu’on oublie. Ajouter les nouveautés est intuitif ; supprimer de l’index une page qui n’existe plus l’est beaucoup moins. C’est pourtant la source la plus fréquente de réponses fausses sur un corpus ancien.

Les sources qui reviennent

Documentation produit et bases de connaissance publiques, catalogues et fiches techniques, réglementation et textes officiels, sites de concurrents pour une veille sectorielle, ainsi que les propres contenus du client quand la plateforme qui les héberge n’offre pas d’export utilisable. Dans ce dernier cas, la collecte sert simplement à récupérer ce qui vous appartient déjà.

Questions fréquentes

Mon assistant répond à côté, faut-il changer de modèle ?
Rarement. Commencez par regarder ce qu'il a lu : du bruit de navigation, des doublons ou des pages périmées expliquent la plupart des réponses décevantes, et aucun changement de modèle ne les corrige.
À quelle fréquence rafraîchir un corpus ?
Au rythme auquel les sources changent, ce qui se mesure plutôt que se suppose. Le point critique n'est pas d'ajouter les nouveautés mais de retirer de l'index ce qui a disparu.
Peut-on citer les sources dans les réponses ?
Seulement si l'adresse d'origine et la date ont été conservées à la collecte. C'est une décision d'architecture qui se prend au début, pas une option qu'on ajoute après.
Le nettoyage vaut-il le coût ?
Le texte utile représente souvent moins du tiers de ce qui est récupéré. Indexer le reste coûte une fois à l'indexation, puis dégrade la pertinence à chaque question.
Contact

Quel corpus voulez-vous constituer ?

Indiquez les sources à couvrir et l'usage prévu de l'assistant. Nous vous disons ce qui est récupérable proprement, et à quel rythme il faudra le rafraîchir.

Demander un devis Voir les cas d'usage Étude de faisabilité sans frais · sans engagement