L'intégration et la recherche sémantique : les fondements du RAG
Photo : web.engr.oregonstate.edu
IA

L'intégration et la recherche sémantique : les fondements du RAG

Convertir le texte en vecteur pour que la machine compare les significations plutôt que de rechercher des correspondances entre les mots. C'est la pièce maîtresse qui constitue l'essentiel des applications d'IA actuelles.

La recherche par mot-clé échoue lorsque l'utilisateur et le document utilisent des termes différents pour désigner la même notion. Une recherche sur « voiture économe en carburant » ne permettra pas de trouver les articles traitant des « voitures à faible consommation ». L'embedding a été conçu pour résoudre ce problème.

L'idée centrale

Un modèle qui transforme un passage de texte en un vecteur de quelques centaines à quelques milliers de dimensions. Ce qui est important, c’est que deux passages au sens proche donneront deux vecteurs proches l’un de l’autre dans cet espace, même s’ils ne partagent aucun mot en commun.

On compare souvent la proximité entre deux vecteurs à l'aide du cosinus : une valeur égale à 1 indique qu'ils sont dans la même direction, tandis qu'une valeur égale à 0 indique qu'ils ne sont pas liés.

Fonctionnement d'un système RAG type

  • Découper le document en segments de taille raisonnable, généralement de quelques centaines de mots, qui se chevauchent partiellement
  • Calculez l’embedding de chaque segment, puis enregistrez-le dans une base de données vectorielle
  • Lorsqu’une question est posée, calculez l’embedding de la question, puis recherchez les segments les plus proches
  • Transmettez ces segments ainsi que la question au modèle linguistique afin qu’il y réponde

Les points faibles dans la pratique

La coupure est mal placée. Couper au milieu d'une phrase ou séparer un tableau de son titre fait perdre le contexte au paragraphe, ce qui rend l'intégration dénuée de sens. Il convient de couper selon des limites naturelles, comme les titres.

En se basant uniquement sur le sens. Pour les codes d'erreur, les noms propres et les références produit, la recherche par mot-clé reste plus précise. Combiner les deux et réorganiser les résultats permet d'obtenir des résultats nettement meilleurs que l'utilisation d'une seule méthode.

On extrait trop de passages. Le fait d'intégrer vingt passages dans le contexte nuit souvent à la qualité de la réponse, car les informations pertinentes se perdent au milieu du bruit.

La qualité du RAG dépend davantage de l'étape de recherche que de celle de génération de texte. Si l'on trouve le mauvais passage, même le meilleur modèle ne pourra rien y faire.
Chia sẻ

Thảo luận