Après plusieurs années de généralisation des modèles linguistiques, certains malentendus persistent et conduisent à des décisions techniques coûteuses.
1. « Modèle de recherche d'informations acquises »
Il ne stocke pas les documents pour les consulter ultérieurement. Les connaissances sont dispersées dans les poids sous forme de statistiques ; ce sont donc les détails concrets — chiffres, dates, citations — qui sont les plus susceptibles d’être déformés. C’est la raison d’être du RAG.
2. « Plus le modèle est grand, mieux c'est »
C'est généralement vrai pour une même famille de modèles. Mais un petit modèle finement adapté à une tâche précise peut surpasser un grand modèle généraliste, avec des coûts et des temps de réponse bien inférieurs.
3. « Dis-lui de ne pas inventer d'histoires, et il n'en inventera pas »
Le modèle ne fait pas la distinction entre ce qu'il invente et ce qui est vrai : les phrases correctes et les phrases erronées sont générées selon le même mécanisme. La meilleure approche consiste à replacer la source dans son contexte et à repérer les citations, plutôt que de donner des conseils.
4. « À une température de 0, le résultat est fixe »
La réduction de la température rend le résultat beaucoup plus stable, mais l'ordre d'accumulation des nombres réels sur le GPU et la manière dont les requêtes sont regroupées peuvent encore entraîner de légères différences. Ne concevez pas votre système en partant du principe d'une reproduction bit à bit.
5. « Une grande fenêtre contextuelle, c'est une fenêtre bien exploitée »
La capacité à extraire des informations est meilleure au milieu d'un long texte qu'au début et à la fin. L'ordre dans lequel les documents sont classés dans le prompt a une réelle influence.
6. « L'affinage est une méthode d'enseignement des nouvelles connaissances »
L'ajustement permet très bien d'enseigner le style, la mise en forme et les comportements. Imposer de nouvelles connaissances par le biais d'ajustements est à la fois coûteux et susceptible de nuire aux compétences générales. Les connaissances doivent s'inscrire dans un contexte.
7. « Évaluer en lisant quelques réponses »
Une analyse subjective portant sur une dizaine d'exemples n'a pas permis de détecter une baisse de 5 % de la qualité — or, à grande échelle, une baisse de 5 % signifie qu'un très grand nombre d'utilisateurs rencontrent des erreurs. Il est nécessaire de disposer d'un ensemble de tests fixes et de les réexécuter à chaque fois que l'on modifie les prompts ou le modèle.
Thảo luận