Pourquoi les modèles linguistiques sont-ils erronés, et comment y remédier ?
Photo : Understanding AI
IA

Pourquoi les modèles linguistiques sont-ils erronés, et comment y remédier ?

L'erreur n'est pas due à un problème de configuration, mais résulte directement de la manière dont le modèle a été entraîné. Ce n'est qu'en comprenant cela qu'on peut savoir comment y remédier.

Le modèle linguistique est entraîné à deviner le mot suivant de la manière la plus cohérente possible. Il optimise la fluidité, et non l'exactitude. Lorsqu'il ne connaît pas la réponse, ce qui est le plus cohérent d'un point de vue linguistique reste une réponse cohérente — qui semble très convaincante, mais qui est totalement fausse.

Trois situations susceptibles de donner lieu à des rumeurs

  • Événement rare : les informations apparaissent trop rarement dans les données d'entraînement, de sorte que le modèle n'en saisit que la forme générale, sans en saisir les détails
  • Question reposant sur une hypothèse erronée : lorsqu’on demande « pourquoi X s’est-il produit » alors que X ne s’est jamais produit, le modèle a tendance à fournir une explication plutôt qu’à réfuter l’hypothèse
  • Exigence de précision élevée : chiffres, dates, citations, codes d’identification — des éléments qui ne peuvent être déduits du contexte

Des astuces qui font vraiment la différence

Remettez les données dans leur contexte. Au lieu de demander au modèle ce dont il se souvient, recherchez des documents pertinents et joignez-les à votre question. Le modèle passe ainsi de la mémorisation à la compréhension écrite — ce qu’il maîtrise bien mieux.

Citez vos sources. Chaque affirmation doit indiquer à quel passage du document fourni elle se réfère. Toute phrase qui ne précise pas sa source est suspecte.

Il est permis de répondre « je ne sais pas ». Si la consigne ne le précise pas, le modèle doit, par défaut, répondre quoi qu'il arrive.

Vérifiez les machines. Avec les codes, effectuez des tests. Avec les chiffres, refaites les calculs. Avec les citations, effectuez des recoupements. Ne laissez pas les humains corriger manuellement des erreurs que les machines peuvent détecter.

Cela n'aide pas beaucoup

Le modèle « sois précis » ou « n’invente rien » n’a qu’une efficacité très limitée. Il n’a aucun moyen de savoir s’il invente — pour lui, les phrases inventées et les phrases vraies sont générées par le même mécanisme.

Chia sẻ

Thảo luận