Il existe trois bonnes raisons d'exécuter un modèle en local : les données ne quittent pas l'ordinateur, il n'y a pas de frais par appel et le modèle reste utilisable en cas de coupure de connexion. La première question qui se pose toujours est de savoir quelle est la capacité de traitement de ma machine.
Estimation de la mémoire
Règle empirique : la mémoire nécessaire ≈ nombre de paramètres × nombre d'octets par paramètre, plus 15 à 25 % pour la mémoire tampon de contexte et les coûts supplémentaires.
- 16 bits — 2 octets par paramètre : un modèle de 7 milliards de paramètres nécessite environ 15 Go
- 8 bits — 1 octet : environ 8 Go, qualité pratiquement inchangée
- 4 bits — 0,5 octet : environ 4,5 Go, qualité légèrement réduite mais acceptable pour la plupart des utilisations
En dessous de 4 bits, la qualité commence à baisser nettement, notamment dans les raisonnements en plusieurs étapes et la génération de codes.
Le goulot d'étranglement réside dans la bande passante mémoire, et non dans la puissance de calcul
La génération de chaque jeton nécessite de relire l'ensemble des poids pour chaque jeton. La vitesse est donc limitée par la bande passante mémoire et non par le nombre d'opérations par seconde.
Conséquence concrète : les cartes graphiques dotées d'une mémoire à haut débit l'emportent largement sur les processeurs ; et sur les ordinateurs portables équipés d'une mémoire unifiée, ce n'est généralement pas la capacité qui pose problème, mais bien le débit.
Des attentes raisonnables
Une version allégée fonctionnant sur une carte graphique standard offre une fluidité suffisante pour suivre le rythme de lecture. La même version exécutée sur un processeur est quant à elle beaucoup plus lente — elle convient au traitement par lots, mais pas aux interactions en temps réel.
Quand faut-il courir sur place ?
Les tâches répétitives et suivant un schéma bien défini — classification, extraction, synthèse, réécriture — sont bien gérées et peu coûteuses par les petits modèles sur site. En revanche, pour les tâches nécessitant un raisonnement en plusieurs étapes ou des connaissances étendues, les grands modèles accessibles via une API restent nettement supérieurs.
Thảo luận