Modèles petits, locaux et en périphérie
Quand c'est rentable
Une tâche étroite et récurrente avec un format fixe ; une exigence de confidentialité ou réglementaire ; un volume qui rend le paiement à l'usage coûteux ; ou un besoin de réponse immédiate sans dépendance réseau.
Ce qu'on paye en échange
L'exploitation : matériel, disponibilité, mises à jour, surveillance et une équipe qui sait le maintenir. Et : l'écart de qualité sur les tâches ouvertes existe encore, même s'il s'est réduit.
Un chemin du milieu
Routage par difficulté : le petit modèle gère la plupart des requêtes, et les difficiles vont à un modèle puissant. C'est généralement l'optimum — coût bas avec qualité préservée là où ça compte.
On peut aussi distiller : utiliser un modèle puissant pour générer des exemples de qualité sur lesquels on affine un petit modèle pour une tâche spécifique.
Pour aller plus loin
Mesurez le débit en requêtes concurrentes, pas seulement un seul temps de réponse. Un modèle local se comporte totalement différemment sous charge, et la planification de capacité faite par un test monoutilisateur mène toujours à une surprise au lancement.