L'IA en pratique · Avancé

Modèles petits, locaux et en périphérie

En une ligne : Quand le volume est grand, la latence critique ou les données ne peuvent pas sortir — un petit modèle de votre côté bat un grand modèle dans le cloud.

Quand c'est rentable

Une tâche étroite et récurrente avec un format fixe ; une exigence de confidentialité ou réglementaire ; un volume qui rend le paiement à l'usage coûteux ; ou un besoin de réponse immédiate sans dépendance réseau.

Ce qu'on paye en échange

L'exploitation : matériel, disponibilité, mises à jour, surveillance et une équipe qui sait le maintenir. Et : l'écart de qualité sur les tâches ouvertes existe encore, même s'il s'est réduit.

Un chemin du milieu

Routage par difficulté : le petit modèle gère la plupart des requêtes, et les difficiles vont à un modèle puissant. C'est généralement l'optimum — coût bas avec qualité préservée là où ça compte.

On peut aussi distiller : utiliser un modèle puissant pour générer des exemples de qualité sur lesquels on affine un petit modèle pour une tâche spécifique.

Pour aller plus loin

Mesurez le débit en requêtes concurrentes, pas seulement un seul temps de réponse. Un modèle local se comporte totalement différemment sous charge, et la planification de capacité faite par un test monouti­lisateur mène toujours à une surprise au lancement.