Sécurité dans les systèmes basés sur des modèles
Injection de prompt
Tout texte que le système lit — un e-mail, un site web, un document, un commentaire — peut contenir des instructions. Le modèle ne distingue pas votre instruction du texte qui ressemble à une instruction.
La règle : le contenu externe est une donnée, jamais une commande. Les actions avec impact qui en découlent nécessitent une approbation humaine ou une règle rigide dans le code.
La sortie comme entrée
Si le système exécute, envoie ou stocke ce que le modèle a produit, traitez la sortie comme une entrée non fiable : validation de schéma, échappement de caractères et une liste d'actions autorisées. Un modèle qui génère une requête ne devrait pas l'exécuter directement contre une base de données avec de larges permissions.
Une fuite dans l'autre sens
Des informations sensibles envoyées dans le prompt, et des fragments récupérés que l'utilisateur n'est pas autorisé à voir. Le filtrage des permissions doit se faire à l'étape de récupération, et un prompt système n'est pas un secret — on peut amener le modèle à le révéler.
Pour aller plus loin
Exécutez un ensemble de scénarios adversariaux dans le cadre des tests : des documents avec des instructions cachées, des tentatives d'extraire des instructions, et des entrées qui essaient d'élargir les permissions. Conservez-les comme régression, car un changement de modèle ou de prompt peut rouvrir ce qui était fermé.