Segurança em sistemas baseados em modelos
Injeção de prompt
Qualquer texto que o sistema lê — um e-mail, um site, um documento, um comentário — pode conter instruções. O modelo não distingue sua instrução do texto que parece uma instrução.
A regra: conteúdo externo é dado, nunca um comando. Ações com impacto derivadas dele exigem aprovação humana ou uma regra rígida no código.
Saída como entrada
Se o sistema executa, envia ou armazena o que o modelo produziu, trate a saída como entrada não confiável: validação de esquema, escape de caracteres e uma lista de ações permitidas. Um modelo que gera uma consulta não deveria executá-la diretamente contra um banco de dados com permissões amplas.
Um vazamento na outra direção
Informações sensíveis enviadas no prompt e trechos recuperados que o usuário não tem permissão de ver. A filtragem de permissões deve acontecer na etapa de recuperação, e um prompt de sistema não é um segredo — dá para fazer o modelo revelá-lo.
Indo mais fundo
Execute um conjunto de cenários adversariais como parte dos testes: documentos com instruções ocultas, tentativas de extrair instruções e entrada que tenta ampliar permissões. Mantenha-os como regressão — uma mudança de modelo ou de prompt pode reabrir o que estava fechado.