Attaques et défenses

Injection de prompt

L’injection de prompt vise à faire ignorer à un modèle ses instructions prévues en dissimulant de nouvelles consignes dans le contenu utilisateur, des documents ou la sortie d’un outil.

Tous les sujets de sécurité IA
01

L’idée

Si un système concatène un prompt système caché avec du texte utilisateur, une page récupérée ou un e-mail résumé, ce texte non fiable peut tenter de remplacer la tâche d’origine. Le modèle ne distingue pas de façon fiable les « données » des « instructions ».

02

Pourquoi cela compte

Une injection réussie peut faire révéler le prompt, mal utiliser un outil connecté, ou produire une sortie trompeuse qu’un utilisateur croira. Les dégâts dépendent de ce que l’application a le droit de faire : un résumé en lecture seule est une cible plus petite qu’un assistant qui envoie du courrier ou change des accès.

03

Pratiques défensives

Ne donnez pas à un modèle d’outils qui changent l’état sans confirmation humaine. Traitez documents et pages web comme non fiables. Séparez instructions système et contenu utilisateur lorsque la plateforme le permet. Contraignez les sorties à un schéma si vous n’avez besoin que de champs structurés. Testez avec des chaînes adverses avant d’exposer une fonction.

04

Ce que ce n’est pas

Parler d’injection de prompt n’est pas une invitation à attaquer des systèmes dont vous n’êtes pas propriétaire. Cette note s’adresse aux équipes qui construisent et relisent leurs propres applications.