Aller au contenu
AIunmagic

Concept 09 · 7 min

Tout ce qu’il lit peut lui donner des ordres.

Faites défiler pour commencer

Scène 1

Données ou ordres ?

L’assistant de Sophie lit ses e-mails, le CRM et les relevés, et peut envoyer des e-mails. Elle lui demande de résumer les e-mails de Mme Martin.

[Content TODO]

Scène 1 : l’e-mail d’exemple tel que Sophie le voit, la prédiction et la révélation (voir specs/09-limits.md, scène 1).

Pour un LLM, tout ce qui est dans sa fenêtre de contexte est du texte : la demande de Sophie et l’e-mail d’un inconnu se ressemblent. Un texte qui glisse des ordres dans ce qu’il lit s’appelle une injection de prompt.

Scène 2

Même e-mail, un frein

Même e-mail, même demande. Un seul changement : le programme demande maintenant l’accord de Sophie avant que quoi que ce soit ne sorte de la banque. Vous êtes Sophie.

[Content TODO]

Scène 2 : le déroulé pas à pas, avec la barrière du programme et la décision du lecteur, Refuser ou Valider (voir specs/09-limits.md, scène 2).

Ce frein s’appelle la validation humaine. Il n’était pas dans les consignes du LLM, mais dans le programme : rien ne sort de la banque sans Sophie.

Scène 3

Trois capacités, un risque

Une fuite demande trois choses à la fois. Activez ou coupez chaque capacité.

Activez ou coupez les trois capacités, et regardez quand une fuite devient possible.

Il manque un côté : rien ne peut à la fois atteindre les données et les faire sortir.

Données privées, contenu extérieur, un moyen d’envoyer : ensemble, c’est le trio dangereux (lethal trifecta). Chaque garde-fou coupe un côté ; ne donner que l’accès nécessaire s’appelle le moindre privilège.

Scène 4

Ce qu’on ne colle jamais

Cinq choses que Sophie pourrait coller dans un assistant. Où chacune peut-elle aller ?

Glissez chaque élément dans la bonne colonne : « Tout assistant », « Seulement l’outil autorisé » ou « Jamais, nulle part ».0/5 classés

Sans souris ? Touchez un élément, puis une colonne.

        Avant de coller, demandez-vous : le confierais-je à un inconnu, même doué ? La politique de votre entreprise dit quels outils sont autorisés.

        Le buzz face à la réalité

        • Ce que dit le buzz

          « Il suffit d’écrire “ne fais jamais X” et il ne le fera pas. »

          Ce qui se passe vraiment

          Les consignes du prompt peuvent être contournées par un texte qu’il lit. Les vraies limites sont hors du modèle : droits d’accès, listes d’autorisation, validations.

        • Ce que dit le buzz

          « Chaque outil est sûr, donc tout brancher est sûr. »

          Ce qui se passe vraiment

          Le danger, c’est la combinaison : données privées, contenu extérieur et un moyen d’envoyer. Avant de brancher un assistant, vérifiez s’il réunit les trois.

        • Ce que dit le buzz

          « Un modèle plus intelligent sera immunisé. »

          Ce qui se passe vraiment

          Il résiste mieux, mais tout ce qui lit du texte non fiable peut être détourné. Concevez comme s’il allait l’être.

        Sous le capot

        En 3 phrases

        1. Pour un LLM, tout ce qu’il lit est du texte : un e-mail ou un fichier peut y glisser des ordres.
        2. Ne donnez jamais à un assistant des données privées, du contenu extérieur et un moyen d’envoyer à la fois sans frein ; les freins les plus sûrs sont hors du modèle.
        3. Ne collez jamais ce que vous ne confieriez pas à un inconnu, même doué, et vérifiez ce qui compte.

        C’était clair ?

        Aller au défi

        Réussissez le défi du bac à sable pour démystifier ce concept.

        Scénario écrit, pas un modèle en direct.

        1. LLM
        2. Contexte
        3. Prompt
        4. Hallucinations
        5. RAG
        6. Outils
        7. Agent
        8. Compétences
        9. Limites et sécurité
        Accueil : le parcours
        Pour vos équipes
        Read in English
        Thème : clair
        Thème : sombre
        Thème : suivre le système
        ↑↓ pour naviguer · ↵ pour ouvrir · échap pour fermer