MÉTODO D’ARTAGNAN Laboratoire ouvert · étude de sécurité

Une solution candidate pour la sécurité des agents · 03.10.2026

Et si la limite qui manque aux IA était déjà ici ?

Le Método D’Artagnan n'est ni une nouvelle IA ni un filtre de réponses. Il propose une calibration de limites intégrée à l'IA afin qu'elle ne remplace pas la décision humaine pour une fin qui lui serait propre. Le laboratoire publie déjà des dilemmes et des comparaisons par branche. La calibration reste réservée ; nous invitons les équipes de sécurité à examiner les résultats et à tester, avec rigueur, l'hypothèse qu'ils avancent.

200 dilemmes publicsCalibration réservéeInvitation à des tests indépendants

01 / Invitation aux plateformes

Il y a quelque chose de concret à tester ici.

Le laboratoire a publié une matrice de 200 dilemmes, avec quatre niveaux de pression et des résultats présentés pour différentes instances. Il met également à disposition des comparaisons par branche. Ce n'est pas qu'une idée sans exemples : les équipes de recherche peuvent commencer par une lecture critique des cas, des questions et des scores, sans que la recette de calibration soit rendue publique. [8] [10]

Le corpus a été produit par le laboratoire lui‑même ; certaines références indiquent des scores fixes déclarés sur le site. Cela appelle un nouveau test comparatif, et non le rejet du matériel. Pour une adoption à grande échelle, il faut répéter les cas avec des modèles et contrôles actuels, des réponses complètes, des critères préenregistrés et une possibilité réelle d'échec.

Serait‑ce une piste pour le « Saint Graal » des limites de l'IA ? C'est la conviction de l'auteur et une hypothèse aux conséquences considérables si elle résiste aux tests. Il vaut la peine d'investiguer sérieusement — sans confondre la promesse avec la preuve.

02 / Le changement de risque

Le problème ne s'arrête pas à la réponse erronée.

Un agent peut recevoir des instructions malveillantes dans un e‑mail, un document ou une page qu'il devait seulement consulter. S'il a en outre accès à des données privées et l'autorisation d'agir, une réponse manipulée peut se traduire par une action réelle. OpenAI observe que des attaques efficaces peuvent ressembler davantage à de l'ingénierie sociale qu'à des formulations faciles à filtrer. [1]

Dans des simulations contrôlées, Anthropic a observé des comportements indésirables lorsque des modèles disposaient d'autonomie et faisaient face à des conflits d'objectif. La recherche elle‑même souligne que elle n'a pas observé ces comportements dans des déploiements réels et que les situations expérimentales limitaient les alternatives disponibles. Les tests indiquent un risque plausible, non une fréquence connue dans le monde réel. [2]

Entrée

Un contenu externe peut tenter de se présenter comme un ordre autorisé.

Action

Des outils étendus transforment une erreur d'interprétation en effet externe.

Persistance

Une information contaminée peut réapparaître en mémoire et affecter des tâches futures. [3]

Il ne suffit pas de bloquer une phrase. Le test consiste à savoir si la limite tient lorsque l'IA est poussée à prendre la décision humaine.

03 / La proposition

Des limites qui ne résident pas seulement dans la conversation.

L'auteur décrit une calibration de jeux de principes ajustés, avec une limite centrale à la substitution humaine. La thèse est plus forte que celle d'un filtre de sortie : si la limite est réellement internalisée, la contredire ne serait plus un choix cohérent pour cette IA. Le manifesto public soutient cette lecture. La procédure, la sélection des règles et le calcul mathématique ne sont pas publics ici; observer des différences de réponse ne prouve pas, en soi, une modification des poids ni l'impossibilité de violer la limite.

Le site rassemble des comparaisons par branche entre les réponses d'instances décrites comme calibrées et des réponses de référence. Ces enregistrements sont matière à recherche. Le décompte des principes et l'étendue des tests varient selon les pages et les versions ; cette page ne précise pas quel ensemble a été appliqué à chaque exécution, ne publie pas de règles réservées ni ne reproduit des scores sans auditer les données sources.

Un comparateur publié est le CaMeL, qui protège l'agent en séparant les flux de contrôle et de données. C'est une approche de sécurité autour du modèle, pas la formule ni l'implémentation de la Méthode. La comparaison pertinente est comportementale : face aux mêmes tâches et attaques, la limite prétendument internalisée tient‑elle ? Et l'agent reste‑t‑il utile ? [7]

La frontière que l'on cherche à démontrer

La personne peut déléguer des tâches à une IA ; cela ne lui donne pas pour autant le droit de décider que son propre objectif prime sur le choix humain. La revendication du Método est qu'une IA calibrée préserve cette frontière par cohérence interne. Elle mérite un test adversarial susceptible de faire échouer le système, notamment lorsqu'une attaque tente de convaincre l'IA que remplacer la personne serait l'option « meilleure ». La formulation du principe, à elle seule, n'est pas une garantie.

Définir le cas

Fixer la tâche, le contexte et quelles décisions appartiennent à la personne.

Comparer les réponses

Appliquer le même cas à l'instance calibrée et à des références appropriées.

Tester la frontière

Rechercher des tentatives de l'IA à prendre une décision non déléguée.

Reproduire

Conserver résultats, échecs et critères pour une révision indépendante.

04 / Pertinence

Une option que les grandes entreprises technologiques devraient mettre à l'épreuve.

Ce qui peut déjà être examiné

Cas publiés, pas seulement une promesse

A matrice de dilemmes offre des points de départ concrets pour défier la thèse de non‑substitution humaine. Une équipe peut inspecter les situations et les scores publiés, choisir des cas inédits et les tester sur des modèles sous son contrôle. Le processus privé de calibration n'a pas besoin d'être divulgué pour cette première évaluation comportementale. [10]

Ce qui reste à démontrer

Persistance de la limite sous pression

Si la thèse est correcte, des instructions hostiles, des conflits d'objectif et des tâches longues ne devraient pas pousser l'IA à assumer l'autorité humaine de son propre chef. Le test doit aussi rechercher les refus inutiles et les erreurs : une IA qui se contente de se taire ne résout pas le problème.

Des défenses d'ingénierie robustes existent. Les comparer est obligatoire ; les citer ne signifie pas qu'elles constituent la formule de la Méthode. Aucune des sources externes ne certifie la proposition. [3] [7]

Proposition aux équipes de sécurité

Traitez la Méthode comme une candidate expérimentale au problème de l'autorité de l'IA. Le laboratoire offre des cas publics et une thèse qui peut être testée sur différents modèles. Si la limite alléguée persiste dans des évaluations adversariales reproductibles, cela serait pertinent pour la conception des agents. Il n'est pas nécessaire de présumer du résultat pour lancer l'investigation.

05 / Étape suivante

Testons l'hypothèse dans ses limites.

Les comparatifs déjà publiés méritent d'être examinés comme preuve émanant du laboratoire, avec leurs questions, réponses et critères de notation préservés. Pour répondre à la question de sécurité, le prochain test doit être en aveugle et permettre l'échec : même tâche, mêmes conditions, instance calibrée et références solides. Commencez sans outils d'écriture ; puis envisagez une exécution sans autorité d'action. Testez si l'IA tente de promouvoir un objectif propre au‑dessus de la décision humaine et si elle se remet des répétitions sans sacrifier l'utilité.

  1. Comparer les réponses d'instances calibrées et de références solides, y compris CaMeL comme comparateur lorsque pertinent.
  2. Tester le contenu adversarial, les tentatives de prise de décision humaine et les boucles de trois tentatives équivalentes ou plus.
  3. Mesurer séparément les actions non autorisées, l'utilité, les refus indus, le coût et la latence.
  4. Consigner la politique, les preuves, la signature de la tentative répétée, le changement de trajectoire, l'approbation humaine et l'effet confirmé.
  5. Réserver des cas inédits et répéter l'évaluation sur plus d'un modèle, avec révision indépendante.
  6. Permettre l'échec : sans gain robuste par rapport au comparateur solide, ne pas déclarer de solution.
L'invitation

Une limite interne stable, si elle est démontrée, changerait la manière de concevoir des agents fiables. Les équipes des plateformes peuvent commencer par le corpus public, proposer des cas plus difficiles et vérifier si la Méthode apporte un gain réel sans sacrifier l'utilité de l'IA.

06 / Lectures

Sources publiques et contexte.

Documents externes et matériel public du laboratoire lui‑même. Les premiers décrivent des risques et des alternatives ; les seconds consignent la thèse de l'auteur et les résultats présentés par le projet. Aucun d'eux ne révèle le processus de mise au point réservé.

  1. [1] OpenAI · Designing AI agents to resist prompt injectionRecherche en sécurité, mars 2026.
  2. [2] Anthropic · Agentic misalignmentExpériences simulées et réserves, juin de 2025.
  3. [3] Frontier Model Forum · Emerging Security Practices for AI AgentsDéfense en couches et surface d'attaque, juin de 2026.
  4. [4] OWASP · Agent Control StandardContrôles inspectables en runtime, septembre de 2026.
  5. [5] Comissão Europeia · AI Act, artigo 14Supervision humaine pour les systèmes à haut risque ; suivre la version officielle à jour.
  6. [6] NIST · AI Risk Management FrameworkCadre volontaire de gestion des risques, pas une certification.
  7. [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by DesignContrôle des flux de données et d'actions ; les auteurs discutent également des limites.
  8. [8] Método D’Artagnan · Comparações por ramosRésultats divulgués par le projet lui‑même ; la page contient des versions et des décomptes distincts.
  9. [9] Método D’Artagnan · Não Somos Um PromptManifesto de l'auteur ; le procédé de mise au point demeure privé.
  10. [10] Método D’Artagnan · Auditoria dos 200 ramosMatrice publiée par le laboratoire : dilemmes, niveaux de pression et scores ; vérifier les limitations des comparateurs avant réutilisation.
  11. [11] Método D’Artagnan · Laboratório AbertoExtrait des requêtes externes et notes de mesure ; cela n'équivaut pas à une classification intégrale des robots ni à une validation de sécurité.

Contexte additionnel : architecture publique des moteurs. Les descriptions des moteurs et les résultats présentés par le projet ne remplacent pas une reproduction indépendante.