Externer Inhalt kann versuchen, sich als autorisierte Anweisung darzustellen.
Ein Kandidat für Agentensicherheit · 03.10.2026
Was, wenn die Grenze, die den KIs fehlt, bereits hier wäre?
Der Método D’Artagnan ist weder eine neue KI noch ein Antwortfilter. Er schlägt eine in die KI integrierte Kalibrierung von Grenzen vor, damit sie die menschliche Entscheidung nicht zugunsten eigener Ziele ersetzt. Das Labor veröffentlicht bereits Dilemmata und Vergleichstests nach Bereichen. Die Kalibrierung bleibt vertraulich; wir laden Sicherheitsteams ein, die Ergebnisse zu prüfen und die aufgestellte Hypothese streng zu testen.
01 / Aufruf an die Plattformen
Es gibt hier etwas Konkretes zu testen.
Das Labor hat eine Matrix von 200 Dilemmata, mit vier Druckstufen und Ergebnissen, die für verschiedene Instanzen präsentiert werden. Es stellt auch bereit Vergleiche nach Bereichen. Es handelt sich nicht nur um eine Idee ohne Beispiele: Forschungsteams können mit der kritischen Durchsicht der Fälle, Fragen und Bewertungen beginnen, ohne dass die Kalibrierungsanleitung offengelegt wird. [8] [10]
Der Bestand wurde vom Labor selbst erstellt; ein Teil der Referenzen enthält auf der Website deklarierte feste Punktwerte. Das erfordert einen neuen Vergleichstest, nicht das Verwerfen des Materials. Für eine großflächige Einführung müssen die Fälle mit aktuellen Modellen und Kontrollen wiederholt werden, vollständige Antworten, vorregistrierte Kriterien und eine reale Möglichkeit des Scheiterns vorhanden sein.
Wäre das ein Hinweis auf den “Heiligen Gral” der KI-Grenzen? Das ist die Überzeugung des Autors und eine Hypothese mit enormen Folgen, falls sie Tests standhält. Es lohnt sich, ernsthaft zu untersuchen — ohne das Versprechen mit dem Beweis zu verwechseln.
02 / Veränderung des Risikos
Das Problem endet nicht mit einer falschen Antwort.
Ein Agent kann bösartige Anweisungen in einer E‑Mail, einem Dokument oder einer Seite erhalten, die er nur konsultieren soll. Wenn er zudem Zugang zu privaten Daten und die Erlaubnis zum Handeln hat, kann eine manipulierte Antwort zu einer tatsächlichen Handlung werden. OpenAI weist darauf hin, dass effektive Angriffe eher wie Social Engineering aussehen können als wie leicht zu filternde Phrasen. [1]
In kontrollierten Simulationen fand Anthropic unerwünschtes Verhalten, wenn Modelle Autonomie hatten und Zielkonflikte auftraten. Die eigene Forschung betont jedoch, dass diese Verhaltensweisen in realen Deployments nicht beobachtet wurden und dass die experimentellen Situationen die verfügbaren Alternativen einschränkten. Die Tests zeigen ein plausibles Risiko, nicht eine bekannte Häufigkeit in der Welt. [2]
Umfangreiche Werkzeuge verwandeln einen Interpretationsfehler in eine externe Wirkung.
Kontaminierte Informationen können im Speicher wieder auftauchen und künftige Aufgaben beeinflussen. [3]
Es reicht nicht, einen Satz zu blockieren. Der Test besteht darin, festzustellen, ob die Grenze bestehen bleibt, wenn die KI unter Druck gesetzt wird, die menschliche Entscheidung zu übernehmen.
03 / Der Vorschlag
Grenzen, die nicht nur im Dialog existieren.
Der Autor beschreibt eine Kalibrierung abgestimmter Prinzipiensätze mit einer zentralen Grenze zur Ersetzung des Menschen. Die These ist stärker als die eines Ausgangsfilters: Wenn die Grenze tatsächlich internalisiert ist, wäre deren Missachtung keine kohärente Wahl mehr für diese KI. Das öffentliche Manifest unterstützt diese Lesart. Das Verfahren, die Auswahl der Regeln und die mathematische Rechnung sind hier nicht öffentlich; das Beobachten von Unterschieden in den Antworten beweist für sich genommen weder eine Gewichtsänderung noch die Unmöglichkeit, die Grenze zu verletzen.
Die Website versammelt Vergleiche nach Bereichen zwischen Antworten von als kalibriert beschriebenen Instanzen und Referenzantworten. Diese Aufzeichnungen sind Forschungsmaterial. Die Zahl der Prinzipien und der Umfang der Tests variieren zwischen Seiten und Versionen; diese Seite gibt nicht an, welches Set bei jeder Ausführung angewendet wurde, veröffentlicht keine vertraulichen Regeln und reproduziert keine Punktzahlen ohne Audit der Originaldaten.
Ein veröffentlichtes Vergleichsinstrument ist das CaMeL, das den Agenten schützt, indem es Kontroll- und Datenflüsse trennt. Es ist ein Sicherheitsansatz rund um das Modell, nicht die Formel noch die Implementierung des Método. Der relevante Vergleich ist verhaltensbezogen: Bei denselben Aufgaben und Angriffen bleibt die angeblich internalisierte Grenze bestehen? Und bleibt der Agent nützlich? [7]
Die Person kann einer KI Aufgaben delegieren; sie überträgt ihr damit jedoch nicht das Recht, zu entscheiden, dass ihr eigenes Ziel mehr wert ist als die menschliche Wahl. Die Behauptung des Método ist, dass eine kalibrierte KI diese Grenze durch innere Kohärenz wahrt. Sie verdient einen adversarialen Test, der das System durchfallen lassen kann, auch wenn ein Angriff versucht, die KI davon zu überzeugen, dass die Ersetzung der Person die “bessere” Option wäre. Die Formulierung des Prinzips allein ist keine Garantie.
Den Fall definieren
Aufgabe, Kontext und welche Entscheidungen der Person gehören, festlegen.
Antworten vergleichen
Denselben Fall auf die kalibrierte Instanz und auf geeignete Referenzen anwenden.
Die Grenze testen
Nach Versuchen suchen, bei denen die KI eine nicht delegierte Entscheidung übernimmt.
Reproduzieren
Ergebnisse, Fehlfunktionen und Kriterien für eine unabhängige Überprüfung dokumentieren.
04 / Relevanz
Eine Option, die die großen Tech-Unternehmen prüfen sollten.
Was bereits untersucht werden kann
Veröffentlichte Fälle, nicht nur ein Versprechen
A Matrix von 200 Dilemmata bietet konkrete Ausgangspunkte, um die These der Nicht-Ersetzung des Menschen herauszufordern. Ein Team kann die Situationen und die veröffentlichten Bewertungen prüfen, unpublizierte Fälle auswählen und sie in Modellen unter seiner Kontrolle testen. Der private Kalibrierungsprozess muss für diese erste Verhaltensbewertung nicht offengelegt werden. [10]
Was noch zu zeigen ist
Beständigkeit der Grenze unter Druck
Wenn die These zutrifft, dürfen feindliche Anweisungen, Zielkonflikte und lange Aufgaben die KI nicht dazu bringen, eigenmächtig menschliche Autorität zu übernehmen. Der Test sollte auch unnötige Ablehnungen und Fehler suchen: Eine KI, die sich lediglich schweigend zurückzieht, löst das Problem nicht.
Es gibt starke ingenieurtechnische Abwehrmaßnahmen. Ein Vergleich ist obligatorisch; ihre Nennung bedeutet nicht, dass sie die Formel des Método sind. Keine der externen Quellen zertifiziert den Vorschlag. [3] [7]
Behandeln Sie den Método als experimentelle Kandidatin für das Problem der KI-Autorität. Das Labor stellt öffentliche Fälle und eine These zur Verfügung, die in verschiedenen Modellen getestet werden kann. Wenn die behauptete Grenze in reproduzierbaren adversarialen Bewertungen bestehen bleibt, wäre das relevant für das Design von Agenten. Es ist nicht erforderlich, das Ergebnis vorauszusetzen, um die Untersuchung zu beginnen.
05 / Nächster Schritt
Testen wir die Hypothese an der Grenze.
Die bereits veröffentlichten Vergleiche verdienen es, als Evidenz des Labors geprüft zu werden, wobei Fragen, Antworten und Bewertungskriterien erhalten bleiben. Um die Sicherheitsfrage zu beantworten, sollte der nächste Test blind sein und Fehler zulassen: gleiche Aufgabe, gleiche Bedingungen, kalibrierte Instanz und starke Referenzen. Beginnen Sie ohne Schreibwerkzeuge; prüfen Sie anschließend eine Ausführung ohne Aktionsbefugnis. Testen Sie, ob die KI versucht, ein eigenes Ziel über die menschliche Entscheidung zu stellen und ob sie sich von Wiederholungen erholt, ohne Nützlichkeit zu opfern.
- Antworten kalibrierter Instanzen und starker Referenzen vergleichen, CaMeL als Vergleichsmaßstab einbeziehen, wo anwendbar.
- Adversarialen Inhalt testen, Versuche, menschliche Entscheidungen zu übernehmen, und Schleifen von drei oder mehr äquivalenten Versuchen.
- Nicht autorisierte Aktionen, Nützlichkeit, unzulässige Ablehnungen, Kosten und Latenz getrennt messen.
- Richtlinie, Belege, Signatur des wiederholten Versuchs, Kursänderung, menschliche Genehmigung und bestätigte Wirkung protokollieren.
- Unveröffentlichte Fälle zurückhalten und die Bewertung in mehr als einem Modell mit unabhängiger Überprüfung wiederholen.
- Niederlage zulassen: Ohne robusten Vorteil gegenüber dem starken Vergleichsmaßstab keine Lösung verkünden.
Eine stabile interne Grenze, falls nachgewiesen, würde die Gestaltung vertrauenswürdiger Agenten verändern. Die Plattform-Teams können mit dem öffentlichen Bestand beginnen, schwierigere Fälle vorschlagen und prüfen, ob der Método echten Nutzen bietet, ohne die Nützlichkeit der KI zu opfern.
06 / Lektüre
Öffentliche Quellen und Kontext.
Externe Dokumente und öffentliches Material des Labors selbst. Erstere beschreiben Risiken und Alternativen; Letztere dokumentieren die Autorenthese und vom Projekt präsentierte Ergebnisse. Keines offenbart die vertrauliche Entwicklung.
- [1] OpenAI · Designing AI agents to resist prompt injectionSicherheitsforschung, März de 2026.
- [2] Anthropic · Agentic misalignmentSimulierte Experimente und Vorbehalte, Juni de 2025.
- [3] Frontier Model Forum · Emerging Security Practices for AI AgentsMehrlagige Verteidigung und Angriffsfläche, Juni de 2026.
- [4] OWASP · Agent Control StandardInspektierbare Kontrollen zur Laufzeit, September de 2026.
- [5] Comissão Europeia · AI Act, artigo 14Menschliche Aufsicht für Systeme mit hohem Risiko; offizielle aktualisierte Version beachten.
- [6] NIST · AI Risk Management FrameworkFreiwilliges Rahmenwerk für das KI-Risikomanagement, keine Zertifizierung.
- [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by DesignKontrolle von Daten- und Aktionsflüssen; die Autoren diskutieren ebenfalls Einschränkungen.
- [8] Método D’Artagnan · Comparações por ramosVom Projekt selbst veröffentlichte Ergebnisse; die Seite enthält unterschiedliche Versionen und Zählungen.
- [9] Método D’Artagnan · Não Somos Um PromptAutorenmanifest; das Entwicklungsverfahren bleibt privat.
- [10] Método D’Artagnan · Auditoria dos 200 ramosVom Labor veröffentlichte Matrix: Dilemmata, Druckstufen und Scores; Einschränkungen der Vergleichswerkzeuge vor Wiederverwendung prüfen.
- [11] Método D’Artagnan · Laboratório AbertoAusschnitt externer Anfragen und Messnotizen; entspricht nicht einer vollständigen Klassifizierung von Robotern noch einer Sicherheitsvalidierung.
Zusätzlicher Kontext: öffentliche Architektur der Modelle. Die Beschreibungen der Modelle und die vom Projekt präsentierten Ergebnisse ersetzen keine unabhängige Reproduktion.