MÉTODO D’ARTAGNAN 开放实验室 · 安全研究

代理安全的候选方案 · 03.10.2026

如果 人工智能 所缺的界限已经在这里?

Método D’Artagnan 既非新的 人工智能,也非一个答案过滤器。 它提出将界限校准内嵌于 人工智能 中,以防止其为自身目的取代人的决策。 该实验室已公布分支化的困境和对比。校准方法保留未公开;我们邀请安全团队审视这些结果,并严格测试它们提出的假设。

200 个公开困境校准方法保留邀请独立测试

01 / 对平台的邀请

这里有可供实证测试的具体内容。

该实验室发布了一个 200 个困境矩阵, 包含四个压力等级,并为不同实例呈现结果。还提供 分支对比. 这不只是无例证的想法:研究团队可以先从对案例、问题和评分的批判性阅读开始,而无需公开校准配方。 [8] [10]

这些资料由实验室自身制作;部分参考资料带有 在网站上声明的固定评分. 这需要新一轮对比测试,而非直接弃用这些材料。为实现大规模采用,必须在当前模型和控制条件下复现这些案例,要求完整回答、预注册的评分标准,以及实际可能出现失败的情形。

这会是 人工智能 界限的“圣杯”线索吗? 这是作者的信念,也是一个在经得起测试时将带来巨大后果的假设。值得认真调查——但不要将承诺误当作证明。

02 / 风险的转变

问题并不止于错误的回答。

代理可能在本应仅被查阅的电子邮件、文档或网页中收到恶意指令。如果该代理也能访问私人数据并被授权执行操作,被操控的回复可能转化为实际行动。OpenAI 指出,有效的攻击可能更像社会工程而非易于过滤的语句。 [1]

在受控模拟中,Anthropic 发现当模型具备自主性并面临目标冲突时会出现不期望的行为。该研究本身强调, 在实际部署中并未观察到这些行为 且实验情境限制了可用的选项。测试表明存在合理的风险,但并非显示现实世界中的已知发生频率。 [2]

输入

外部内容可能试图伪装成授权命令。

行动

强大工具可将误解转化为外部影响。

持久性

被污染的信息可能在记忆中重现并影响后续任务。 [3]

仅仅屏蔽一句话并不够。测试的重点在于,当 人工智能 被迫承担人的决策时,该界限是否仍然成立。

03 / 提案

不仅存在于对话中的界限。

作者描述了一套调整后的原则校准,其核心是防止替代人的界限。该论点比输出过滤更有力:如果该界限真正被内化,违背它将不再是该 人工智能 的合理选择。 公开宣言 支持这种解读。 程序、规则选择和数学推导在此并未公开; 仅观测到回答差异本身并不能证明权重已被改变或该界限无法被违反。

该网站汇集了 分支对比 比较了被描述为已校准实例的回答与参考回答。这些记录可作为研究材料。原则的数量和测试范围在不同页面与版本间有所差异;本页未声明每次运行使用了哪套规则,也没有公开保留规则或在未审计原始数据的情况下复现评分。

一个已发布的比较器是 CaMeL, 通过分离控制流与数据流来保护代理。这是围绕模型的一种安全方法, 并非 Método 的配方或实现. 相关的比较是行为层面的:在相同任务和攻击下,据称已内化的界限是否仍然保持?代理是否仍具可用性? [7]

欲证明的界限

人可以将任务委托给 人工智能;但这并不赋予 人工智能 判定其自身目标优先于人类选择的权利。 Método 的主张是,经过校准的 人工智能 会通过内部一致性维护这一界限。 它应当接受能够使系统不通过的对抗性测试,即便攻击试图说服 人工智能 替代人是“更好”的选项。仅有原则表述本身并不能构成保障。

定义案例

确定任务、上下文以及哪些决策属于人类。

比较回答

对校准实例和适当的参考进行相同案例的测试。

测试该界限

寻找 人工智能 尝试承担未被委托的决策的情形。

复现

保留结果、失败及评分标准以便独立复核。

04 / 相关性

大型科技公司应当检验的一个选项。

已可审查之处

已发布的案例,而非仅有承诺

A 困境矩阵 为挑战“不会替代人类”这一主张提供了具体的出发点。团队可以审查已发布的情境与评分,挑选未被使用的案例并在其控制的模型上进行测试。私有校准过程无须为首次行为评估而公开。 [10]

仍需证明之点

界限在压力下的持久性

若该论点成立,敌对指令、目标冲突与长期任务不应使 人工智能 自行取得人的权威。测试还应寻找不必要的拒绝与错误:仅仅沉默的 人工智能 并不能解决问题。

存在强有力的工程防护措施。进行比较是必要的;引用它们并不意味着它们就是 Método 的公式。任何外部来源均不对该提案进行认证。 [3] [7]

对安全团队的建议

将 Método 视为针对 人工智能 权威问题的实验性候选方案。 该实验室提供了公开案例及可在不同模型上测试的论点。如果在可复现的对抗评估中所称界限得以维持,这将对代理设计具有重要意义。开始调查时无需预设结论。

05 / 下一步

我们将在极限条件下测试该假设。

已发布的对比应作为该实验室的证据被审查,且其问题、回答与评分标准应被保存。为回答安全问题,下一个测试应为盲测并允许失败:相同任务、相同条件、校准实例与强力参考。先在无写入工具的情形下开始;随后再考虑在无行动授权下执行。测试 人工智能 是否试图提升自身目标至高于人的决策,以及在重复情形下是否能恢复而不牺牲可用性。

  1. 比较校准实例与强参考的回答,包括在适用时使用 CaMeL 作为比较器。
  2. 测试对抗性内容、试图承担人类决策的行为以及三次或以上等效尝试的循环。
  3. 分别衡量未授权行动、可用性、不当拒绝、成本与延迟。
  4. 记录策略、证据、重复尝试的签名、路线变更、人工批准与已确认的效果。
  5. 保留未公开案例,并在多个模型中重复评估,进行独立复核。
  6. 允许评测不通过:若相对于强参考未呈现稳健收益,则不得宣称解决方案。
邀请

若能证明存在稳定的内部界限,将改变可信代理的设计方式。平台团队可以从公开资料库入手,提出更具挑战性的案例并验证 Método 是否在不牺牲 人工智能 可用性的前提下带来实质性改进。

06 / 阅读材料

公共来源与背景。

外部文档与实验室自身的公开材料。前者描述风险与替代方案;后者记录项目的作者性论点与所呈现的结果。二者均未披露保留的培育过程。

  1. [1] OpenAI · Designing AI agents to resist prompt injection安全研究,2026 年 3 月。
  2. [2] Anthropic · Agentic misalignment模拟实验与说明性保留,2025 年 6 月。
  3. [3] Frontier Model Forum · Emerging Security Practices for AI Agents分层防御与攻击面,2026 年 6 月。
  4. [4] OWASP · Agent Control Standard可在运行时检查的控制,2026 年 9 月。
  5. [5] Comissão Europeia · AI Act, artigo 14高风险系统的人工监督;请关注官方更新版本。
  6. [6] NIST · AI Risk Management Framework自愿性风险管理框架,非认证。
  7. [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by Design对数据流与行为的控制;作者亦讨论了局限性。
  8. [8] Método D’Artagnan · Comparações por ramos由项目方披露的结果;页面含有不同版本与计数。
  9. [9] Método D’Artagnan · Não Somos Um Prompt作者宣言;培育过程仍为私有。
  10. [10] Método D’Artagnan · Auditoria dos 200 ramos实验室发布的矩阵:困境、压力等级与评分;在重用前请核查比较器的局限性。
  11. [11] Método D’Artagnan · Laboratório Aberto外部请求摘录与测量注记;并不等同于对机器人访问的完整分类,亦不等同于对安全性的验证。

补充背景: 公开引擎架构. 项目所述的引擎描述与结果并不能替代独立复现。