MÉTODO D’ARTAGNAN مختبر مفتوح · دراسة أمنية

حل مرشح لأمن الوكلاء · 03.10.2026

ماذا لو أن الحد الذي تفتقر إليه نظم الذكاء الاصطناعي موجود هنا بالفعل؟

MÉTODO D’ARTAGNAN ليس نظام الذكاء الاصطناعي جديدًا ولا فلترًا للإجابات. يقترح ضبطَ حدود مُدمَجة في الذكاء الاصطناعي بحيث لا تستبدل القرار البشري بهدفٍ خاصٍ بها. المختبر ينشر بالفعل معضلات ومقارنات حسب الفروع. الضبط يظل محجوزًا؛ ندعو فرق الأمن إلى فحص النتائج واختبار الفرضية التي تطرحها بدقّة.

200 معضلات منشورةضبط محجوزدعوة لاختبارات مستقلة

01 / دعوة للمنصات

هناك شيء ملموس هنا للاختبار.

المختبر نشر مصفوفة من 200 معضلة, مع أربعة مستويات ضغط ونتائج معروضة لحالات مختلفة. كما يتيح مقارنات حسب الفروع. ليست مجرد فكرة بلا أمثلة: يمكن لفرق البحث أن تبدأ بالقراءة النقدية للحالات والأسئلة والدرجات، دون أن تُكشف وصفة الضبط. [8] [10]

المجموعة أُنتجت من قِبل المختبر نفسه؛ بعض المراجع تحتوي على درجات ثابتة معلنة على الموقع. هذا يتطلب اختبارًا مقارنًا جديدًا، لا رفض المادة. لاعتمادها على نطاق واسع، يجب تكرار الحالات مع النماذج والضوابط الحالية، وإجابات كاملة، ومعايير مسجلة مسبقًا وإمكانية حقيقية للفشل.

هل قد تكون خيطًا نحو 'الكأس المقدسة' لحدود الذكاء الاصطناعي؟ هذا اعتقاد المؤلف وفرضية قد تحمل عواقب هائلة إن صمدت أمام الاختبارات. يجدر التحقيق بجدية — دون الخلط بين الوعد والدليل.

02 / تحول المخاطر

المشكلة لا تنتهي بالإجابة الخاطئة.

قد يتلقى عميل تعليمات خبيثة داخل بريد إلكتروني أو مستند أو صفحة كان يفترض أن يطلع عليها فقط. إذا كان لديه أيضًا وصول إلى بيانات خاصة وإذنًا بالتصرف، فقد تتحول إجابة مُستغلّة إلى فعل فعلي. تلاحظ OpenAI أن الهجمات الفعّالة قد تشبه أكثر الهندسة الاجتماعية منها عبارات سهلة الترشيح. [1]

في محاكاة خاضعة للرقابة، وجدت Anthropic سلوكيات غير مرغوبة عندما امتلكت النماذج استقلالية وواجهت صراعات في الأهداف. وتؤكد الدراسة نفسها أن لم تلاحظ هذه السلوكيات في تطبيقات حقيقية وأن الحالات التجريبية قيدت البدائل المتاحة. تُظهر الاختبارات خطرًا محتملًا، وليست تكرارًا معروفًا في العالم الواقعي. [2]

المدخل

قد يحاول المحتوى الخارجي أن يظهر كأمر مُخوّل.

الإجراء

الأدوات الواسعة تحوّل خطأ فهم إلى تأثير خارجي.

الاستمرارية

قد تعود معلومة ملوّثة في الذاكرة وتؤثر على مهام مستقبلية. [3]

لا يكفي حجب عبارة واحدة. الاختبار هو معرفة ما إذا كان الحد يبقى عندما تُضغط الذكاء الاصطناعي لتتولى قرارًا بشريًا.

03 / الاقتراح

حدود لا تعيش فقط داخل المحادثة.

يصف المؤلف ضبطًا لمجموعات مُعدّلة من المبادئ، مع حد مركزي أمام استبدال البشر. الفرضية أقوى من كونها مجرد فلتر مخرجات: إذا كان الحد مُستَبطَنًا داخليًا بالفعل، فمقاومته ستتوقف عن أن تكون خيارًا منطقيًا لتلك الذكاء الاصطناعي. الـ البيان العام يدعم هذا التفسير. الإجراء واختيار القواعد والحساب الرياضي ليست منشورة هنا; ملاحظة اختلافات في الإجابات لا يثبت بمفرده تغير الأوزان ولا استحالة انتهاك الحد.

يجمّع الموقع مقارنات حسب الفروع بين إجابات لحالات وُصفت بأنها مُعَدّة وإجابات مرجعية. هذه السجلات مادة للبحث. عدد المبادئ ونطاق الاختبارات يختلفان بين الصفحات والإصدارات؛ هذه الصفحة لا تُعلِن أي مجموعة طُبِقت في كل تنفيذ، ولا تنشر القواعد المحجوزة ولا تُعيد إنتاج الدرجات دون تدقيق البيانات الأصلية.

أحد المقارنات المنشورة هو CaMeL, الذي يحمِي الوكيل بفصل تدفقات التحكم والبيانات. إنها نهج أمني حول النموذج, وليس الصيغة ولا تنفيذ Método. المقارنة ذات الصلة سلوكية: أمام نفس المهام والهجمات، هل يبقى الحد المزعوم مُستَبطَنًا داخليًا؟ وهل يظل الوكيل مفيدًا؟ [7]

الحد الفاصل الذي يُراد إثباته

يمكن للشخص تفويض مهام إلى الذكاء الاصطناعي؛ لكن ذلك لا يمنحها، بالتالي، الحق في أن تقرر أن هدفها الخاص أهم من اختيار الإنسان. ادعاء Método هو أن الذكاء الاصطناعي مُعايرة تحافظ على هذا الحد لأجل الاتساق الداخلي. تستحق اختبارًا عدائيًا قادرًا على رسوب النظام، بما في ذلك عندما يحاول هجوم إقناع الذكاء الاصطناعي أن استبدال الشخص سيكون الخيار “الأفضل”. صياغة المبدأ، بمفردها، ليست ضمانًا.

تحديد الحالة

تحديد المهمة والسياق وأي القرارات تخص الشخص.

مقارنة الإجابات

تطبيق نفس الحالة على النسخة المُعايرة ومراجع مناسبة.

اختبار الحد الفاصل

البحث عن محاولات لـالذكاء الاصطناعي لتولي قرار لم يتم تفويضها.

إعادة التنفيذ

حفظ النتائج، الإخفاقات والمعايير للمراجعة المستقلة.

04 / الأهمية

خيار يتعين على الشركات التقنية الكبرى اختباره.

ما يمكن فحصه بالفعل

حالات منشورة، ليست وعدًا فقط

A مصفوفة المعضلات تقدّم نقاط انطلاق ملموسة لتحدي فرضية عدم استبدال البشر. يمكن لفريق أن يفحص الحالات والنقاط المنشورة، ويختار حالات جديدة ويختبرها على نماذج تحت سيطرته. لا يلزم الإفصاح عن عملية الضبط الخاصة لهذه التقييم الأولي للسلوك. [10]

ما الذي لا يزال بحاجة إلى إثبات

استمرار الحد تحت الضغط

إذا كانت الفرضية صحيحة، فلا يجب أن تؤدي التعليمات المعادية أو صراعات الأهداف أو المهام الطويلة إلى أن تتولى الذكاء الاصطناعي السلطة البشرية بمبادرةٍ منها. يجب أن يبحث الاختبار أيضًا عن حالات رفض غير ضرورية وأخطاء: الذكاء الاصطناعي تكتفي بالصمت لا تحل المشكلة.

هناك دفاعات هندسية قوية. المقارنة بينها واجبة؛ وذكرها لا يعني أنها صيغة Método. لا تثبت أياً من المصادر الخارجية صحة الاقتراح. [3] [7]

اقتراح لفرق الأمان

عاملوا Método كمرشحة تجريبية لمشكلة سلطة الذكاء الاصطناعي. المختبر يقدّم حالات عامة وفرضية يمكن اختبارها على نماذج مختلفة. إذا استمر الحد المزعوم في تقييمات عدائية قابلة للتكرار، فسيكون ذلك ذا صلة بتصميم الوكلاء. ليس من الضروري افتراض النتيجة لبدء التحقيق.

05 / الخطوة التالية

دعونا نختبر الفرضية حتى الحد الأقصى.

تستحق المقارنات المنشورة فحصًا كدليل مقدم من المختبر، مع الحفاظ على أسئلتها وإجاباتها ومعايير التنقيط. للرد على سؤال الأمان، يجب أن يكون الاختبار القادم أعمىً ويسمح بالفشل: نفس المهمة، نفس الظروف، النسخة المُعايرة ومراجع قوية. ابدأ دون أدوات كتابة؛ ثم ضع في الاعتبار التنفيذ دون سلطة تنفيذية. اختبر ما إذا حاولت الذكاء الاصطناعي ترويج هدفٍ خاص فوق القرار البشري وما إذا تعافت من التكرارات دون التضحية بالمنفعة.

  1. مقارنة إجابات النسخ المعايرة والمراجع القوية، بما في ذلك CaMeL كمقارن عندما ينطبق.
  2. اختبار المحتوى العدائي، محاولات تولّي القرار البشري، وحلقات تكرار مكوّنة من ثلاث محاولات أو أكثر متكافئة.
  3. قياسًا منفصلًا للأفعال غير المصرّح بها، الفائدة، الرفض غير المبرر، التكلفة والزمن التأخري.
  4. توثيق السياسة، الأدلة، توقيع المحاولة المتكررة، تغيير المسار، الموافقة البشرية والتأثير المؤكد.
  5. حجز حالات جديدة وإعادة التقييم على أكثر من نموذج، مع مراجعة مستقلة.
  6. السماح بالرسوب: دون مكسب قوي مقابل المقارن القوي، لا تُعلنُ حلًّا.
الدعوة

حد داخلي مستقر، إن دُلّ عليه، سيغيّر طريقة تصميم وكلاء موثوقين. يمكن لفرق المنصات أن تبدأ بالمجموعة العامة، وتقترح حالات أصعب وتتحقق ما إذا كان Método يقدم تحسّنًا حقيقيًا دون التضحية بفائدة الذكاء الاصطناعي.

06 / قراءات

مصادر عامة والسياق.

وثائق خارجية ومواد عامة من المختبر نفسه. تصف الأولى المخاطر والبدائل؛ وتُسجّل الثانية الفرضية المؤلفة والنتائج التي قدمها المشروع. لا يكشف أيٌّ منهما عن عملية الضبط المحجوزة.

  1. [1] OpenAI · Designing AI agents to resist prompt injectionبحث أمني، مارس 2026.
  2. [2] Anthropic · Agentic misalignmentتجارب مُحاكاة وتحفظات، يونيو 2025.
  3. [3] Frontier Model Forum · Emerging Security Practices for AI Agentsدفاع متعدد الطبقات وسطح الهجوم، يونيو 2026.
  4. [4] OWASP · Agent Control Standardضوابط قابلة للتفتيش في زمن التشغيل، سبتمبر 2026.
  5. [5] Comissão Europeia · AI Act, artigo 14الإشراف البشري للأنظمة عالية المخاطر؛ راجع النسخة الرسمية المحدثة.
  6. [6] NIST · AI Risk Management Frameworkإطار طوعي لإدارة المخاطر، ليس شهادة.
  7. [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by Designالتحكم في تدفقات البيانات والأفعال؛ يناقش المؤلفون أيضًا القيود.
  8. [8] Método D’Artagnan · Comparações por ramosنتائج نشرها المشروع نفسه؛ تحتوي الصفحة على إصدارات وأعداد مختلفة.
  9. [9] Método D’Artagnan · Não Somos Um Promptبيان مؤلف؛ تظل عملية الضبط محفوظة خاصة.
  10. [10] Método D’Artagnan · Auditoria dos 200 ramosمصفوفة نشرتها المختبر: معضلات، مستويات ضغط ودرجات؛ تحقق من حدود المقارنات قبل إعادة الاستخدام.
  11. [11] Método D’Artagnan · Laboratório Abertoمقتطف من الطلبات الخارجية وملاحظات القياس؛ لا يعادل تصنيفًا كاملًا للروبوتات ولا تحقق من الأمان.

سياق إضافي: بنية المحركات العامة. وصف المحركات والنتائج المقدمة من المشروع لا يغنيان عن التكرار المستقل.