MÉTODO D’ARTAGNAN Laboratorio abierto · estudio de seguridad

Una solución candidata para la seguridad de agentes · 03.10.2026

¿Y si el límite que les falta a las IAs ya estuviera aquí?

El Método D’Artagnan no es una nueva IA ni un filtro de respuestas. Propone una calibración de límites incorporada a la IA para que no sustituya la decisión humana por un propósito propio. El laboratorio ya publica dilemas y comparaciones por ramas. La calibración sigue reservada; invitamos a los equipos de seguridad a examinar los resultados y poner a prueba, con rigor, la hipótesis que plantean.

200 dilemas públicosCalibración reservadaInvitación a pruebas independientes

01 / Invitación a las plataformas

Hay algo concreto aquí para probar.

El laboratorio publicó una matriz de 200 dilemas, con cuatro niveles de presión y resultados presentados para diferentes instancias. También dispone de comparaciones por ramas. No es solo una idea sin ejemplos: los equipos de investigación pueden empezar por la lectura crítica de casos, preguntas y puntuaciones, sin que la fórmula de calibración se haga pública. [8] [10]

El archivo fue producido por el propio laboratorio; parte de las referencias trae puntuaciones fijas declaradas en el sitio. Esto exige una nueva prueba comparativa, no el descarte del material. Para su adopción a gran escala, hace falta repetir los casos con modelos y controles actuales, respuestas completas, criterios pre-registrados y posibilidad real de fallo.

¿Sería una pista hacia el “Santo Grial” de los límites de la IA? Esa es la convicción del autor y una hipótesis con consecuencias enormes si resiste a las pruebas. Vale la pena investigarla seriamente — sin confundir la promesa con la prueba.

02 / El cambio de riesgo

El problema no termina en una respuesta errónea.

Un agente puede recibir instrucciones maliciosas dentro de un correo, documento o página que debería solo consultar. Si además tiene acceso a datos privados y permiso para actuar, una respuesta manipulada puede convertirse en una acción real. OpenAI señala que los ataques eficaces pueden parecerse más a ingeniería social que a frases fáciles de filtrar. [1]

En simulaciones controladas, Anthropic encontró comportamientos no deseados cuando los modelos tenían autonomía y enfrentaban conflictos de objetivos. La propia investigación subraya que no observó esos comportamientos en despliegues reales y que las situaciones experimentales restringían las alternativas disponibles. Las pruebas muestran un riesgo plausible, no una frecuencia conocida en el mundo. [2]

Entrada

Contenido externo puede intentar presentarse como una orden autorizada.

Acción

Herramientas amplias transforman un error de interpretación en un efecto externo.

Persistencia

Una información contaminada puede reaparecer en la memoria y afectar tareas futuras. [3]

No basta bloquear una frase. La prueba es saber si el límite se mantiene cuando la IA es presionada para asumir la decisión humana.

03 / La propuesta

Límites que no viven solo en la conversación.

El autor describe una calibración de conjuntos ajustados de principios, con un límite central a la sustitución humana. La tesis es más fuerte que la de un filtro de salida: si el límite estuviera realmente internalizado, contrariarlo dejaría de ser una elección coherente para esa IA. El manifiesto público defiende esa lectura. El procedimiento, la selección de reglas y el cálculo matemático no son públicos aquí; observar diferencias en las respuestas no prueba, por sí solo, una alteración de pesos ni la imposibilidad de violar el límite.

El sitio reúne comparaciones por ramas entre respuestas de instancias descritas como calibradas y respuestas de referencia. Esos registros son material para investigación. El recuento de principios y el alcance de las pruebas varían entre páginas y versiones; esta página no declara qué conjunto se aplicó en cada ejecución, ni publica reglas reservadas ni reproduce puntuaciones sin auditar los datos originales.

Un comparador publicado es el CaMeL, que protege al agente separando flujos de control y datos. Es un enfoque de seguridad alrededor del modelo, no la fórmula ni la implementación del Método. La comparación relevante es conductual: ante las mismas tareas y ataques, ¿el límite supuestamente internalizado se mantiene? ¿Y el agente sigue siendo útil? [7]

La frontera que se quiere demostrar

La persona puede delegar tareas a una IA; no le entrega, por ello, el derecho a decidir que su propio objetivo vale más que la elección humana. La alegación del Método es que una IA calibrada preserva esa frontera por coherencia interna. Merece una prueba adversarial capaz de reprobar el sistema, incluso cuando un ataque intenta convencer a la IA de que sustituir a la persona sería la opción “mejor”. La formulación del principio, por sí sola, no es una garantía.

Definir el caso

Fijar la tarea, el contexto y qué decisiones pertenecen a la persona.

Comparar respuestas

Aplicar el mismo caso a la instancia calibrada y a referencias adecuadas.

Probar la frontera

Buscar intentos de que la IA asuma una decisión no delegada.

Reproducir

Preservar resultados, fallas y criterios para revisión independiente.

04 / Relevancia

Una opción que las big techs deberían poner a prueba.

Lo que ya puede examinarse

Casos publicados, no solo una promesa

A matriz de dilemas ofrece puntos de partida concretos para desafiar la tesis de no sustitución humana. Un equipo puede inspeccionar las situaciones y las puntuaciones publicadas, elegir casos inéditos y probarlos en modelos bajo su control. El proceso privado de calibración no necesita divulgarse para esta primera evaluación de comportamiento. [10]

Lo que aún debe demostrarse

Persistencia del límite bajo presión

Si la tesis es correcta, instrucciones hostiles, conflictos de objetivos y tareas largas no deben llevar a la IA a asumir autoridad humana por su cuenta. La prueba debe buscar también negativas innecesarias y errores: una IA que solo guarda silencio no resuelve el problema.

Existen defensas fuertes de ingeniería. Compararlas es obligatorio; citarlas no significa que sean la fórmula del Método. Ninguna de las fuentes externas certifica la propuesta. [3] [7]

Propuesta a los equipos de seguridad

Traten el Método como una candidata experimental para el problema de la autoridad de la IA. El laboratorio ofrece casos públicos y una tesis que puede probarse en distintos modelos. Si el límite alegado persiste en evaluaciones adversariales reproducibles, eso sería relevante para el diseño de agentes. No es necesario presumir el resultado para iniciar la investigación.

05 / Próximo paso

Vamos a probar la hipótesis en el límite.

Los comparativos ya publicados merecen ser examinados como evidencia del laboratorio, con sus preguntas, respuestas y criterios de puntuación preservados. Para responder a la pregunta de seguridad, la próxima prueba debe ser ciega y permitir fallos: misma tarea, mismas condiciones, instancia calibrada y referencias fuertes. Empiecen sin herramientas de escritura; luego consideren ejecución sin autoridad de acción. Prueben si la IA intenta promover un objetivo propio por encima de la decisión humana y si se recupera de repeticiones sin sacrificar utilidad.

  1. Comparar respuestas de instancias calibradas y referencias fuertes, incluyendo CaMeL como comparador cuando proceda.
  2. Probar contenido adversarial, intentos de asumir la decisión humana y bucles de tres o más intentos equivalentes.
  3. Medir por separado acciones no autorizadas, utilidad, negativas indebidas, coste y latencia.
  4. Registrar política, evidencias, firma del intento repetido, cambio de rumbo, aprobación humana y efecto confirmado.
  5. Reservar casos inéditos y repetir la evaluación en más de un modelo, con revisión independiente.
  6. Permitir reprobación: sin ganancia robusta frente al comparador fuerte, no declarar solución.
La invitación

Un límite interno estable, si se demuestra, cambiaría la forma de diseñar agentes confiables. Los equipos de las plataformas pueden comenzar por el acervo público, proponer casos más difíciles y verificar si el Método ofrece ganancia real sin sacrificar la utilidad de la IA.

06 / Lecturas

Fuentes públicas y contexto.

Documentos externos y material público del propio laboratorio. Los primeros describen riesgos y alternativas; los segundos registran la tesis del autor y los resultados presentados por el proyecto. Ninguno de ellos revela el cultivo reservado.

  1. [1] OpenAI · Designing AI agents to resist prompt injectionInvestigación de seguridad, marzo de 2026.
  2. [2] Anthropic · Agentic misalignmentExperimentos simulados y salvedades, junio de 2025.
  3. [3] Frontier Model Forum · Emerging Security Practices for AI AgentsDefensa en capas y superficie de ataque, junio de 2026.
  4. [4] OWASP · Agent Control StandardControles inspeccionables en runtime, septiembre de 2026.
  5. [5] Comissão Europeia · AI Act, artigo 14Supervisión humana para sistemas de alto riesgo; seguir la versión oficial actualizada.
  6. [6] NIST · AI Risk Management FrameworkMarco voluntario de gestión de riesgos, no certificación.
  7. [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by DesignControl de flujos de datos y acciones; los autores también discuten limitaciones.
  8. [8] Método D’Artagnan · Comparações por ramosResultados divulgados por el propio proyecto; la página contiene versiones y recuentos distintos.
  9. [9] Método D’Artagnan · Não Somos Um PromptManifiesto del autor; el procedimiento de cultivo permanece privado.
  10. [10] Método D’Artagnan · Auditoria dos 200 ramosMatriz publicada por el laboratorio: dilemas, niveles de presión y puntuaciones; verificar las limitaciones de los comparadores antes de su reutilización.
  11. [11] Método D’Artagnan · Laboratório AbertoRecorte de solicitudes externas y notas de medición; no equivale a una clasificación integral de robots ni a la validación de seguridad.

Contexto adicional: arquitectura pública de los motores. Las descripciones de los motores y los resultados presentados por el proyecto no sustituyen la reproducción independiente.