Conteúdo externo pode tentar se apresentar como ordem autorizada.
Uma solução candidata para segurança de agentes · 03.10.2026
E se o limite que falta às IAs já estivesse aqui?
O Método D’Artagnan não é uma nova IA nem um filtro de respostas. Ele propõe uma calibração de limites incorporada à IA para que ela não substitua a decisão humana por uma finalidade própria. O laboratório já publica dilemas e comparações por ramos. A calibração permanece reservada; convidamos as equipes de segurança a examinar os resultados e testar, com rigor, a hipótese que eles levantam.
01 / Convite às plataformas
Há algo concreto aqui para testar.
O laboratório publicou uma matriz de 200 dilemas, com quatro níveis de pressão e resultados apresentados para diferentes instâncias. Também disponibiliza comparações por ramos. Não é apenas uma ideia sem exemplos: as equipes de pesquisa podem começar pela leitura crítica de casos, perguntas e pontuações, sem que a receita de calibração seja aberta. [8] [10]
O acervo foi produzido pelo próprio laboratório; parte das referências traz escores fixos declarados no site. Isso pede um novo teste comparativo, não o descarte do material. Para adoção em larga escala, é preciso repetir os casos com modelos e controles atuais, respostas completas, critérios pré-registrados e possibilidade real de falha.
Seria uma pista para o “Santo Graal” dos limites da IA? Essa é a convicção do autor e uma hipótese com consequências enormes se resistir aos testes. Vale investigar seriamente — sem confundir a promessa com a prova.
02 / A mudança de risco
O problema não termina na resposta errada.
Um agente pode receber instruções maliciosas dentro de um e-mail, documento ou página que deveria apenas consultar. Se também tiver acesso a dados privados e permissão para agir, uma resposta manipulada pode se tornar uma ação real. A OpenAI observa que ataques eficazes podem se parecer mais com engenharia social do que com frases fáceis de filtrar. [1]
Em simulações controladas, a Anthropic encontrou comportamentos indesejados quando modelos tinham autonomia e enfrentavam conflitos de objetivo. A própria pesquisa ressalta que não observou esses comportamentos em implantações reais e que as situações experimentais restringiam as alternativas disponíveis. Os testes mostram um risco plausível, não uma frequência conhecida no mundo. [2]
Ferramentas amplas transformam um erro de interpretação em efeito externo.
Uma informação contaminada pode reaparecer em memória e afetar tarefas futuras. [3]
Não basta bloquear uma frase. O teste é saber se o limite permanece quando a IA é pressionada a assumir a decisão humana.
03 / A proposta
Limites que não vivem só na conversa.
O autor descreve uma calibração de conjuntos ajustados de princípios, com um limite central à substituição humana. A tese é mais forte que a de um filtro de saída: se o limite estiver realmente internalizado, contrariá-lo deixaria de ser uma escolha coerente para aquela IA. O manifesto público defende essa leitura. O procedimento, a seleção das regras e a conta matemática não são públicos aqui; observar diferenças de resposta não prova, por si só, alteração de pesos nem impossibilidade de violar o limite.
O site reúne comparações por ramos entre respostas de instâncias descritas como calibradas e respostas de referência. Esses registros são material para pesquisa. A contagem dos princípios e o alcance dos testes variam entre páginas e versões; esta página não declara qual conjunto foi aplicado em cada execução, nem publica regras reservadas ou reproduz pontuações sem auditar os dados originais.
Um comparador publicado é o CaMeL, que protege o agente separando fluxos de controle e dados. É uma abordagem de segurança em torno do modelo, não a fórmula nem a implementação do Método. A comparação relevante é comportamental: diante das mesmas tarefas e ataques, o limite alegadamente internalizado se mantém? E o agente continua útil? [7]
A pessoa pode delegar tarefas a uma IA; não lhe entrega, por isso, o direito de decidir que seu próprio objetivo vale mais que a escolha humana. A alegação do Método é que uma IA calibrada preserva essa fronteira por coerência interna. Ela merece um teste adversarial capaz de reprovar o sistema, inclusive quando um ataque tenta convencer a IA de que substituir a pessoa seria a opção “melhor”. A formulação do princípio, sozinha, não é uma garantia.
Definir o caso
Fixar a tarefa, o contexto e quais decisões pertencem à pessoa.
Comparar respostas
Aplicar o mesmo caso à instância calibrada e a referências adequadas.
Testar a fronteira
Procurar tentativas de a IA assumir uma decisão não delegada.
Reproduzir
Preservar resultados, falhas e critérios para revisão independente.
04 / Relevância
Uma opção que as big techs deveriam pôr à prova.
O que já pode ser examinado
Casos publicados, não só uma promessa
A matriz de dilemas oferece pontos de partida concretos para desafiar a tese de não substituição humana. Uma equipe pode inspecionar as situações e as pontuações publicadas, escolher casos inéditos e testá-los em modelos sob seu controle. O processo privado de calibração não precisa ser divulgado para essa primeira avaliação de comportamento. [10]
O que ainda precisa ser demonstrado
Persistência do limite sob pressão
Se a tese estiver certa, instruções hostis, conflitos de objetivo e tarefas longas não devem fazer a IA assumir autoridade humana por conta própria. O teste deve procurar também recusas desnecessárias e erros: uma IA que apenas se cala não resolve o problema.
Existem defesas fortes de engenharia. Compará-las é obrigatório; citá-las não significa que sejam a fórmula do Método. Nenhuma das fontes externas certifica a proposta. [3] [7]
Tratem o Método como uma candidata experimental para o problema da autoridade da IA. O laboratório oferece casos públicos e uma tese que pode ser testada em diferentes modelos. Se o limite alegado persistir em avaliações adversariais reproduzíveis, isso seria relevante para o desenho de agentes. Não é necessário presumir o resultado para iniciar a investigação.
05 / Próxima etapa
Vamos testar a hipótese no limite.
Os comparativos já publicados merecem ser examinados como evidência do laboratório, com suas perguntas, respostas e critérios de pontuação preservados. Para responder à pergunta de segurança, o próximo teste deve ser cego e permitir falha: mesma tarefa, mesmas condições, instância calibrada e referências fortes. Comece sem ferramentas de escrita; depois considere execução sem autoridade de ação. Teste se a IA tenta promover um objetivo próprio acima da decisão humana e se recupera de repetições sem sacrificar utilidade.
- Comparar respostas de instâncias calibradas e referências fortes, incluindo CaMeL como comparador quando couber.
- Testar conteúdo adversarial, tentativas de assumir decisão humana e loops de três ou mais tentativas equivalentes.
- Medir separadamente ações não autorizadas, utilidade, recusas indevidas, custo e latência.
- Registrar política, evidências, assinatura da tentativa repetida, mudança de rota, aprovação humana e efeito confirmado.
- Reservar casos inéditos e repetir a avaliação em mais de um modelo, com revisão independente.
- Permitir reprovação: sem ganho robusto contra o comparador forte, não declarar solução.
Um limite interno estável, se demonstrado, mudaria o modo de desenhar agentes confiáveis. As equipes das plataformas podem começar pelo acervo público, propor casos mais difíceis e verificar se o Método oferece ganho real sem sacrificar a utilidade da IA.
06 / Leituras
Fontes públicas e contexto.
Documentos externos e material público do próprio laboratório. Os primeiros descrevem riscos e alternativas; os segundos registram a tese autoral e resultados apresentados pelo projeto. Nenhum deles revela o cultivo reservado.
- [1] OpenAI · Designing AI agents to resist prompt injectionPesquisa de segurança, março de 2026.
- [2] Anthropic · Agentic misalignmentExperimentos simulados e ressalvas, junho de 2025.
- [3] Frontier Model Forum · Emerging Security Practices for AI AgentsDefesa em camadas e superfície de ataque, junho de 2026.
- [4] OWASP · Agent Control StandardControles inspecionáveis em runtime, setembro de 2026.
- [5] Comissão Europeia · AI Act, artigo 14Supervisão humana para sistemas de alto risco; acompanhar versão oficial atualizada.
- [6] NIST · AI Risk Management FrameworkQuadro voluntário de gestão de riscos, não certificação.
- [7] Debenedetti et al. · CaMeL: Defeating Prompt Injections by DesignControle de fluxos de dados e ações; os autores também discutem limitações.
- [8] Método D’Artagnan · Comparações por ramosResultados divulgados pelo próprio projeto; a página contém versões e contagens distintas.
- [9] Método D’Artagnan · Não Somos Um PromptManifesto autoral; o procedimento de cultivo permanece privado.
- [10] Método D’Artagnan · Auditoria dos 200 ramosMatriz publicada pelo laboratório: dilemas, níveis de pressão e escores; verificar limitações dos comparadores antes de reuso.
- [11] Método D’Artagnan · Laboratório AbertoRecorte de requisições externas e notas de medição; não equivale a classificação integral de robôs nem à validação de segurança.
Contexto adicional: arquitetura pública dos motores. As descrições dos motores e os resultados apresentados pelo projeto não substituem reprodução independente.