Anthropic e Accenture anunciaram uma parceria de avaliação independente, incluindo testes adversariais e verificação de salvaguardas. O modelo está em construção, sem padrões consolidados de acesso e reporte.
Aplicação: Separar quem gera o Plano A/B de quem valida regras, cálculos e evidências.
Integração proposta: Recommendation Engine → verificação determinística → aprovação humana.
Risco: Outro agente pode repetir o erro do primeiro; duas IAs concordarem não basta.
Experimento sugerido: Usar dez casos sintéticos com resposta esperada validada por um responsável humano. Incluir frete duplicado, divergência de inventário e reprogramação sem autorização.