O problema que o ProvenanceGuard resolve

A verificação de fonte em agentes MCP começa com um ponto que os sistemas tradicionais ignoram: um fato pode ser verdadeiro e ainda assim chegar ao usuário com a atribuição errada. Quando um agente baseado em MCP responde "De acordo com o cadastro do cliente, o plano inclui 30 dias de devolução", a política de devolução pode existir em outro documento da base de dados. O verificador padrão passa porque o fato está em algum ponto do contexto. O usuário lê, acredita que o cadastro confirma o prazo e toma decisões com base nisso.

A equipe liderada por Ander Alvarez Sanz e Alessandro Genuardi na Multiverse Computing publicou o ProvenanceGuard em 29 de setembro de 2026. O paper está disponível no arXiv 2606.18037. O que eles chamam de "conflação entre fontes" é a razão pela qual verificadores como RAGAS Faithfulness e MiniCheck passam por erros que um auditor humano pegaria: eles confirmam que o fato existe em algum ponto do pool de evidências, sem checar de qual ferramenta ele veio.

Como o ProvenanceGuard funciona

O sistema opera como uma camada de verificação de fonte em agentes MCP acoplada aos traces capturados pelo protocolo. Cada trace registra quais ferramentas foram chamadas, com que IDs estáveis, e quais foram as saídas brutas. Com isso, o ProvenanceGuard faz cinco etapas:

  1. Decompõe a resposta em afirmações atômicas
  2. Roteia cada afirmação até a fonte mais relevante usando embeddings MiniLM
  3. Checa o suporte via NLI com o modelo DeBERTa-v3-base
  4. Compara a fonte de suporte com a fonte que o agente citou na resposta
  5. Emite um veredicto por afirmação e um allow/block para a resposta inteira

Respostas bloqueadas entram em um loop de revisão no estilo RARR: o sistema reformula e re-verifica. Nos testes, resolveu 173 respostas bloqueadas em média em 0,5 segundo cada, sem retreinar o agente base.

Resultados nos testes

A avaliação usou 281 traces reais de um agente médico que acessa prontuários de pacientes, artigos de pesquisa e outras ferramentas clínicas, domínio em que confundir fontes tem consequências sérias. O conjunto de teste final teve 361 afirmações verificadas por humanos.

O ProvenanceGuard capturou 138 de 139 afirmações sem suporte e identificou a fonte correta em aproximadamente 86% dos casos elegíveis. O F1 de reject/block ficou em 0,802, o maior entre todos os sistemas comparados:

SistemaF1 reject/block
ProvenanceGuard0,802
MiniCheck0,783
RAGAS Faithfulness0,758
AlignScore0,662
SummaC-ZS0,436

Em um teste controlado com 50 afirmações verdadeiras onde os pesquisadores trocaram propositalmente a atribuição de fonte, o sistema detectou todos os 50 erros. O único ponto de atenção: quando as fontes são semanticamente próximas entre si, a precisão na identificação da fonte certa cai para 50,3%, mesmo que o F1 de bloqueio se mantenha em 0,846.

Por que isso importa para o seu negócio

Agentes de IA conectados via MCP já atuam em suporte ao cliente, análise financeira e setores regulados. Um agente que diz "conforme o contrato" e cita o documento errado não é um bug exótico: é um risco de compliance e de confiança.

A segurança em pipelines MCP já está no radar com o vazamento de credenciais documentado pelo GitGuardian em ferramentas como Cursor, Claude Code e Copilot. A verificação de fonte em agentes MCP adiciona outra camada crítica: não basta o agente não vazar dados, ele também não pode confundir de qual ferramenta cada fato veio.

A adoção pelo NVFlow da NVIDIA em um agente financeiro de produção mostra que a abordagem é viável fora do laboratório. O sistema usa modelos locais, roda offline sobre traces já capturados e não exige nenhuma modificação no agente base. Para equipes que já têm pipelines MCP no ar, o custo de adoção é baixo.

Se a sua empresa usa ou planeja agentes com múltiplas ferramentas, vale lembrar que a responsabilidade por erros de atribuição não desaparece porque o fato era tecnicamente verdadeiro em algum lugar do contexto.


Conteúdo reescrito e traduzido para PT pela redação luiscortex, revisado por humano.

Fontes: