← Todos os insights

Nota de campoRecorte: Brasil4 min de leitura

Em IA regulada, o modelo nunca corrige a própria prova. A evidência tem de vir de fora dele

Dual Run, ferramentas de verificação e revisores calibrados seguem uma regra: a evidência de que uma saída de IA está certa precisa vir de algo independente do modelo. Um teste para setores regulados.

Ouça este artigo · 5 min

Narração completa do artigo, gerada por IA.

Mãos medindo uma peça de madeira torneada com um paquímetro de aço, em duotone La Madre, ao lado das palavras A prova vem de fora
Foto: James Frid (StockSnap, CC0)

Dois anúncios desta semana parecem não ter relação. As ferramentas de modernização de mainframe do Google usam o Gemini para ler código legado e depois confiam no Dual Run, uma reexecução determinística de transações reais, para provar que o sistema novo se comporta igual. A marca d’água de texto da OpenAI vem acompanhada de uma lista franca do que a detecção não consegue provar. Coloque os dois ao lado do que cobrimos na última semana e aparece uma regra para organizações reguladas: a evidência de que uma saída de IA está certa precisa vir de algo independente do modelo que a produziu.

É um ponto de vista, e vamos dizer onde ele se apoia em fato e onde é leitura nossa.

A evidência por trás da regra

  • Modernização. No desenho do Dual Run do Google, a leitura do Gemini sobre o código legado é um conjunto de hipóteses; a prova é o que os dois sistemas fazem com as mesmas transações reais. O Intesa Sanpaolo descreve o Dual Run como a evidência que constrói para a diretoria, os controles internos e os reguladores.
  • Proveniência. Os próprios números da OpenAI mostram a detecção da marca d’água caindo de cerca de 92% para 66% quando 10% das palavras são trocadas. Um sinal probabilístico não sustenta sozinho uma decisão sobre uma pessoa.
  • Engenharia. No GPT-Synopsys, o modelo opera ferramentas de projeto de chips, mas as ferramentas de verificação dão a palavra final.
  • Operações financeiras. O sistema de contas a pagar da Snowflake mantém conciliação e cálculos determinísticos, e a Chatham Financial redesenhou a validação de operações em torno de evidência e exceções.
  • Pessoas. O estudo da IBM com líderes de RH mostra que um revisor que não consegue contestar a IA não é controle.

Quatro fontes de prova que valem, três que não valem

Esta evidência é independente do modelo?01Comparaçãocom umsistemaconfiável02Verificadorde domínioou motorde regras03Conjuntodereferênciafeito porespecialistas04Revisorqualificadoque poderejeitar05O modelochecando asi mesmo06LLM juizsemcalibração07BenchmarksdofornecedorVale como evidência
  1. Comparação com um sistema confiável
  2. Verificador de domínio ou motor de regras
  3. Conjunto de referência feito por especialistas
  4. Revisor qualificado que pode rejeitar
  5. O modelo checando a si mesmo
  6. LLM juiz sem calibração
  7. Benchmarks do fornecedor

Vale como evidência

Um LLM juiz vira evidência depois de calibrado contra pessoas qualificadas nos seus próprios casos. Antes disso, é uma segunda opinião de uma mente parecida.

O que vale. Comparação determinística com um sistema em que você já confia (Dual Run, conciliações, execuções em paralelo). Um verificador de domínio que não compartilha os modos de falha do modelo: simuladores, motores de regras, motores de cálculo, checagens de aprovação. Um conjunto de referência montado por especialistas com os seus casos, separado de qualquer coisa usada para ajustar o modelo. Um revisor qualificado com tempo, informação e autoridade para rejeitar.

O que não vale sozinho. O modelo explicando por que está certo. Outro LLM julgando o primeiro, a menos que você tenha medido com que frequência ele concorda com os seus especialistas. Benchmarks publicados pelo fornecedor, que testam as tarefas dele, não as suas.

O regulador já fala essa língua

Nada disso é novo para setores regulados; a IA só torna o tema urgente.

Na indústria farmacêutica brasileira, o Guia nº 33/2020 da Anvisa sobre validação de sistemas computadorizados, aplicado junto com as Boas Práticas de Fabricação da RDC 658/2022, pede que sistemas relevantes para BPF sejam validados para o uso pretendido, com controle de acesso, rastreabilidade e integridade de dados. Um passo assistido por IA num processo de BPF vai ser cobrado pelo mesmo critério: qual evidência independente mostra que ele funciona? O relatório da própria ferramenta não responde a essa pergunta.

Nos bancos, os times de risco de modelo conhecem o princípio como desafio efetivo (effective challenge): análise crítica feita por pessoas objetivas e bem informadas, com poder de exigir mudanças. Um modelo que se valida sozinho é o contrário disso. IA generativa usada em crédito, prevenção a fraude ou compliance vai ser medida por esse padrão, chame-se ou não de modelo.

O que isso implica para a arquitetura

A nossa leitura, e é uma leitura, não um fato: os sistemas de IA regulados que chegarem primeiro à produção serão desenhados como dois sistemas, um que produz e outro que prova. O sistema que prova costuma ser antigo (uma conciliação, um protocolo de validação, uma etapa de revisão) e propositalmente não é IA. Inclua-o no orçamento desde o início; é ali que vai a maior parte do esforço, e é ele que o auditor vai ler.

O que fazer agora

  1. Para cada etapa de IA num processo regulado, nomeie a evidência independente de que a saída está certa.
  2. Se a única evidência for o modelo ou um modelo parecido, não deixe a etapa passar de “recomendar”.
  3. Monte conjuntos de referência com especialistas a partir dos seus casos e mantenha-os fora do ajuste do modelo.
  4. Calibre qualquer LLM juiz contra revisores qualificados antes de confiar nele.
  5. Dê aos revisores autoridade e tempo para rejeitar, e acompanhe com que frequência rejeitam.
  6. Monte o pacote de evidência para a auditoria durante o projeto, não depois do go-live.

Para fechar

A IA lê, redige, traduz e transforma mais rápido que qualquer time. Numa organização regulada, ela continua sem poder ser a própria testemunha. Desenhe cada uso em produção para que a prova venha de fora do modelo, e a conversa com risco, qualidade e regulador fica bem mais curta.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso