← Todos os insights

Análise de casoRecorte: Brasil5 min de leitura

Não automatize o processo antigo. A Chatham Financial redesenhou a validação em torno de evidência e exceções

A Chatham Financial reduziu uma revisão de validação de uns 30 minutos para menos de 4 ao perguntar que evidência cada decisão exige, não onde pôr um agente. O roteamento segue essa lógica.

Ouça este artigo · 6 min

Narração completa do artigo, gerada por IA.

Uma lupa sobre uma superfície clara, em duotone La Madre, ao lado das palavras Evidência primeiro
Foto: rawpixel (CC0)

A maioria dos projetos de IA nas empresas começa com uma pergunta que soa prática: onde dá para colocar um agente? A Chatham Financial, consultoria americana de mercado de capitais, começa por outro lugar. O CEO, Matt Henry, descreve a abordagem como partir “do resultado que queremos” e identificar “onde o julgamento importa” antes de decidir como usar IA.

A OpenAI publicou o caso em 2 de outubro. Todos os números abaixo são informados pela Chatham e pela OpenAI.

O que a Chatham construiu

A Chatham usa o Codex, da OpenAI, para construir software interno e para clientes, e o GPT-5.6 nos recursos de IA, em três frentes:

  • Process Zero, o serviço de redesenho de processos. Para cada processo, a Chatham identifica o mínimo de insumos e evidências necessários, define onde o julgamento humano é essencial e decide como a IA e as ferramentas construídas com IA devem apoiar o trabalho.
  • Validação de operações, um dos primeiros resultados do Process Zero. O time de Controles e Integridade de Dados verifica se cada registro no sistema bate com o que o cliente autorizou e com o que foi executado. A nova aplicação reúne a evidência da operação, compara os termos principais e aponta divergências para revisão. Na medição inicial, a revisão caiu de cerca de 30 minutos para menos de 4.
  • Chatham Onyx, o sistema operacional de mercado de capitais, em que clientes e consultores trabalham sobre dados conectados e governados e usam IA “sem perder a rastreabilidade até a fonte”.

Dois detalhes merecem tanta atenção quanto o ganho de tempo. A Chatham diz que está comparando os resultados da aplicação com os de revisores experientes, em operações reais, antes de ampliar a automação. E a aplicação não decide se a operação está correta. Ela monta a evidência e aponta as exceções para uma pessoa.

Evidência primeiro, automação depois

É um alvo de projeto diferente de “um agente que valida operações”. O trabalho é separado entre o que pode ser checado e o que precisa ser julgado:

  1. Definir o resultado: todo registro bate com a autorização e com a execução.
  2. Listar a evidência mínima: confirmações, instruções do cliente, dados de execução.
  3. Automatizar a coleta e a comparação: buscar documentos e casar termos é onde o software é rápido e consistente.
  4. Mandar as exceções para especialistas: uma divergência é questão de julgamento, então vai para uma pessoa com a evidência anexada.
  5. Medir contra o jeito antigo antes de ampliar o escopo.
Redesenho a partir da evidência, como a Chatham descreveDESENHARAUTOMATIZARJULGAR E PROVAR01Resultado aproteger02Evidênciamínimanecessária03IA coleta ecompara04Divergênciasapontadas05Especialistadecide asexceções06Comparaçãocomrevisoresantes deescalarDefinido pelo negócioFeito pelo software
  1. Resultado a proteger
  2. Evidência mínima necessária
  3. IA coleta e compara
  4. Divergências apontadas
  5. Especialista decide as exceções
  6. Comparação com revisores antes de escalar
  • Desenhar: Resultado a proteger · Evidência mínima necessária
  • Automatizar: IA coleta e compara · Divergências apontadas
  • Julgar e provar: Especialista decide as exceções · Comparação com revisores antes de escalar

Definido pelo negócioFeito pelo software

A aplicação faz o trabalho braçal e expõe as exceções. As pessoas ficam com o julgamento, e a automação conquista escopo comparada a elas.

O padrão bate com o que chamamos de trabalho pronto para agentes no framework para encontrar onde o agente cabe: um processo que já existe, um registro claro do que é certo e errado e uma etapa de revisão que as pessoas já fazem.

O roteamento faz parte do mesmo desenho

O caso também mostra roteamento de modelos numa empresa regulada. O Onyx usa GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.4 e GPT-4.1: análises simples e testes fora de produção vão para modelos mais baratos, e o GPT-5.6 fica com as tarefas complexas em que a precisão vale mais. No Chatham Vibes, a plataforma interna em que funcionários constroem as próprias aplicações, os recursos de IA rodam por padrão no GPT-5.6 Terra, com o Sol como upgrade opcional configurado por aplicação.

Essa regra de padrão mais upgrade é tanto decisão de governança quanto de custo. Mantém os apps construídos pelos próprios funcionários num modelo conhecido e mais barato, a menos que alguém peça mais de forma deliberada, e deixa o upgrade visível na configuração. Para quem orça em reais com preços em dólar, esse controle pesa ainda mais. É a forma prática do argumento da análise do roteamento por tarefa no guia do GPT-6.

Por que isso importa para instituições reguladas

O mercado brasileiro tem um paralelo direto. Derivativos de balcão precisam ser registrados na B3, e conciliar o que está registrado com o que foi contratado e confirmado é trabalho diário de back office em bancos e gestoras. É exatamente o tipo de processo em que coletar e comparar evidência pode ser automatizado, e a divergência continua sendo decisão de alguém.

A comparação com revisores experientes também não é só boa prática. Para instituições supervisionadas pelo Banco Central, a estrutura de gestão de riscos exigida pela Resolução CMN 4.557 pressupõe que modelos usados em decisões relevantes sejam validados e acompanhados. Rodar uma ferramenta nova lado a lado com especialistas, em operações reais, produz essa evidência e permite ampliar a automação depois sem chute.

A rastreabilidade é a outra metade. Um sistema que compara termos e aponta o documento de origem deixa trilha de auditoria por construção. Um sistema que responde “esta operação está correta” em texto corrido não deixa.

O que fazer agora

  1. Escolha um processo de controle em que pessoas já conferem registros contra fontes.
  2. Escreva o resultado e a evidência mínima antes de escolher modelo ou ferramenta.
  3. Automatize primeiro a coleta e a comparação; deixe o julgamento das exceções com pessoas.
  4. Rode em paralelo com revisores experientes em casos reais e registre concordâncias e discordâncias.
  5. Defina um modelo padrão e um caminho explícito de upgrade para quem constrói internamente, e registre os upgrades.
  6. Amplie o escopo só com resultado medido, um tipo de operação ou documento por vez.

Em resumo

A redução de 30 para 4 minutos vai virar manchete, e é um número inicial informado pela própria empresa. A lição mais duradoura é a ordem das etapas: definir o resultado, nomear a evidência, automatizar o trabalho braçal, manter o julgamento onde ele deve estar e deixar a concordância medida com especialistas decidir até onde a automação vai.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso