Quando agentes de IA passam a manter sistemas de IA, a avaliação vira o painel de controle
O AIP Evolve da Palantir, já em disponibilidade geral, usa agentes para propor troca de modelo, corte de custo e melhora de avaliação. Por que isso só funciona com boas avaliações.
Ouça este artigo · 5 min
Narração completa do artigo, gerada por IA.

Existe um mito persistente sobre IA em produção: o de que a parte difícil é colocar no ar. Na prática, colocar no ar é quando começa um segundo trabalho. Modelos são atualizados ou descontinuados. Preços mudam. Surgem opções mais rápidas e mais baratas. Só em setembro de 2026, a OpenAI lançou três novos modelos na sua API e o Google colocou um novo modelo padrão em disponibilidade geral no Gemini Enterprise. Cada lançamento desses é uma possível melhoria, e uma possível regressão, para sistemas que já estão em produção.
O AIP Evolve, da Palantir, chama a atenção porque automatiza esse segundo trabalho.
O que a Palantir anunciou
Segundo o anúncio da Palantir de 8 de setembro, o AIP Evolve está em disponibilidade geral para ambientes com AIP habilitado e acesso ao AI FDE. Ele coordena grupos de agentes do AI FDE para melhorar sistemas de IA construídos no Foundry. O time define:
- Um objetivo: migração de modelo, redução de custo, redução de latência, melhora da nota de avaliação ou um objetivo próprio.
- Uma estratégia de validação: casos de teste selecionados ou suítes de avaliação existentes, com pontuação configurável e um nível aceitável de divergência nas respostas.
- Restrições: que tipos de mudança os agentes podem propor e quantas iterações podem executar.
Os agentes então trabalham para atingir o objetivo e produzem uma proposta com as mudanças, os resultados da validação, comparações de respostas, evidências e avaliações de confiança. Pessoas revisam, e as mudanças entram pelo fluxo de branches da Palantir. A empresa diz que os primeiros clientes usaram o recurso para cortar custos de IA, melhorar avaliações e migrar cargas para modelos open source; esses resultados são alegações da Palantir.
O que muda de fato
O ciclo de otimização de um sistema de IA (testar um modelo mais barato, ajustar um prompt, comparar respostas, decidir) era manual e esporádico. O AIP Evolve o torna agêntico e, potencialmente, contínuo.
Isso muda o papel das pessoas. Elas deixam de fazer cada mudança e passam a definir o que é uma mudança aceitável. Os artefatos mais importantes deixam de ser o prompt ou a escolha do modelo. Passam a ser:
- A suíte de avaliação, que define o que é “melhor”.
- O limite de divergência, que define o quanto as respostas podem mudar antes de a mudança ser rejeitada.
- As restrições, que definem o que os agentes podem tocar.
- A etapa de revisão, que decide se a evidência é suficiente.
- Objetivo e restrições
- Agentes propõem mudanças
- Validação contra a suíte de avaliação
- Revisão humana da evidência
- Merge via revisão de branch
O painel de controleDecisões humanas
A avaliação vira o painel de controle
É aqui que muitos times vão subestimar o desafio. Um agente de otimização faz exatamente o que a avaliação recompensa. Se a suíte de testes cobre os casos comuns e não os raros e caros, uma troca de modelo pode passar em todas as verificações e ainda assim falhar onde importa. O custo cai, a nota fica estável, e uma classe de casos extremos piora sem ninguém perceber.
Em outras palavras, a melhoria automatizada é tão segura quanto a avaliação que ela otimiza. Times sem uma suíte de avaliação séria não deveriam ver o AIP Evolve como atalho. Deveriam ver como motivo para construir uma.
Mudança controlada, emprestada da engenharia de software
As escolhas de desenho do AIP Evolve espelham o que times maduros de software já fazem: tipos de mudança delimitados, limite de iterações, evidência anexada a cada proposta, revisão antes do merge e fluxo baseado em branches. É o modelo certo para sistemas de IA em produção, em qualquer plataforma.
Um ponto para empresas brasileiras
Boa parte das empresas brasileiras paga o uso de modelos em dólar. Com isso, a variação de custo por troca de modelo ou por mudança de preço do fornecedor pesa duas vezes: no preço e no câmbio. Ter linhas de base de custo por sistema, e um processo para avaliar migrações com frequência, deixa de ser otimização fina e vira gestão financeira básica.
O que qualquer empresa pode aproveitar
Não é preciso ter Foundry para aplicar a lição:
- Construa e versione uma suíte de avaliação para cada sistema de IA em produção, incluindo os casos raros e caros.
- Registre linhas de base de qualidade, custo e latência, para julgar qualquer mudança.
- Trate mudanças de modelo e de prompt como mudanças de código: propostas, testadas, revisadas e integradas, com caminho de volta.
- Registre por que cada mudança foi aceita. Seis meses depois, esse registro é o que permite confiar no sistema.
- Planeje migrações contínuas. Lançamentos de modelos agora são mensais. Reserve tempo para avaliá-los.
IA em produção não é “implantou e esqueceu”. Seja a manutenção feita por pessoas ou por agentes, os controles são os mesmos. Veja no nosso guia do stack de 2026 como avaliação e ciclo de vida se encaixam no resto do sistema.