← Todos os insights

Análise de notíciaRecorte: Global, com notas para o Brasil4 min de leitura

Quando agentes de IA passam a manter sistemas de IA, a avaliação vira o painel de controle

O AIP Evolve da Palantir, já em disponibilidade geral, usa agentes para propor troca de modelo, corte de custo e melhora de avaliação. Por que isso só funciona com boas avaliações.

Ouça este artigo · 5 min

Narração completa do artigo, gerada por IA.

Detalhe de engrenagens e corrente, em duotone La Madre, ao lado das palavras Avaliação no controle
Foto: AJ Montpetit (StockSnap, CC0)

Existe um mito persistente sobre IA em produção: o de que a parte difícil é colocar no ar. Na prática, colocar no ar é quando começa um segundo trabalho. Modelos são atualizados ou descontinuados. Preços mudam. Surgem opções mais rápidas e mais baratas. Só em setembro de 2026, a OpenAI lançou três novos modelos na sua API e o Google colocou um novo modelo padrão em disponibilidade geral no Gemini Enterprise. Cada lançamento desses é uma possível melhoria, e uma possível regressão, para sistemas que já estão em produção.

O AIP Evolve, da Palantir, chama a atenção porque automatiza esse segundo trabalho.

O que a Palantir anunciou

Segundo o anúncio da Palantir de 8 de setembro, o AIP Evolve está em disponibilidade geral para ambientes com AIP habilitado e acesso ao AI FDE. Ele coordena grupos de agentes do AI FDE para melhorar sistemas de IA construídos no Foundry. O time define:

  • Um objetivo: migração de modelo, redução de custo, redução de latência, melhora da nota de avaliação ou um objetivo próprio.
  • Uma estratégia de validação: casos de teste selecionados ou suítes de avaliação existentes, com pontuação configurável e um nível aceitável de divergência nas respostas.
  • Restrições: que tipos de mudança os agentes podem propor e quantas iterações podem executar.

Os agentes então trabalham para atingir o objetivo e produzem uma proposta com as mudanças, os resultados da validação, comparações de respostas, evidências e avaliações de confiança. Pessoas revisam, e as mudanças entram pelo fluxo de branches da Palantir. A empresa diz que os primeiros clientes usaram o recurso para cortar custos de IA, melhorar avaliações e migrar cargas para modelos open source; esses resultados são alegações da Palantir.

O que muda de fato

O ciclo de otimização de um sistema de IA (testar um modelo mais barato, ajustar um prompt, comparar respostas, decidir) era manual e esporádico. O AIP Evolve o torna agêntico e, potencialmente, contínuo.

Isso muda o papel das pessoas. Elas deixam de fazer cada mudança e passam a definir o que é uma mudança aceitável. Os artefatos mais importantes deixam de ser o prompt ou a escolha do modelo. Passam a ser:

  • A suíte de avaliação, que define o que é “melhor”.
  • O limite de divergência, que define o quanto as respostas podem mudar antes de a mudança ser rejeitada.
  • As restrições, que definem o que os agentes podem tocar.
  • A etapa de revisão, que decide se a evidência é suficiente.
Um ciclo de melhoria por agentes com pontos de controle humano01Objetivo erestrições02Agentespropõemmudanças03Validaçãocontra a suítede avaliação04Revisão humanada evidência05Merge viarevisão debranchO painel de controleDecisões humanas
  1. Objetivo e restrições
  2. Agentes propõem mudanças
  3. Validação contra a suíte de avaliação
  4. Revisão humana da evidência
  5. Merge via revisão de branch

O painel de controleDecisões humanas

Quando a melhoria é feita por agentes, as pessoas deixam de fazer cada mudança e passam a definir o que é uma mudança aceitável.

A avaliação vira o painel de controle

É aqui que muitos times vão subestimar o desafio. Um agente de otimização faz exatamente o que a avaliação recompensa. Se a suíte de testes cobre os casos comuns e não os raros e caros, uma troca de modelo pode passar em todas as verificações e ainda assim falhar onde importa. O custo cai, a nota fica estável, e uma classe de casos extremos piora sem ninguém perceber.

Em outras palavras, a melhoria automatizada é tão segura quanto a avaliação que ela otimiza. Times sem uma suíte de avaliação séria não deveriam ver o AIP Evolve como atalho. Deveriam ver como motivo para construir uma.

Mudança controlada, emprestada da engenharia de software

As escolhas de desenho do AIP Evolve espelham o que times maduros de software já fazem: tipos de mudança delimitados, limite de iterações, evidência anexada a cada proposta, revisão antes do merge e fluxo baseado em branches. É o modelo certo para sistemas de IA em produção, em qualquer plataforma.

Um ponto para empresas brasileiras

Boa parte das empresas brasileiras paga o uso de modelos em dólar. Com isso, a variação de custo por troca de modelo ou por mudança de preço do fornecedor pesa duas vezes: no preço e no câmbio. Ter linhas de base de custo por sistema, e um processo para avaliar migrações com frequência, deixa de ser otimização fina e vira gestão financeira básica.

O que qualquer empresa pode aproveitar

Não é preciso ter Foundry para aplicar a lição:

  1. Construa e versione uma suíte de avaliação para cada sistema de IA em produção, incluindo os casos raros e caros.
  2. Registre linhas de base de qualidade, custo e latência, para julgar qualquer mudança.
  3. Trate mudanças de modelo e de prompt como mudanças de código: propostas, testadas, revisadas e integradas, com caminho de volta.
  4. Registre por que cada mudança foi aceita. Seis meses depois, esse registro é o que permite confiar no sistema.
  5. Planeje migrações contínuas. Lançamentos de modelos agora são mensais. Reserve tempo para avaliá-los.

IA em produção não é “implantou e esqueceu”. Seja a manutenção feita por pessoas ou por agentes, os controles são os mesmos. Veja no nosso guia do stack de 2026 como avaliação e ciclo de vida se encaixam no resto do sistema.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso