← Todos os insights

Análise de notíciaRecorte: Brasil4 min de leitura

Um agente de IA pode responder 200 e errar. A observabilidade da Snowflake mede o que o uptime não vê

A Snowflake vai levar tracing de agentes, sinais de custo e avaliação com LLM como juiz ao Observe. Por que monitorar IA em produção exige olhar comportamento, qualidade e custo.

Ouça este artigo · 5 min

Narração completa do artigo, gerada por IA.

Painel de cabine de avião cheio de mostradores analógicos, em duotone La Madre, ao lado das palavras Além do uptime
Foto: rawpixel (CC0)

O monitoramento tradicional pergunta se o serviço está no ar, rápido e sem erros. Um agente de IA pode passar nas três verificações e mesmo assim falhar: responde com segurança a partir do documento errado, chama a ferramenta certa com os parâmetros errados ou gasta vinte chamadas ao modelo em uma tarefa que deveria levar três. Nada fica vermelho no dashboard.

O anúncio do Agent Observability da Snowflake, que chega ao produto Observe, foi construído em torno dessa lacuna. Serve de referência para o que o monitoramento de IA em produção precisa cobrir, em qualquer plataforma.

O que a Snowflake anunciou

Segundo a Snowflake, o Agent Observability chega em breve em preview privado, com acesso solicitado pelos times de conta do Observe e um evento de lançamento marcado para 22 de outubro. Os recursos descritos:

  • Traces do comportamento do agente: prompts, respostas, documentos recuperados, chamadas de ferramentas, consumo de tokens e identificadores de sessão, pesquisáveis por trace, sessão e conversa.
  • Sinais de desempenho e custo derivados desses traces: latência, erros, tokens e custo estimado, com comparação entre agentes, modelos e workflows.
  • Avaliação de qualidade: avaliações online com LLM como juiz sobre o tráfego de produção, para apontar alucinações e problemas de qualidade, além do acompanhamento de avaliações offline.
  • Padrões abertos: um SDK que segue as convenções semânticas de GenAI do OpenTelemetry, ainda em evolução, com Apache Iceberg para acesso aos dados. Entre os frameworks suportados estão LangChain, o OpenAI Agents SDK e o SDK de agentes da Anthropic, e frameworks próprios entram por um endpoint OTLP.

Como em qualquer preview, escopo, preço e limites podem mudar até a disponibilidade geral.

Quatro perguntas que o monitoramento de IA em produção precisa responder01Está no ar? Uptime,erros, latência02O que ele fez?Prompts, buscas,ferramentas03Acertou? Evals onlinee offline04Valeu a pena? Tokens ecusto por tarefaSinais específicos de agentes de IA
  1. Está no ar? Uptime, erros, latência
  2. O que ele fez? Prompts, buscas, ferramentas
  3. Acertou? Evals online e offline
  4. Valeu a pena? Tokens e custo por tarefa

Sinais específicos de agentes de IA

O monitoramento clássico para no primeiro quadro. Um agente pode passar nele e falhar nos outros três.

O que muda para os times

Qualidade vira sinal de operação. A maioria dos times avalia o agente antes do go-live e depois só acompanha métricas operacionais. A avaliação online sobre tráfego real coloca a qualidade no mesmo ciclo da latência. É a direção certa, com uma ressalva: o juiz também é um modelo, e precisa ser calibrado contra revisão humana antes que as notas dele orientem decisões.

Custo aparece por comportamento, não por fatura. Tokens associados a um trace mostram qual agente, workflow ou escolha de modelo sai caro, e por quê. É nesse nível que o custo pode ser gerenciado de verdade.

Padrões abertos reduzem o lock-in. Instrumentar agentes com as convenções de GenAI do OpenTelemetry permite levar os mesmos traces para outra ferramenta no futuro. Vale exigir isso de qualquer fornecedor de observabilidade.

Telemetria é dado sensível. É a parte que quase todo anúncio pula. Um trace que guarda prompts, respostas e documentos recuperados contém exatamente as informações que foram confiadas ao agente: dados de clientes, cláusulas de contratos, dados de saúde ou financeiros. O armazenamento de observabilidade precisa dos mesmos controles de acesso, mascaramento, retenção e decisões de residência que os sistemas de origem. Do contrário, vira o lugar mais fácil para ler tudo o que o agente já viu.

Defendemos na nossa análise do AIP Evolve, da Palantir, que a avaliação está virando a superfície de controle dos sistemas de IA. A observabilidade é onde essas avaliações encontram o tráfego real.

O que isso significa no Brasil

Para a LGPD, guardar prompts e respostas que contêm dados de clientes é tratamento de dados pessoais, com finalidade, necessidade e prazo de retenção definidos. Na prática, três decisões precisam ser tomadas antes de ligar o tracing completo em produção:

  • O que é mascarado antes de sair da aplicação, como CPF, dados de contato e números de contas, para que o trace sirva à investigação sem carregar mais do que o necessário.
  • Onde o armazenamento de observabilidade fica, e se isso implica transferência internacional de dados.
  • Por quanto tempo os traces ficam guardados, e quem pode consultá-los. O time de segurança e o encarregado de dados (DPO) devem participar dessa definição.

O que fazer agora

  1. Defina o que é “errar” para cada agente antes de comprar ferramenta: resposta errada, ferramenta errada, violação de política, custo excessivo. Cada um pede um sinal próprio.
  2. Instrumente com padrões abertos, para que os traces possam mudar de ferramenta.
  3. Classifique o armazenamento de traces como o sistema mais sensível que o agente consulta, com acesso pelos controles de identidade que você já tem.
  4. Calibre os juízes LLM com uma amostra de casos revisados por pessoas, e revise quando o modelo mudar.
  5. Defina orçamentos de custo por agente e por tarefa, com alertas para desvios, e não só para o total.

Em resumo

O Agent Observability é mais um sinal de que operar IA em produção está virando uma disciplina própria. Uptime é necessário e já não basta. Os times que conseguirem dizer, por tarefa, o que o agente fez, se acertou e quanto custou serão os autorizados a escalar. A lista completa de controles está no nosso guia do stack de 2026.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso