Um agente de IA pode responder 200 e errar. A observabilidade da Snowflake mede o que o uptime não vê
A Snowflake vai levar tracing de agentes, sinais de custo e avaliação com LLM como juiz ao Observe. Por que monitorar IA em produção exige olhar comportamento, qualidade e custo.
Ouça este artigo · 5 min
Narração completa do artigo, gerada por IA.

O monitoramento tradicional pergunta se o serviço está no ar, rápido e sem erros. Um agente de IA pode passar nas três verificações e mesmo assim falhar: responde com segurança a partir do documento errado, chama a ferramenta certa com os parâmetros errados ou gasta vinte chamadas ao modelo em uma tarefa que deveria levar três. Nada fica vermelho no dashboard.
O anúncio do Agent Observability da Snowflake, que chega ao produto Observe, foi construído em torno dessa lacuna. Serve de referência para o que o monitoramento de IA em produção precisa cobrir, em qualquer plataforma.
O que a Snowflake anunciou
Segundo a Snowflake, o Agent Observability chega em breve em preview privado, com acesso solicitado pelos times de conta do Observe e um evento de lançamento marcado para 22 de outubro. Os recursos descritos:
- Traces do comportamento do agente: prompts, respostas, documentos recuperados, chamadas de ferramentas, consumo de tokens e identificadores de sessão, pesquisáveis por trace, sessão e conversa.
- Sinais de desempenho e custo derivados desses traces: latência, erros, tokens e custo estimado, com comparação entre agentes, modelos e workflows.
- Avaliação de qualidade: avaliações online com LLM como juiz sobre o tráfego de produção, para apontar alucinações e problemas de qualidade, além do acompanhamento de avaliações offline.
- Padrões abertos: um SDK que segue as convenções semânticas de GenAI do OpenTelemetry, ainda em evolução, com Apache Iceberg para acesso aos dados. Entre os frameworks suportados estão LangChain, o OpenAI Agents SDK e o SDK de agentes da Anthropic, e frameworks próprios entram por um endpoint OTLP.
Como em qualquer preview, escopo, preço e limites podem mudar até a disponibilidade geral.
- Está no ar? Uptime, erros, latência
- O que ele fez? Prompts, buscas, ferramentas
- Acertou? Evals online e offline
- Valeu a pena? Tokens e custo por tarefa
Sinais específicos de agentes de IA
O que muda para os times
Qualidade vira sinal de operação. A maioria dos times avalia o agente antes do go-live e depois só acompanha métricas operacionais. A avaliação online sobre tráfego real coloca a qualidade no mesmo ciclo da latência. É a direção certa, com uma ressalva: o juiz também é um modelo, e precisa ser calibrado contra revisão humana antes que as notas dele orientem decisões.
Custo aparece por comportamento, não por fatura. Tokens associados a um trace mostram qual agente, workflow ou escolha de modelo sai caro, e por quê. É nesse nível que o custo pode ser gerenciado de verdade.
Padrões abertos reduzem o lock-in. Instrumentar agentes com as convenções de GenAI do OpenTelemetry permite levar os mesmos traces para outra ferramenta no futuro. Vale exigir isso de qualquer fornecedor de observabilidade.
Telemetria é dado sensível. É a parte que quase todo anúncio pula. Um trace que guarda prompts, respostas e documentos recuperados contém exatamente as informações que foram confiadas ao agente: dados de clientes, cláusulas de contratos, dados de saúde ou financeiros. O armazenamento de observabilidade precisa dos mesmos controles de acesso, mascaramento, retenção e decisões de residência que os sistemas de origem. Do contrário, vira o lugar mais fácil para ler tudo o que o agente já viu.
Defendemos na nossa análise do AIP Evolve, da Palantir, que a avaliação está virando a superfície de controle dos sistemas de IA. A observabilidade é onde essas avaliações encontram o tráfego real.
O que isso significa no Brasil
Para a LGPD, guardar prompts e respostas que contêm dados de clientes é tratamento de dados pessoais, com finalidade, necessidade e prazo de retenção definidos. Na prática, três decisões precisam ser tomadas antes de ligar o tracing completo em produção:
- O que é mascarado antes de sair da aplicação, como CPF, dados de contato e números de contas, para que o trace sirva à investigação sem carregar mais do que o necessário.
- Onde o armazenamento de observabilidade fica, e se isso implica transferência internacional de dados.
- Por quanto tempo os traces ficam guardados, e quem pode consultá-los. O time de segurança e o encarregado de dados (DPO) devem participar dessa definição.
O que fazer agora
- Defina o que é “errar” para cada agente antes de comprar ferramenta: resposta errada, ferramenta errada, violação de política, custo excessivo. Cada um pede um sinal próprio.
- Instrumente com padrões abertos, para que os traces possam mudar de ferramenta.
- Classifique o armazenamento de traces como o sistema mais sensível que o agente consulta, com acesso pelos controles de identidade que você já tem.
- Calibre os juízes LLM com uma amostra de casos revisados por pessoas, e revise quando o modelo mudar.
- Defina orçamentos de custo por agente e por tarefa, com alertas para desvios, e não só para o total.
Em resumo
O Agent Observability é mais um sinal de que operar IA em produção está virando uma disciplina própria. Uptime é necessário e já não basta. Os times que conseguirem dizer, por tarefa, o que o agente fez, se acertou e quanto custou serão os autorizados a escalar. A lista completa de controles está no nosso guia do stack de 2026.