Un agente de IA puede devolver un 200 y equivocarse. Snowflake mide lo que el uptime no ve
Snowflake llevará el tracing de agentes, las señales de coste y la evaluación con LLM como juez a Observe. Por qué monitorizar IA en producción exige medir comportamiento, calidad y coste.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

La monitorización tradicional pregunta si un servicio está disponible, si es rápido y si no da errores. Un agente de IA puede superar las tres comprobaciones y aun así fallar: responde con seguridad a partir del documento equivocado, llama a la herramienta correcta con los parámetros incorrectos o encadena veinte llamadas al modelo para una tarea que debería resolver en tres. Nada se pone en rojo en el dashboard.
El anuncio de Agent Observability de Snowflake, que llegará a su producto Observe, gira en torno a esa brecha. Es una buena referencia de lo que debe cubrir hoy la monitorización de IA en producción, sea cual sea la plataforma.
Qué anunció Snowflake
Según Snowflake, Agent Observability llegará pronto en preview privada, con acceso a través de los equipos de cuenta de Observe y un evento de lanzamiento previsto para el 22 de octubre. Las capacidades que describe:
- Trazas del comportamiento del agente: prompts, respuestas, documentos recuperados, llamadas a herramientas, consumo de tokens e identificadores de sesión, con búsqueda por traza, sesión y conversación.
- Señales de rendimiento y coste derivadas de esas trazas: latencia, errores, tokens y coste estimado, con comparaciones entre agentes, modelos y flujos de trabajo.
- Evaluación de calidad: evaluaciones online con un LLM como juez sobre el tráfico de producción para detectar alucinaciones y problemas de calidad, además del seguimiento de evaluaciones offline.
- Estándares abiertos: un SDK que sigue las convenciones semánticas de GenAI de OpenTelemetry, todavía en evolución, con Apache Iceberg para el acceso a los datos. Entre los frameworks compatibles están LangChain, el OpenAI Agents SDK y el SDK de agentes de Anthropic, y los frameworks propios se conectan mediante un endpoint OTLP.
Como en toda preview, el alcance, el precio y los límites pueden cambiar antes de la disponibilidad general.
- ¿Está disponible? Uptime, errores, latencia
- ¿Qué hizo? Prompts, búsquedas, herramientas
- ¿Acertó? Evals online y offline
- ¿Mereció la pena? Tokens y coste por tarea
Señales propias de los agentes de IA
Qué cambia para los equipos
La calidad pasa a ser una señal operativa. La mayoría de los equipos evalúa el agente antes del lanzamiento y después solo vigila métricas operativas. La evaluación online sobre tráfico real lleva la calidad al mismo ciclo que la latencia. Es la dirección correcta, con un matiz: el juez también es un modelo, y hay que calibrarlo frente a revisiones humanas antes de que sus puntuaciones guíen decisiones.
El coste se ve por comportamiento, no por factura. Los tokens asociados a una traza muestran qué agente, flujo o elección de modelo resulta caro, y por qué. Es el nivel en el que el coste se puede gestionar de verdad.
Los estándares abiertos reducen el lock-in. Instrumentar los agentes con las convenciones de GenAI de OpenTelemetry permite llevar las mismas trazas a otra herramienta en el futuro. Conviene exigirlo a cualquier proveedor de observabilidad.
La telemetría es un dato sensible. Es la parte que casi todos los anuncios omiten. Una traza que guarda prompts, respuestas y documentos recuperados contiene justo la información que se confió al agente: datos de clientes, cláusulas contractuales, datos sanitarios o financieros. El almacén de observabilidad necesita los mismos controles de acceso, enmascaramiento, retención y decisiones de residencia que los sistemas de origen. Si no, se convierte en el sitio más fácil para leer todo lo que el agente ha visto.
En nuestro análisis de AIP Evolve, de Palantir, defendíamos que la evaluación se está convirtiendo en la superficie de control de los sistemas de IA. La observabilidad es donde esas evaluaciones se encuentran con el tráfico real.
España: registros que la regulación ya pide
En la UE, el Reglamento de IA exige que los sistemas de alto riesgo permitan el registro automático de eventos durante su funcionamiento (artículo 12). Las trazas de un agente son una forma natural de cumplir esa obligación, siempre que se diseñen para ello. Al mismo tiempo, el RGPD exige minimización y plazos de conservación definidos: guardar todos los prompts y respuestas para siempre no es una opción. El equilibrio entre ambas obligaciones es una decisión que debe tomarse con los equipos de privacidad y de compliance, no solo con ingeniería.
Latinoamérica: enmascarar antes de exportar
En México, Colombia, Chile o Argentina, la pregunta práctica es qué datos personales salen hacia el almacén de observabilidad y dónde se guardan. Enmascarar identificadores y datos de contacto antes de exportar las trazas, y elegir la región del almacén con el mismo criterio que la de los datos de origen, evita que la telemetría se convierta en el punto débil del cumplimiento.
Qué hacer ahora
- Defina qué es “equivocarse” para cada agente antes de comprar herramientas: respuesta errónea, herramienta equivocada, incumplimiento de política, coste excesivo. Cada caso necesita su propia señal.
- Instrumente con estándares abiertos, para que las trazas puedan cambiar de herramienta.
- Clasifique el almacén de trazas como el sistema más sensible que consulta el agente, con acceso a través de sus controles de identidad actuales.
- Calibre los jueces LLM con una muestra de casos revisados por personas, y repita al cambiar de modelo.
- Fije presupuestos de coste por agente y por tarea, con alertas ante desviaciones y no solo sobre el total.
En resumen
Agent Observability es otra señal de que operar IA en producción se está convirtiendo en una disciplina propia. El uptime es necesario y ya no basta. Los equipos que puedan decir, por tarea, qué hizo el agente, si acertó y cuánto costó serán los que puedan escalarlo. La lista completa de controles está en nuestra guía del stack de 2026.