No automatice el proceso antiguo. Chatham Financial rediseñó la validación en torno a evidencia y excepciones
Chatham Financial redujo una revisión de validación de unos 30 minutos a menos de 4 al preguntarse qué evidencia exige cada decisión, no dónde poner un agente. Su enrutamiento sigue esa lógica.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

La mayoría de los proyectos de IA empresarial empiezan con una pregunta que suena práctica: ¿dónde podemos poner un agente? Chatham Financial, una firma estadounidense de asesoramiento en mercados de capitales, empieza por otro sitio. Su consejero delegado, Matt Henry, describe el enfoque como partir “del resultado que queremos” e identificar “dónde importa el criterio” antes de decidir cómo usar la IA.
OpenAI publicó el caso el 2 de octubre. Todas las cifras que siguen las facilitan Chatham y OpenAI.
Qué ha construido Chatham
Chatham usa Codex, de OpenAI, para construir software interno y para clientes, y GPT-5.6 en sus funciones de IA, en tres frentes:
- Process Zero, su servicio de rediseño de procesos. Para cada proceso, Chatham identifica las entradas y la evidencia mínimas necesarias, determina dónde es imprescindible el criterio humano y decide cómo deben apoyar el trabajo la IA y las herramientas construidas con IA.
- Validación de operaciones, uno de los primeros resultados de Process Zero. El equipo de Controles e Integridad de Datos comprueba que cada registro del sistema coincide con lo que autorizó el cliente y con lo que se ejecutó. La nueva aplicación reúne la evidencia de la operación, compara los términos clave y señala las discrepancias para su revisión. En la medición inicial, la revisión bajó de unos 30 minutos a menos de 4.
- Chatham Onyx, su sistema operativo de mercados de capitales, donde clientes y asesores trabajan sobre datos conectados y gobernados y usan IA “sin perder la trazabilidad hasta la fuente”.
Dos detalles merecen tanta atención como el ahorro de tiempo. Chatham afirma que está comparando los resultados de la aplicación con los de revisores experimentados, sobre operaciones reales, antes de ampliar la automatización. Y la aplicación no decide si la operación es correcta. Reúne la evidencia y dirige a una persona hacia las excepciones.
Primero la evidencia, después la automatización
Es un objetivo de diseño distinto de “un agente que valida operaciones”. El trabajo se separa entre lo que se puede comprobar y lo que hay que juzgar:
- Definir el resultado: cada registro coincide con la autorización y con la ejecución.
- Enumerar la evidencia mínima: confirmaciones, instrucciones del cliente, datos de ejecución.
- Automatizar la recogida y la comparación: buscar documentos y casar términos es donde el software es rápido y constante.
- Enviar las excepciones a expertos: una discrepancia es una cuestión de criterio, así que va a una persona con la evidencia adjunta.
- Medir frente al método anterior antes de ampliar el alcance.
- Resultado que proteger
- Evidencia mínima necesaria
- La IA recoge y compara
- Discrepancias señaladas
- El experto decide las excepciones
- Comparación con revisores antes de escalar
- Diseñar: Resultado que proteger · Evidencia mínima necesaria
- Automatizar: La IA recoge y compara · Discrepancias señaladas
- Juzgar y demostrar: El experto decide las excepciones · Comparación con revisores antes de escalar
Lo define el negocioLo hace el software
El patrón encaja con lo que llamamos trabajo listo para agentes en nuestro marco para encontrar dónde encaja un agente: un proceso que ya existe, un registro claro de lo correcto y lo incorrecto y un paso de revisión que las personas ya hacen.
El enrutamiento forma parte del mismo diseño
El caso muestra también enrutamiento de modelos en una empresa regulada. Onyx usa GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.4 y GPT-4.1: los análisis sencillos y las pruebas fuera de producción van a modelos más baratos, y GPT-5.6 se reserva para las tareas complejas donde la precisión vale más. En Chatham Vibes, la plataforma interna donde los empleados construyen sus propias aplicaciones, las funciones de IA usan GPT-5.6 Terra por defecto, con Sol como mejora opcional configurada por aplicación.
Esa regla de modelo por defecto más mejora explícita es una decisión de gobernanza tanto como de costes. Mantiene las aplicaciones creadas por los propios empleados en un modelo conocido y más barato, salvo que alguien pida más de forma deliberada, y deja la mejora visible en la configuración. Es la forma práctica del argumento de nuestro análisis del enrutamiento por tarea en la guía de GPT-6.
Por qué importa en el sector financiero europeo
El paralelo europeo es directo. EMIR obliga a notificar los derivados a registros de operaciones, y la calidad y la conciliación de esos datos están bajo la lupa de los supervisores, la CNMV incluida. Comprobar que lo notificado coincide con lo contratado y confirmado es trabajo diario de back office en bancos y gestoras españolas. Es justo el tipo de proceso donde la recogida y la comparación de evidencia se pueden automatizar, mientras la discrepancia sigue siendo decisión de alguien.
La comparación con revisores experimentados tampoco es solo una buena práctica. Una herramienta nueva que interviene en un control debe demostrar que funciona antes de sustituir trabajo humano, y la forma más defendible ante un supervisor es ejecutarla en paralelo con especialistas, sobre casos reales, y registrar los resultados. Eso es lo que permite ampliar la automatización después sin adivinar.
La trazabilidad es la otra mitad. Un sistema que compara términos y apunta al documento de origen deja un registro de auditoría por construcción. Un sistema que responde en prosa “esta operación es correcta” no lo deja.
Qué hacer ahora
- Elija un proceso de control donde las personas ya contrasten registros con sus fuentes.
- Escriba el resultado y la evidencia mínima antes de elegir modelo o herramienta.
- Automatice primero la recogida y la comparación; deje el criterio sobre las excepciones a las personas.
- Ejecute en paralelo con revisores experimentados sobre casos reales y registre acuerdos y desacuerdos.
- Fije un modelo por defecto y una vía explícita de mejora para quienes construyen internamente, y registre las mejoras.
- Amplíe el alcance solo con resultados medidos, un tipo de operación o de documento cada vez.
En resumen
La reducción de 30 a 4 minutos acaparará los titulares, y es una cifra inicial comunicada por la propia empresa. La lección más duradera es el orden de los pasos: definir el resultado, nombrar la evidencia, automatizar la recopilación, dejar el criterio donde debe estar y que el acuerdo medido con los expertos decida hasta dónde llega la automatización.