Para agentes de longa duração, o limite útil é o ambiente, não o número de passos. A Jump Trading mostra como
A Jump Trading deixa agentes GPT-6 Astra rodarem longos ciclos de pesquisa quantitativa por conta própria, em ambiente monitorado, com critérios humanos e revisão antes de qualquer sinal.
Ouça este artigo · 4 min
Narração completa do artigo, gerada por IA.

Um dos usuários mais exigentes e regulados de agentes de IA não os controla encurtando as execuções. Ele os deixa rodar por muito tempo, e controla onde eles rodam.
Essa é a lição de um estudo de caso que a OpenAI publicou em 6 de outubro sobre a Jump Trading, uma firma de trading quantitativo que constrói modelos preditivos a partir de dados de mercado, notícias, eventos e dados alternativos.
O problema: pesquisa não cabe em uma coleira curta
A maneira usual de manter um agente seguro é uma coleira curta: poucos passos, aprovações frequentes, tarefas estreitas. Isso funciona para um bot de suporte. Falha para pesquisa, onde o valor vem de seguir um fio por muito tempo e mudar de direção quando a evidência diz para fazê-lo. Um agente que para para aprovação a cada poucos passos é apenas um analista mais lento.
Lucas Baker, head de pesquisa e desenvolvimento de LLM da Jump, descreve agentes rodando GPT-6 Astra que agora assumem estudos quantitativos, não apenas tarefas de codificação.
A arquitetura: pessoas desenham a caixa, agentes trabalham dentro dela
Como a Jump descreve:
- pessoas definem o problema, o ambiente e os critérios de avaliação antes de o agente começar;
- agentes analisam seus próprios achados, julgam-nos segundo esses critérios e redirecionam o trabalho sem uma pessoa revisando cada rodada;
- as execuções mais longas ainda têm check-ins humanos regulares sobre dados, runtime, o que conta como importante, e resultados intermediários.
O ambiente é a fronteira. Um agente dentro de um sandbox de pesquisa monitorado, com dados e computação definidos, pode rodar por muito tempo porque suas ações não podem alcançar nada que importe sem passar por um portão. Autonomia dentro da caixa é barata; cruzar sua borda é caro.
Os critérios de avaliação fazem o trabalho que a aprovação passo a passo costumava fazer. Escrever como é um bom resultado antes da execução permite que o agente julgue seu próprio progresso e que as pessoas revisem resultados em vez de movimentos. É a disciplina por trás do nosso argumento de que em IA regulada, o modelo nunca avalia seu próprio trabalho: os critérios vêm de fora do agente.
- Pessoas definem problema, dados e critérios
- Agentes pesquisam, avaliam e redirecionam
- Check-ins humanos periódicos
- Portão de aceitação: mesma revisão de qualquer sinal
- Workflows de trading em produção
- Ambiente de pesquisa monitorado: Pessoas definem problema, dados e critérios · Agentes pesquisam, avaliam e redirecionam · Check-ins humanos periódicos
Direção humanaAutonomia do agente
Os controles: um portão antigo, não um novo
A Jump lista suas medidas de segurança como design de sistema: fronteiras, restrições, capacidade de direcionamento, observabilidade e revisão humana de mudanças. A decisiva é o portão de aceitação. Sinais produzidos por agentes são delimitados e revisados como qualquer outro sinal, tratados como informativos mas possivelmente errados, antes de chegarem aos workflows de trading. A firma não inventou um novo controle para agentes; ela encaminhou a saída do agente para um que já confiava.
Nada no estudo de caso descreve agentes executando trades. Os agentes fazem pesquisa; pessoas decidem o que chega à produção. Os efeitos de produtividade descritos são relato da própria Jump e da OpenAI.
A lição transferível
Qualquer time que queira agentes fazendo análise em vez de responder perguntas enfrenta a mesma escolha entre aprovações frequentes e fronteiras desenhadas. As peças se transferem diretamente: um ambiente de pesquisa com suas próprias cópias de dados, orçamento de computação e logging, e nenhum caminho para produção; critérios escritos antes da execução; check-ins sobre direção em vez de cada passo; e saída do agente encaminhada pelo processo de aceitação que já existe, seja validação de modelo, um comitê de mudanças ou um comitê de crédito.
A partir daí, a autonomia pode ser conquistada em vez de configurada: uma vez que os resultados de um agente passam consistentemente pelo portão, o ambiente pode ser ampliado, uma fronteira de cada vez. Coleiras curtas mantêm os agentes seguros e em grande parte inúteis para problemas difíceis. A fronteira que importa é a borda do ambiente.