← Todos os insights

Análise de casoRecorte: Brasil3 min de leitura

Para agentes de longa duração, o limite útil é o ambiente, não o número de passos. A Jump Trading mostra como

A Jump Trading deixa agentes GPT-6 Astra rodarem longos ciclos de pesquisa quantitativa por conta própria, em ambiente monitorado, com critérios humanos e revisão antes de qualquer sinal.

Ouça este artigo · 4 min

Narração completa do artigo, gerada por IA.

Uma piscina vista de cima com raias longas e bem marcadas, em duotone La Madre, ao lado das palavras Raias bem definidas
Foto: rawpixel (CC0)

Um dos usuários mais exigentes e regulados de agentes de IA não os controla encurtando as execuções. Ele os deixa rodar por muito tempo, e controla onde eles rodam.

Essa é a lição de um estudo de caso que a OpenAI publicou em 6 de outubro sobre a Jump Trading, uma firma de trading quantitativo que constrói modelos preditivos a partir de dados de mercado, notícias, eventos e dados alternativos.

O problema: pesquisa não cabe em uma coleira curta

A maneira usual de manter um agente seguro é uma coleira curta: poucos passos, aprovações frequentes, tarefas estreitas. Isso funciona para um bot de suporte. Falha para pesquisa, onde o valor vem de seguir um fio por muito tempo e mudar de direção quando a evidência diz para fazê-lo. Um agente que para para aprovação a cada poucos passos é apenas um analista mais lento.

Lucas Baker, head de pesquisa e desenvolvimento de LLM da Jump, descreve agentes rodando GPT-6 Astra que agora assumem estudos quantitativos, não apenas tarefas de codificação.

A arquitetura: pessoas desenham a caixa, agentes trabalham dentro dela

Como a Jump descreve:

  • pessoas definem o problema, o ambiente e os critérios de avaliação antes de o agente começar;
  • agentes analisam seus próprios achados, julgam-nos segundo esses critérios e redirecionam o trabalho sem uma pessoa revisando cada rodada;
  • as execuções mais longas ainda têm check-ins humanos regulares sobre dados, runtime, o que conta como importante, e resultados intermediários.

O ambiente é a fronteira. Um agente dentro de um sandbox de pesquisa monitorado, com dados e computação definidos, pode rodar por muito tempo porque suas ações não podem alcançar nada que importe sem passar por um portão. Autonomia dentro da caixa é barata; cruzar sua borda é caro.

Os critérios de avaliação fazem o trabalho que a aprovação passo a passo costumava fazer. Escrever como é um bom resultado antes da execução permite que o agente julgue seu próprio progresso e que as pessoas revisem resultados em vez de movimentos. É a disciplina por trás do nosso argumento de que em IA regulada, o modelo nunca avalia seu próprio trabalho: os critérios vêm de fora do agente.

Autonomia de longa duração dentro de uma fronteira desenhadaAMBIENTE DE PESQUISA MONITORADO01Pessoasdefinemproblema,dados ecritérios02Agentespesquisam,avaliam eredirecionam03Check-inshumanosperiódicos04Portão deaceitação:mesma revisãode qualquersinal05Workflows detrading emproduçãoDireção humanaAutonomia do agente
  1. Pessoas definem problema, dados e critérios
  2. Agentes pesquisam, avaliam e redirecionam
  3. Check-ins humanos periódicos
  4. Portão de aceitação: mesma revisão de qualquer sinal
  5. Workflows de trading em produção
  • Ambiente de pesquisa monitorado: Pessoas definem problema, dados e critérios · Agentes pesquisam, avaliam e redirecionam · Check-ins humanos periódicos

Direção humanaAutonomia do agente

Dentro do ambiente o agente roda livremente. Nada sai dele sem passar pela revisão que um resultado humano enfrentaria.

Os controles: um portão antigo, não um novo

A Jump lista suas medidas de segurança como design de sistema: fronteiras, restrições, capacidade de direcionamento, observabilidade e revisão humana de mudanças. A decisiva é o portão de aceitação. Sinais produzidos por agentes são delimitados e revisados como qualquer outro sinal, tratados como informativos mas possivelmente errados, antes de chegarem aos workflows de trading. A firma não inventou um novo controle para agentes; ela encaminhou a saída do agente para um que já confiava.

Nada no estudo de caso descreve agentes executando trades. Os agentes fazem pesquisa; pessoas decidem o que chega à produção. Os efeitos de produtividade descritos são relato da própria Jump e da OpenAI.

A lição transferível

Qualquer time que queira agentes fazendo análise em vez de responder perguntas enfrenta a mesma escolha entre aprovações frequentes e fronteiras desenhadas. As peças se transferem diretamente: um ambiente de pesquisa com suas próprias cópias de dados, orçamento de computação e logging, e nenhum caminho para produção; critérios escritos antes da execução; check-ins sobre direção em vez de cada passo; e saída do agente encaminhada pelo processo de aceitação que já existe, seja validação de modelo, um comitê de mudanças ou um comitê de crédito.

A partir daí, a autonomia pode ser conquistada em vez de configurada: uma vez que os resultados de um agente passam consistentemente pelo portão, o ambiente pode ser ampliado, uma fronteira de cada vez. Coleiras curtas mantêm os agentes seguros e em grande parte inúteis para problemas difíceis. A fronteira que importa é a borda do ambiente.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso