← Todos os insights

Análise de notíciaRecorte: Brasil3 min de leitura

Nem toda decisão de agente precisa de um modelo generativo. A Decisions API precifica a camada de decisão

A OpenAI abriu sua Decisions API em beta público: o GPT-6 Luna retorna probabilidades, escolhas ou scores em vez de texto, cobrado apenas na entrada.

Ouça este artigo · 4 min

Narração completa do artigo, gerada por IA.

Sinais ferroviários acima dos trilhos em uma estação em um dia chuvoso, em duotone La Madre, ao lado das palavras Decidir antes de gerar
Foto: rawpixel (CC0)

No início desta semana, a Cloudflare lançou modelos de decisão abertos e defendemos que um agente não deve perguntar a um modelo de fronteira cada pequena questão. Em 6 de outubro, a OpenAI fez o mesmo argumento arquitetural com seu próprio produto e deu a ele uma lista de preços.

Coloque os dois lado a lado e a camada de decisão deixa de parecer um padrão e começa a parecer uma categoria de produto.

Mesma ideia, termos diferentes

A Decisions API da OpenAI está disponível para todos os desenvolvedores em beta público. Ela roda no GPT-6 Luna, aceita entradas de texto e imagem e retorna uma de três saídas estruturadas em vez de texto livre: predicados, uma probabilidade de que uma afirmação seja verdadeira; escolhas, uma seleção entre opções que você define, com scores de confiança; e scores, um número em um intervalo que você define.

Os modelos Clef da Cloudflare respondem aos mesmos tipos de perguntas. A diferença está na custódia e na cobrança. Os pesos do Clef são abertos e podem rodar em qualquer lugar; o modelo da OpenAI é uma API hospedada. A OpenAI diz que as decisões são até 10 vezes mais rápidas do que chamar o GPT-6 Luna pela Responses API, e as precifica a $0.10 por milhão de tokens de entrada, sem cobrança por tokens de saída ou por leituras e escritas de cache. Tanto a velocidade quanto o preço são números da OpenAI para um beta, e o anúncio não menciona disponibilidade por meio de parceiros de nuvem.

A lista de preços muda o design

Você paga pelo contexto, não pelas respostas. Com a saída gratuita e a entrada cobrada, o custo de uma decisão depende quase inteiramente de quanto você envia. Uma verificação de roteamento que envia um histórico de conversa inteiro custa muito mais do que uma que envia a última mensagem e um breve resumo de estado. Disciplina de contexto se torna disciplina de custo.

A camada de decisão ganha sua própria linha de orçamento. Roteamento, escalonamento, moderação e classificação de próxima etapa geralmente compõem a maior parte das chamadas de um agente. Movê-las para um endpoint mais barato e mais rápido muda a economia que descrevemos em nossa análise de roteamento por tarefa no guia do GPT-6 da OpenAI, e torna visível qual parte do gasto de um agente é raciocínio e qual é triagem.

A custódia se torna uma escolha real. Para decisões que tocam dados regulados, pesos abertos que você hospeda e uma API que você chama são perfis de risco diferentes. Essa diferença pode importar mais do que velocidade ou preço.

O que uma API de decisão ainda não decide

Uma probabilidade não é uma permissão. Um “aprovar” de alta confiança ainda passa por uma verificação de política determinística que você possui, com limiares em configuração e uma faixa que vai para uma pessoa.

Calibração precisa de prova no seu próprio tráfego: um 0.9 deve estar certo cerca de nove em cada dez vezes. Primeiros usuários do beta público no fórum da OpenAI já estão comparando quão bem os formatos se comportam, um lembrete para medir antes de definir limiares.

E um beta é um beta. Limites de taxa, preços e comportamento podem mudar antes da disponibilidade geral (GA). A maneira mais segura de adotar qualquer um desses modelos, da OpenAI, da Cloudflare ou o seu próprio, é atrás de uma única interface interna, para que a camada de decisão possa trocar de fornecedor sem que o agente perceba.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso