Gasto com IA agora precisa de guardrails, como as permissões. As plataformas já entregam, e os CFOs querem voz
A Snowflake liberou cotas de IA por usuário, o Google criou tetos de gasto e alertas para agentes, e a IBM aponta CFOs mais presentes na estratégia de IA. Como desenhar controles de custo.
Ouça este artigo · 6 min
Narração completa do artigo, gerada por IA.

Um assistente de chat tem um custo relativamente previsível: a pessoa digita, o modelo responde. Um agente, não. Ele planeja, tenta de novo, chama ferramentas, lê documentos e repete o ciclo até decidir que terminou. Multiplique isso por todos os funcionários com acesso, ou por milhares de execuções automáticas por dia, e o gasto com IA deixa de ser uma linha do orçamento e vira uma variável que pode mudar de um dia para o outro.
Três anúncios das últimas semanas mostram o mercado reagindo por dois lados: as plataformas estão transformando controle de custo em funcionalidade de produto, e os líderes financeiros estão assumindo um papel maior nas decisões de IA.
As plataformas entregam controles de gasto
A Snowflake liberou em disponibilidade geral as cotas de IA por usuário em setembro. O administrador define limites diários e mensais por usuário, separadamente para cada serviço controlado: as funções de IA do Cortex, os Cortex Agents, o assistente para desenvolvedores e o processamento dos warehouses. Quando o usuário atinge o limite, segundo a Snowflake, o acesso àquele serviço específico fica pausado até o próximo ciclo, sem afetar outros serviços nem outros usuários. Os limites podem ser definidos em SQL, na interface Snowsight ou em linguagem natural.
O Google Cloud lançou um conjunto de controles de FinOps para agentes em agosto. Entre eles: tetos de gasto por projeto que pausam temporariamente as chamadas de API do agente quando o limite mensal é atingido, com alertas em 50%, 80% e 100%; detecção de anomalias que aponta gastos fora do padrão e os três SKUs que mais pesam; cotas compartilhadas com excedente controlado pelo administrador para a plataforma de desenvolvimento Antigravity; e uma opção de execução adiada, anunciada como “em breve”, que roda trabalhos elegíveis fora do horário de pico por até metade do custo de inferência.
O padrão: limites de gasto estão sendo desenhados como permissões, com escopo por usuário, projeto ou serviço, e aplicados pela plataforma.
O financeiro chega mais perto da IA
Em 30 de setembro, o Institute for Business Value da IBM publicou um estudo com 1.500 CFOs de 33 geografias e 26 setores, entrevistados entre fevereiro e abril de 2026. Segundo a IBM, 62% relatam um papel maior na liderança da estratégia de tecnologia ou de IA, e 56% dizem ter mais autoridade sobre gestão de portfólio e realocação de capital. Só 6% dizem que a área financeira chegou a um estágio pronto para a transformação.
São resultados de pesquisa da IBM, não medições independentes. Mas a direção bate com o que as plataformas estão entregando: quando o custo de IA fica variável e relevante, quem é dono do orçamento quer visibilidade e controle, e não uma surpresa no fim do mês.
- Cotas por usuário
- Tetos por projeto
- Alertas de anomalia
- Gasto atribuído por agente e tarefa
- Execução fora do pico para o que pode esperar
- Descontos por compromisso
- Limitar: Cotas por usuário · Tetos por projeto
- Detectar: Alertas de anomalia · Gasto atribuído por agente e tarefa
- Otimizar: Execução fora do pico para o que pode esperar · Descontos por compromisso
Podem pausar o trabalho ao serem atingidos: desenhe por carga de trabalhoReduzem o custo unitário sem mudar o comportamento
A pergunta que ninguém faz: o que acontece no limite?
Um limite rígido é proteção para um funcionário testando um assistente. Para um agente que atende clientes, é uma indisponibilidade. Tanto a Snowflake quanto o Google descrevem a pausa do trabalho quando o limite é atingido. É o padrão certo para exploração e o errado para um fluxo em produção do qual clientes dependem.
Por isso, guardrails de custo pedem a mesma disciplina de desenho dos controles de segurança:
Classifique as cargas de trabalho por criticidade. Exploração e produtividade individual recebem limites rígidos por usuário. Agentes em produção recebem orçamento com alertas, excedente controlado e um responsável nomeado que decide o próximo passo.
Atribua o gasto ao comportamento. O total do projeto diz que o orçamento estourou. O custo por agente, por tarefa e por modelo diz por quê. Isso exige o tipo de tracing que discutimos na nossa análise sobre observabilidade de agentes.
Separe o que pode esperar. Enriquecimento em lote, análises noturnas e geração de relatórios muitas vezes podem rodar fora do pico, mais barato. Trabalho interativo, não. Decidir o que é o quê é escolha de arquitetura, não configuração de cobrança.
Dê ao financeiro uma visão útil. Se os CFOs estão assumindo decisões de portfólio de IA, precisam de dados de gasto organizados por caso de uso e resultado, e não por SKU.
O que isso significa no Brasil
Há um fator extra por aqui: boa parte do consumo de IA em nuvem é cotada em dólar, enquanto o orçamento das empresas é em reais. Um agente que dobra o número de chamadas e uma alta do câmbio no mesmo trimestre se somam. Isso torna ainda mais importante definir orçamentos por caso de uso com folga para o câmbio, acompanhar a projeção de gasto ao longo do mês, e não só no fechamento, e envolver o financeiro e a área de compras desde o desenho, inclusive na negociação de compromissos de consumo.
O que fazer agora
- Mapeie de onde o gasto com IA pode surgir: assistentes, agentes, funções de IA dentro de plataformas de dados, ferramentas de desenvolvimento.
- Ative limites por usuário para exploração em todas as plataformas que oferecem o recurso.
- Dê a cada agente em produção um orçamento, um alerta e um responsável, e combine antes o que acontece quando o limite for ultrapassado.
- Ligue a detecção de anomalias e direcione os alertas para o responsável, e não só para uma caixa compartilhada de FinOps.
- Reporte o gasto por caso de uso ao financeiro, junto com o valor esperado de cada um.
Em resumo
O custo de agentes de IA é variável por natureza. As plataformas já oferecem as alavancas: cotas, tetos, alertas e formas mais baratas de rodar o que pode esperar. Usá-las bem é uma decisão de modelo operacional: quais cargas podem ser pausadas, quem é dono de cada orçamento e como o financeiro enxerga valor. No nosso guia do stack de 2026, essa decisão pertence à camada que ninguém entrega: a responsabilidade operacional. E o custo costuma ser o que trava um programa que, no resto, está funcionando.