← Todos os insights

Análise de notíciaRecorte: Brasil4 min de leitura

Infraestrutura de IA privada passou a ser vendida pela carga de trabalho, não pela quantidade de GPUs

Lenovo e NVIDIA vendem capacidade de IA híbrida em níveis definidos por usuários, tokens por segundo e tamanho de modelo, entregues em 15 a 25 dias. Agentes mudam a conta.

Ouça este artigo · 6 min

Narração completa do artigo, gerada por IA.

Longas fileiras de caixas de papelão empilhadas num armazém, em duotone La Madre, ao lado das palavras Dimensionar a carga
Foto: U.S. Department of Agriculture (rawpixel, CC0)

Comprar infraestrutura de IA privada costumava parecer um projeto de supercomputação: arquitetos escolhendo GPUs, interconexão e storage, meses de desenho e um cluster que era grande demais no primeiro ano ou pequeno demais no segundo. A nova oferta da Lenovo se parece mais com comprar um nível de capacidade já validado.

O que a Lenovo anunciou

O Lenovo AI Express, desenvolvido com a NVIDIA como porta de entrada rápida para a Hybrid AI Factory da Lenovo, vem em três configurações predefinidas. A Lenovo descreve cada uma pela carga que pretende atender, antes da lista de peças:

Nível Carga descrita pela Lenovo Hardware Do pedido ao envio
Pequeno Inferência focada para dezenas de usuários a mais de 30 tokens por segundo, modelos de cerca de 7 a 70 bilhões de parâmetros ThinkSystem SR650a V4 com duas GPUs NVIDIA RTX PRO 6000 Blackwell Server Edition A partir de 15 dias úteis
Médio Inferência de maior vazão e IA agêntica para centenas de usuários a mais de 30 tokens por segundo, modelos de cerca de 70 a 400 bilhões ThinkSystem SR675 V3 com oito GPUs RTX PRO 6000 Blackwell Server Edition A partir de 20 dias úteis
Grande IA generativa em escala para milhares de usuários, modelos de até um trilhão de parâmetros ThinkSystem SR680a V4 com NVIDIA HGX B300 A partir de 25 dias úteis

As opções de software são o NVIDIA AI Enterprise ou o Red Hat AI Factory with NVIDIA, com Veeam Kasten para resiliência de dados. Os serviços incluem implantação, validação de ROI e otimização de GPU, além de um novo nível de suporte Premier Support Plus para servidores. Os prazos valem para configurações elegíveis depois da validação, e a Lenovo diz que a disponibilidade varia por região. Para o Brasil, prazo e elegibilidade precisam ser confirmados com a Lenovo ou seus parceiros, e o preço final passa por câmbio e tributação de importação.

A Lenovo também cita uma pesquisa própria com CIOs sobre retorno esperado da IA. É pesquisa de fornecedor e não deve ser lida como evidência independente.

Por que a unidade de compra importa

Descrever capacidade como “usuários, tokens por segundo e tamanho de modelo” é o caminho certo. É a linguagem da carga de trabalho, e obriga quem compra a responder as perguntas que definem se o sistema vai dar conta: quantas pessoas, com que rapidez precisam de resposta e de que tamanho de modelo a tarefa precisa.

Há um porém, e ele está crescendo: agentes quebram o número de “usuários”.

Dimensionar a partir do caso de uso, não da GPU01Caso de usoe meta delatência02Usuáriossimultâneosno pico03Chamadas aomodelo portarefa04Tokens porchamada,entrada esaída05Tamanho demodelonecessário06Nível decapacidade,comcrescimentoDados do negócioOnde os agentes multiplicam a carga
  1. Caso de uso e meta de latência
  2. Usuários simultâneos no pico
  3. Chamadas ao modelo por tarefa
  4. Tokens por chamada, entrada e saída
  5. Tamanho de modelo necessário
  6. Nível de capacidade, com crescimento

Dados do negócioOnde os agentes multiplicam a carga

Quem conversa com um assistente faz uma chamada por pergunta. Um agente pode fazer dezenas por tarefa, muitas vezes com contexto longo.

Uma pessoa conversando com um assistente gera uma chamada ao modelo por pergunta. Um agente executando uma tarefa planeja, chama ferramentas, busca, revisa e tenta de novo, o que pode significar dezenas de chamadas por tarefa, cada uma com contexto longo. Um nível dimensionado para “centenas de usuários” de chat pode atender bem menos usuários de um workflow agêntico. Agentes que rodam em segundo plano, sem ninguém esperando, somam carga que nenhuma contagem de usuários captura.

Por isso, o dimensionamento precisa começar um nível abaixo:

  • Chamadas por tarefa de cada agente, medidas num piloto, não estimadas.
  • Tokens por chamada, de entrada e de saída, incluindo o contexto recuperado e os resultados de ferramentas.
  • Concorrência de agentes, incluindo os agendados e os disparados por eventos.
  • Metas de latência por etapa, porque o fechamento noturno e a resposta ao cliente têm necessidades muito diferentes.
  • Mix de modelos. Se a maior parte das etapas pode usar um modelo menor e só algumas precisam de um grande, como sugere o argumento de rotear por tarefa, o nível necessário pode ser menor do que o maior modelo sugere.

Quando um nível empacotado faz sentido

Um nível validado com prazo curto serve a quem já decidiu que parte da inferência precisa rodar em infraestrutura própria, pelos motivos de custódia e soberania que discutimos na análise da IA soberana, e quer evitar um projeto de desenho sob medida. No Brasil, isso costuma coincidir com setores em que a LGPD e a supervisão setorial pesam, como bancos, saúde e governo. O AI Express fica um degrau acima da opção de mesa que a NVIDIA acabou de anunciar com o DGX Spark de 64 GB: compartilhado, de padrão data center, operado pelo time de TI.

Ele não elimina o trabalho de operação. Alguém continua atualizando o stack, gerindo modelos, acompanhando a utilização e planejando a expansão. Um nível empacotado torna a compra mais rápida; não torna a operação mais barata.

O que fazer agora

  1. Meça antes de comprar. Rode os agentes-alvo num piloto e registre chamadas por tarefa, tokens por chamada e latência por etapa.
  2. Traduza agentes em carga, não em usuários, e inclua os agentes de segundo plano.
  3. Dimensione pelo mix de modelos, não pelo maior modelo que você talvez queira um dia.
  4. Planeje o segundo ano: metas de utilização, caminho de crescimento entre níveis e quem decide sobre capacidade.
  5. Confirme elegibilidade e prazos no Brasil com a Lenovo ou seus parceiros; os 15 a 25 dias valem para configurações elegíveis.

Para fechar

O Lenovo AI Express é um sinal de que a infraestrutura de IA privada está virando produto comprado pela carga de trabalho. É um avanço. Vai acertar quem conhecer a própria carga em termos de agentes, chamadas, tokens e concorrência, antes de escolher o nível.

Tem um caso de uso de IA parado entre o protótipo e a produção?

Conte o que você quer colocar no ar. Respondemos com próximos passos honestos.

Converse sobre um caso de uso