A IA privada está ficando menor. Quando um agente corporativo deve rodar numa máquina embaixo da mesa?
O DGX Spark de 64 GB da NVIDIA chega por seis fabricantes a partir de 23 de outubro, para agentes locais com modelos de até 100 bilhões de parâmetros. Um critério para decidir o que roda localmente.
Ouça este artigo · 6 min
Narração completa do artigo, gerada por IA.

Para a maioria das empresas, “IA privada” tem significado uma de duas coisas: um endpoint de modelo dentro do próprio tenant de nuvem ou um rack de GPUs num data center sob seu controle. A NVIDIA está empurrando uma terceira opção para o centro da conversa: um sistema de IA capaz que cabe em cima da mesa.
O que a NVIDIA anunciou
Em 2 de outubro, a NVIDIA anunciou uma configuração de 64 GB do DGX Spark, a partir de US$ 4.999 nos Estados Unidos, com o superchip GB10 Grace Blackwell e placa de rede ConnectX-7. Segundo a NVIDIA, uma unidade roda modelos de até 100 bilhões de parâmetros. Os sistemas serão vendidos por Acer, ASUS, Dell, Gigabyte, HP e MSI a partir de 23 de outubro: estão anunciados, ainda não chegaram.
A segunda novidade é o Sync Cluster Assistant. Duas unidades de 64 GB ligadas por um cabo QSFP somam 128 GB de memória e suportam modelos de até 200 bilhões de parâmetros; o assistente detecta as unidades, valida a configuração e monta a rede sem trabalho manual.
O software inclui o Agent Toolkit da NVIDIA, as bibliotecas CUDA-X AI e os modelos abertos Nemotron, com suporte a Ollama, vLLM e PyTorch. A NVIDIA posiciona o equipamento para rodar agentes locais capazes, de forma privada e sem depender da nuvem, para que desenvolvedores trabalhem com dados proprietários localmente antes de escalar.
O texto da NVIDIA não informa disponibilidade por país nem preço no Brasil. Até que os fabricantes confirmem, vale tratar a chegada ao mercado brasileiro, e o preço depois de câmbio e impostos de importação, como incógnitas.
A pergunta de verdade: o que deve rodar localmente?
- API pública de modelo
- Endpoint no seu tenant de nuvem
- Cluster de IA on-premises
- Sistema de mesa como o DGX Spark
- O provedor opera: API pública de modelo · Endpoint no seu tenant de nuvem
- Você opera: Cluster de IA on-premises · Sistema de mesa como o DGX Spark
Elástico, gerenciado, o dado sai do seu hardwareControlado, compartilhado, intensivo em capital
Hardware local não é uma nuvem mais barata. É outra troca. Estes fatores decidem:
Dado que não deve sair. Código-fonte sensível, resultados financeiros antes da divulgação, dados clínicos, material de fusões e aquisições. Se a resposta da política interna para “isso pode ir para um modelo hospedado?” é não, ou leva meses, a inferência local transforma um caso de uso travado em possível. Para dados pessoais, a conta da LGPD também muda: sem envio a um provedor no exterior, não há transferência internacional para justificar. É a lógica de custódia que descrevemos ao falar da soberania que chega ao data center, agora na escala de um time.
Ambientes desconectados ou limitados. Fábricas, laboratórios, plataformas offshore e operações no interior com conectividade instável, ou redes isoladas, precisam de inferência que não dependa de ida e volta à nuvem.
Desenvolvimento com dado real. O próprio argumento da NVIDIA é o desenvolvimento: construir e testar um agente com dados proprietários localmente e depois decidir onde ele roda em produção. Faz sentido, e encurta a revisão de segurança de um protótipo.
Teto de tamanho de modelo. Cem bilhões de parâmetros numa unidade, duzentos em duas, cobrem modelos abertos capazes, mas não os maiores modelos de fronteira. Algumas tarefas vão ser simplesmente melhores num modelo de fronteira hospedado. A lógica do guia do GPT-6 de rotear por tarefa vale aqui: local para as etapas que precisam ficar privadas, hospedado para as que exigem mais capacidade, se a política permitir.
Os custos que não aparecem na etiqueta
Gestão. Uma máquina embaixo da mesa é um servidor sem gestão, a menos que alguém decida o contrário. Precisa de inventário de ativos, atualização de sistema e drivers, criptografia de disco, proteção de endpoint, backup do que importa e um processo de descarte para os dados que ficaram nela.
Cadeia de suprimentos de modelos. Rodar localmente significa escolher e atualizar os modelos abertos. Alguém precisa verificar a origem dos modelos, controlar versões e refazer as avaliações a cada atualização, a mesma disciplina que o IBM Bob auto-hospedado exige.
Controle de acesso. Na nuvem, identidade e logs vêm com o endpoint. Localmente, é preciso decidir quem usa o sistema e como prompts, respostas e ações do agente ficam registrados.
Uso. Um sistema de mesa usado por uma pessoa algumas horas por dia sai caro por token comparado a um endpoint compartilhado. Ele se paga por privacidade, latência ou disponibilidade, não por custo unitário.
O que fazer agora
- Liste os casos de uso travados hoje por política de dados, não por tecnologia. São os candidatos à inferência local.
- Trate sistemas de IA locais como servidores nos processos de ativos e segurança, desde o dia em que chegam.
- Defina a governança de modelos antes da compra: quais modelos abertos são permitidos, quem aprova atualizações, como as avaliações são refeitas.
- Comece pelo desenvolvimento, como sugere a NVIDIA, e registre por escrito onde cada agente vai rodar em produção.
- Compare o custo total por tarefa útil, incluindo tempo de gestão, câmbio e importação, com um endpoint privado na nuvem.
Para fechar
A escolha de arquitetura deixou de ser nuvem ou data center. Existe agora uma opção pequena, capaz e privada no meio do caminho, e ela serve a um conjunto específico de problemas: dado que não pode sair, lugar que não pode depender de conexão e desenvolvimento com dado real. Usada para isso, destrava trabalho. Tratada como novidade, vira o próximo servidor sem dono guardando dado sensível.