← Todos los insights

Análisis de noticiaEnfoque: España y Latinoamérica4 min de lectura

La IA privada se hace más pequeña. ¿Cuándo debe un agente empresarial ejecutarse en un equipo bajo la mesa?

El DGX Spark de 64 GB de NVIDIA llega de seis fabricantes desde el 23 de octubre, para agentes locales con modelos de hasta 100.000 millones de parámetros.

Escuche este artículo · 6 min

Narración completa del artículo, generada con IA.

Un pequeño bonsái en una maceta baja ante una pared gris, en duotono La Madre, junto a las palabras IA privada en la mesa
Foto: rawpixel (CC0)

Para la mayoría de las empresas, “IA privada” ha significado una de dos cosas: un endpoint de modelo dentro de su propio tenant en la nube o un rack de GPU en un centro de datos que controlan. NVIDIA está empujando una tercera opción hacia el centro de la conversación: un sistema de IA capaz que cabe encima de una mesa.

Qué anunció NVIDIA

El 2 de octubre, NVIDIA anunció una configuración de 64 GB de DGX Spark, desde 4.999 dólares en Estados Unidos, con el superchip GB10 Grace Blackwell y tarjeta de red ConnectX-7. Según NVIDIA, una unidad ejecuta modelos de hasta 100.000 millones de parámetros. Los sistemas los venderán Acer, ASUS, Dell, Gigabyte, HP y MSI a partir del 23 de octubre: están anunciados, todavía no se envían.

La segunda novedad es Sync Cluster Assistant. Dos unidades de 64 GB conectadas con un cable QSFP suman 128 GB de memoria y admiten modelos de hasta 200.000 millones de parámetros; el asistente detecta las unidades, valida la configuración y monta la red sin trabajo manual.

El software incluye el Agent Toolkit de NVIDIA, las bibliotecas CUDA-X AI y los modelos abiertos Nemotron, con soporte para Ollama, vLLM y PyTorch. NVIDIA lo presenta como un equipo para ejecutar agentes locales capaces, de forma privada y sin depender de la nube, de modo que los desarrolladores trabajen con datos propios en local antes de escalar.

NVIDIA no detalla la disponibilidad por país. Hasta que los fabricantes lo confirmen, el precio en euros en España y la llegada a los mercados latinoamericanos, con sus aranceles y tipos de cambio, son incógnitas.

La pregunta de verdad: ¿qué debe ejecutarse en local?

Dónde puede ejecutarse un agente empresarialOPERA EL PROVEEDOROPERA USTED01API pública de modelo02Endpoint en su tenantde nube03Clúster de IA en local04Sistema de sobremesacomo DGX SparkElástico, gestionado, el dato sale de su hardwareControlado, compartido, intensivo en capital
  1. API pública de modelo
  2. Endpoint en su tenant de nube
  3. Clúster de IA en local
  4. Sistema de sobremesa como DGX Spark
  • Opera el proveedor: API pública de modelo · Endpoint en su tenant de nube
  • Opera usted: Clúster de IA en local · Sistema de sobremesa como DGX Spark

Elástico, gestionado, el dato sale de su hardwareControlado, compartido, intensivo en capital

Cada paso hacia la derecha gana control y pierde elasticidad y gestión centralizada.

El hardware local no es una nube más barata. Es otro equilibrio. Estos factores deciden:

Datos que no deben salir. Código fuente sensible, resultados financieros antes de publicarse, datos clínicos, documentación de fusiones y adquisiciones. Si la respuesta de la política interna a “¿esto puede ir a un modelo alojado?” es no, o tarda meses, la inferencia local convierte un caso de uso bloqueado en posible. Con datos personales, además, el análisis del RGPD se simplifica: sin envío a un proveedor fuera del Espacio Económico Europeo, no hay transferencia internacional que justificar. Es la lógica de custodia que describimos al hablar de la soberanía que llega al centro de datos, ahora a la escala de un equipo.

Entornos desconectados o limitados. Plantas, laboratorios, explotaciones mineras y emplazamientos remotos con conectividad irregular, o redes aisladas, necesitan inferencia que no dependa de un viaje de ida y vuelta a la nube. En la minería chilena o peruana, por ejemplo, ese es un requisito operativo, no una preferencia.

Desarrollo con datos reales. El propio argumento de NVIDIA es el desarrollo: construir y probar un agente con datos propios en local y decidir después dónde se ejecuta en producción. Tiene sentido, y acorta la revisión de seguridad de un prototipo.

Techo de tamaño de modelo. Cien mil millones de parámetros en una unidad, doscientos mil en dos, cubren modelos abiertos capaces, pero no los mayores modelos de frontera. Algunas tareas serán sencillamente mejores en un modelo de frontera alojado. La lógica de la guía de GPT-6 de enrutar por tarea vale aquí: local para los pasos que deben quedarse en privado, alojado para los que exigen más capacidad, si la política lo permite.

Los costes que no aparecen en la etiqueta

Gestión. Un equipo bajo la mesa es un servidor sin gestionar, salvo que alguien decida lo contrario. Necesita inventario de activos, actualización de sistema y controladores, cifrado de disco, protección de endpoint, copia de seguridad de lo importante y un proceso de baja para los datos que contiene.

Cadena de suministro de modelos. Ejecutar en local significa elegir y actualizar los modelos abiertos. Alguien tiene que verificar su origen, controlar versiones y repetir las evaluaciones con cada actualización, la misma disciplina que exige IBM Bob autoalojado.

Control de acceso. En la nube, la identidad y los registros vienen con el endpoint. En local hay que decidir quién usa el sistema y cómo se registran prompts, respuestas y acciones del agente.

Uso. Un sistema de sobremesa que usa una persona unas horas al día sale caro por token frente a un endpoint compartido. Se justifica por privacidad, latencia o disponibilidad, no por coste unitario.

Qué hacer ahora

  1. Liste los casos de uso bloqueados hoy por la política de datos, no por la tecnología. Son los candidatos a inferencia local.
  2. Trate los sistemas de IA locales como servidores en sus procesos de activos y seguridad desde el día en que llegan.
  3. Decida el gobierno de los modelos antes de comprar: qué modelos abiertos se permiten, quién aprueba las actualizaciones, cómo se repiten las evaluaciones.
  4. Empiece por el desarrollo, como sugiere NVIDIA, y deje por escrito dónde se ejecutará cada agente en producción.
  5. Compare el coste total por tarea útil, con el tiempo de gestión y, fuera de Estados Unidos, la importación y el tipo de cambio, frente a un endpoint privado en la nube.

En resumen

La elección de arquitectura ya no es nube o centro de datos. Hay una opción pequeña, capaz y privada en medio, y sirve para un conjunto concreto de problemas: datos que no pueden salir, lugares que no pueden depender de la conexión y desarrollo con datos reales. Usada para eso, desbloquea trabajo. Tratada como un capricho, se convierte en el próximo servidor sin dueño con datos sensibles dentro.

¿Tiene un caso de uso de IA detenido entre el prototipo y la producción?

Cuéntenos qué quiere poner en marcha. Le respondemos con próximos pasos honestos.

Conversemos sobre un caso de uso