Local o nube ya no es la pregunta. Windows y NVIDIA convierten la ubicación en política de enrutamiento
Microsoft construye Windows en torno a la inteligencia híbrida y NVIDIA pone grandes modelos locales en los escritorios. La decisión clave es quién escribe las reglas para enrutar cada tarea.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

Durante dos años, la pregunta sobre la IA empresarial en el escritorio fue binaria: enviar el trabajo a un modelo en la nube o prescindir de ella. El 7 de octubre, Microsoft y NVIDIA presentaron un argumento coordinado de que la respuesta ahora es “ambos, por tarea”, y que el sistema operativo debería ayudar a decidir.
Eso cambia la decisión real. Ya no es dónde se ejecuta su IA. Es quién escribe la regla que envía cada tarea a algún lugar.
Qué se anunció
Microsoft describió Windows como una plataforma para lo que llama inteligencia híbrida: los agentes se ejecutan localmente cuando tiene sentido y llegan a la nube cuando lo necesitan. Las piezas, con su estado:
- GitHub HydraFusion enruta cada tarea al modelo adecuado, en la nube o en el dispositivo. Microsoft lo lista como una vista previa experimental más adelante en octubre.
- Windows ML ejecuta modelos locales en la GPU, NPU o CPU.
- Microsoft Execution Containers, disponible general, establece a qué archivos y redes pueden acceder los agentes locales. Los cubrimos en nuestro análisis sobre el confinamiento de agentes en Windows.
- Se espera que las características híbridas en Copilot se desplieguen en los próximos meses, de forma opcional (opt-in), comenzando en mercados selectos.
Microsoft también dice que el 40% de los portátiles empresariales ahora son PCs Copilot+ y que esos PCs ejecutan alrededor de 2 billones de inferencias locales al mes. Esas son cifras de la propia Microsoft.
NVIDIA presentó RTX Spark, que combina una GPU Blackwell RTX con hasta 6.144 núcleos, una CPU Grace con hasta 20 núcleos y hasta 128GB de memoria unificada, con una calificación de un petaflop de rendimiento FP4. Los portátiles de Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI y Gigabyte abrieron para reserva el 7 de octubre, con envío a partir del 16 de octubre; los ordenadores de sobremesa compactos llegan en noviembre. El Surface RTX Spark Dev Box de Microsoft se envía en noviembre, solo en EE. UU.. Ninguna de las dos compañías enumeró la disponibilidad por país para el resto.
NVIDIA también mostró DGX Station for Windows como una vista previa: 748GB de memoria coherente y hasta 20 petaflops de cómputo FP4, que NVIDIA dice que es suficiente para modelos de hasta escala de billones de parámetros. Microsoft dice que estará disponible antes de que termine el año.
Qué cambia realmente
La inferencia local no es nueva; preguntamos cuándo un agente empresarial pertenece a una caja bajo el escritorio hace unos días. Lo nuevo es que el enrutamiento se está convirtiendo en una característica de la plataforma. Cuando el sistema operativo y las herramientas de desarrollo deciden qué modelo maneja qué paso, la ubicación deja de ser una revisión de arquitectura que se hace una vez y se convierte en una decisión en tiempo de ejecución tomada miles de veces al día.
Esa decisión tiene al menos cuatro entradas, y cada una pertenece a un propietario diferente:
- Privacidad: ¿pueden estos datos salir del dispositivo? Seguridad y privacidad son los dueños de esa respuesta.
- Latencia: ¿espera el usuario este paso? Los equipos de producto son los dueños de eso.
- Coste: ¿cuánto cuesta una llamada a la nube frente al hardware ya pagado? Finanzas y FinOps son los dueños de eso.
- Capacidad: ¿es un modelo local lo suficientemente bueno para esta tarea? Solo la evaluación puede decirlo.
- Llega la tarea
- Política de datos: ¿puede salir del dispositivo?
- Comprobación de capacidad desde evaluaciones
- Presupuesto de coste y latencia
- Modelo local o modelo en la nube
- Política de enrutamiento propiedad de la empresa: Política de datos: ¿puede salir del dispositivo? · Comprobación de capacidad desde evaluaciones · Presupuesto de coste y latencia
Solicitud del agenteReglas con dueños nombrados
El enrutador es el nuevo punto de control
Un enrutador que elige el “modelo correcto” optimiza para algo. En una herramienta de proveedor, eso suele ser calidad y gasto en tokens. Su empresa puede necesitar que optimice primero para la clasificación de datos, algo que un enrutador genérico no puede saber.
La clasificación de datos tiene que llegar al enrutador. Si un archivo está etiquetado como confidencial, la decisión de enrutamiento debería ver esa etiqueta antes de cualquier llamada a la nube. Pregunte a cualquier proveedor cómo su enrutador consume tus etiquetas, no solo si admite modelos locales.
La capacidad local se convierte en una línea de FinOps. Pagar una vez por una estación de trabajo de gran memoria que ejecuta un modelo abierto capaz cambia la curva de costes para usuarios intensivos, como desarrolladores que ejecutan agentes todo el día. También añade la renovación de hardware, las actualizaciones de modelos y el parcheo al trabajo de alguien. Argumentamos en nuestro artículo sobre la gestión de un portafolio de modelos que cada modelo que ejecutas es algo que operas; un modelo en cada escritorio son muchos de ellos.
La evaluación tiene que cubrir ambos caminos. Si la misma tarea puede recaer en un modelo local de 125B o en un modelo en la nube de frontera, las pruebas de calidad deben ejecutarse en ambos, o el enrutador reducirá silenciosamente la calidad para ahorrar costes.
Las vistas previas son vistas previas. HydraFusion es experimental, DGX Station for Windows es una vista previa, y las características de Copilot están a meses de distancia. Haga pilotos; no estandarice todavía.
Qué hacer ahora
- Escriba la política de enrutamiento antes de comprar el hardware: qué clases de datos deben permanecer locales, qué tareas necesitan calidad de frontera, cuánto puede costar cada camino.
- Elija un grupo de uso intensivo, normalmente desarrolladores, para un piloto local más nube, y mida el coste por tarea en ambos caminos.
- Exija un registro de cada decisión de ubicación: tarea, modelo, ubicación y motivo.
- Extienda las evaluaciones a los modelos locales que permita, con los mismos conjuntos de pruebas que los de la nube.
- Aplique confinamiento a todo agente local y decida quién gestiona esos dispositivos.
La conclusión
El tiempo de ejecución híbrido está llegando al escritorio, en parte ya enviado y en parte en vista previa. El hardware se resolverá por sí solo. La parte que hay que acertar ahora es la política de enrutamiento: escrita por la empresa, aplicada por la plataforma y visible en un registro.