La infraestructura de IA privada ya se vende por carga de trabajo, no por número de GPU
Lenovo y NVIDIA venden capacidad de IA híbrida en niveles definidos por usuarios, tokens por segundo y tamaño de modelo, con envío en 15 a 25 días. Los agentes cambian el cálculo.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

Comprar infraestructura de IA privada solía parecerse a un proyecto de supercomputación: arquitectos eligiendo GPU, interconexión y almacenamiento, meses de diseño y un clúster que era demasiado grande el primer año o demasiado pequeño el segundo. La nueva oferta de Lenovo se parece más a comprar un nivel de capacidad ya validado.
Qué anunció Lenovo
Lenovo AI Express, desarrollado con NVIDIA como vía rápida de entrada a la Hybrid AI Factory de Lenovo, llega en tres configuraciones predefinidas. Lenovo describe cada una por la carga que pretende atender, antes que por su lista de componentes:
| Nivel | Carga descrita por Lenovo | Hardware | Del pedido al envío |
|---|---|---|---|
| Pequeño | Inferencia acotada para decenas de usuarios a más de 30 tokens por segundo, modelos de unos 7.000 a 70.000 millones de parámetros | ThinkSystem SR650a V4 con dos GPU NVIDIA RTX PRO 6000 Blackwell Server Edition | Desde 15 días hábiles |
| Mediano | Inferencia de mayor rendimiento e IA agéntica para cientos de usuarios a más de 30 tokens por segundo, modelos de unos 70.000 a 400.000 millones | ThinkSystem SR675 V3 con ocho GPU RTX PRO 6000 Blackwell Server Edition | Desde 20 días hábiles |
| Grande | IA generativa a escala para miles de usuarios, modelos de hasta un billón de parámetros | ThinkSystem SR680a V4 con NVIDIA HGX B300 | Desde 25 días hábiles |
Las opciones de software son NVIDIA AI Enterprise o Red Hat AI Factory with NVIDIA, con Veeam Kasten para la resiliencia de datos. Los servicios incluyen despliegue, validación del ROI y optimización de GPU, además de un nuevo nivel de soporte Premier Support Plus para servidores. Los plazos se aplican a configuraciones elegibles tras su validación, y Lenovo indica que la disponibilidad varía por región, así que conviene confirmarla en cada país.
Lenovo cita también una encuesta propia a CIO sobre el retorno esperado de la IA. Es investigación de un proveedor y no debe leerse como evidencia independiente.
Por qué importa la unidad de compra
Describir la capacidad como “usuarios, tokens por segundo y tamaño de modelo” es acertado. Es el lenguaje de la carga de trabajo, y obliga a quien compra a responder las preguntas que deciden si el sistema será suficiente: cuántas personas, con qué rapidez necesitan respuesta y qué tamaño de modelo exige la tarea.
Hay un problema, y va a más: los agentes rompen la cifra de “usuarios”.
- Caso de uso y objetivo de latencia
- Usuarios simultáneos en el pico
- Llamadas al modelo por tarea
- Tokens por llamada, entrada y salida
- Tamaño de modelo necesario
- Nivel de capacidad, con crecimiento
Datos de negocioDonde los agentes multiplican la carga
Una persona que conversa con un asistente genera una llamada al modelo por pregunta. Un agente que completa una tarea planifica, llama a herramientas, recupera información, revisa y reintenta, lo que puede suponer decenas de llamadas por tarea, cada una con un contexto largo. Un nivel dimensionado para “cientos de usuarios” de chat puede atender a muchos menos usuarios de un flujo agéntico. Y los agentes que trabajan en segundo plano, sin nadie esperando, añaden una carga que ningún recuento de usuarios recoge.
Por eso el dimensionamiento tiene que empezar un nivel más abajo:
- Llamadas por tarea de cada agente, medidas en un piloto, no supuestas.
- Tokens por llamada, de entrada y de salida, incluido el contexto recuperado y los resultados de herramientas.
- Concurrencia de agentes, incluidos los programados y los activados por eventos.
- Objetivos de latencia por paso, porque un cierre nocturno y una respuesta a un cliente tienen necesidades muy distintas.
- Combinación de modelos. Si la mayoría de los pasos puede usar un modelo pequeño y solo algunos necesitan uno grande, como plantea el argumento de enrutar por tarea, el nivel necesario puede ser menor de lo que sugiere el modelo más grande.
Cuándo tiene sentido un nivel empaquetado
Un nivel validado con plazos cortos encaja con organizaciones que ya han decidido que parte de la inferencia debe ejecutarse en infraestructura propia, por las razones de custodia y soberanía que analizamos en nuestro artículo sobre la IA soberana, y quieren evitar un proyecto de diseño a medida. En España, esa decisión suele venir de la mano del RGPD y de la supervisión sectorial en banca, sanidad o administración pública; en Latinoamérica, también de la latencia y del coste de depender de regiones de nube lejanas. Se sitúa un peldaño por encima de la opción de sobremesa que NVIDIA acaba de anunciar con el DGX Spark de 64 GB: compartido, de grado centro de datos y operado por TI.
No elimina el trabajo de operación. Alguien sigue actualizando la plataforma, gestionando los modelos, vigilando la utilización y planificando la ampliación. Un nivel empaquetado hace la compra más rápida; no hace más barata la operación.
Qué hacer ahora
- Mida antes de comprar. Ejecute los agentes objetivo en un piloto y registre llamadas por tarea, tokens por llamada y latencia por paso.
- Traduzca los agentes a carga, no a usuarios, e incluya los agentes en segundo plano.
- Dimensione según la combinación de modelos, no según el modelo más grande que quizá quiera algún día.
- Planifique el segundo año: objetivos de utilización, camino de crecimiento entre niveles y quién decide sobre la capacidad.
- Confirme la elegibilidad y los plazos en su país con Lenovo o sus socios; los 15 a 25 días se aplican a configuraciones elegibles.
En resumen
Lenovo AI Express es una señal de que la infraestructura de IA privada se está convirtiendo en un producto que se compra por carga de trabajo. Es un avance. Acertarán quienes conozcan su carga en términos de agentes, llamadas, tokens y concurrencia, antes de elegir el nivel.