Beam, de Reflection, tiene 501.000 millones de parámetros y pesos abiertos. Ahora la operación es suya
Reflection presentó Beam, un modelo mixture-of-experts de 501.000 millones de parámetros para código y agentes, con licencia Apache 2.0. Los pesos llegarán este mes, tras el red teaming final.
Escuche este artículo · 6 min
Narración completa del artículo, generada con IA.

El 5 de octubre, Reflection presentó Beam, su primer modelo de pesos abiertos, pensado para código, razonamiento y trabajo con agentes. Si sus promesas se confirman, las empresas tendrán otro modelo capaz que pueden ejecutar en su propia infraestructura. Antes de que alguien lo descargue, conviene tener claro qué transfieren realmente los pesos abiertos: no solo control, sino las tareas de operación que una API mantenía ocultas.
Qué ha anunciado Reflection, y qué no ha entregado todavía
- Arquitectura. Un modelo mixture-of-experts disperso con 501.000 millones de parámetros en total y 23.000 millones activos por token. Contexto de 256.000 tokens durante el aprendizaje por refuerzo, ampliado a un millón en el midtraining.
- Entrenamiento. Preentrenamiento con 23,8 billones de tokens en 6.144 GPU NVIDIA GB300 en menos de cuatro semanas; aprendizaje por refuerzo con más de 100 millones de rollouts en unas 10.500 GPU GB300 durante cuatro semanas.
- Licencia. Apache 2.0, permisiva, que admite uso comercial.
- Estado. Beam está en la fase final de red teaming y evaluaciones. Reflection dice que publicará los pesos, el informe técnico, la ficha del modelo y los materiales para desarrolladores a lo largo de este mes. Hoy hay una lista de espera para acceso anticipado en su plataforma.
- Benchmarks. Reflection comunica resultados como un 77,2% en SWE Bench Pro v2-Hard y un 90,5% en GPQA Diamond. Son cifras propias hasta que haya evaluaciones independientes.
El estado honesto, hoy, es un anuncio con licencia y fecha, no un modelo descargable. Eso es útil: da a los equipos de plataforma unas semanas para prepararse.
Qué pasa a ser suyo cuando ejecuta los pesos
- Capacidad y disponibilidad
- Parches y actualizaciones
- Pruebas de seguridad para su uso
- Evaluación en sus tareas
- Frontera y conservación de datos
- Coste por respuesta aceptada
Suya en cualquier caso
La capacidad es la primera sorpresa. “23.000 millones activos” describe el cálculo por token, no la memoria. Los 501.000 millones de parámetros tienen que estar cargados para servir el modelo: unos 500 GB de pesos a 8 bits por parámetro, alrededor de 1 TB a 16 bits, antes de la memoria para contextos largos. Eso es, como mínimo, un servidor con varias GPU, y producción con redundancia exige más de uno. Dimensione por el total de parámetros, no por los activos.
Actualizar pasa a ser su publicación. Con una API, el proveedor publica correcciones y versiones a su ritmo. Con los pesos, nada cambia hasta que usted lo cambie, lo que es bueno para la estabilidad y malo si después aparece un problema de seguridad. Alguien tiene que seguir las nuevas versiones, repetir las evaluaciones y desplegar la actualización, como en cualquier cambio de modelo.
Las pruebas de seguridad son en parte suyas. Reflection está terminando su red teaming. No puede probar las herramientas, los datos y los permisos de su agente. Un agente de código que ejecuta comandos necesita pruebas adversarias propias, en su entorno.
La frontera de datos es la recompensa. Prompts, código y respuestas no salen de su infraestructura. En España, eso simplifica el análisis de transferencias internacionales bajo el RGPD y encaja con la preocupación por la soberanía que domina las compras públicas y bancarias europeas. En Latinoamérica, donde las regiones de los grandes proveedores de modelos son escasas, ejecutar el modelo en un centro de datos propio o local en México, Colombia o Chile puede ser la única forma de mantener los datos en el país. Es la misma lógica de custodia que analizamos con los agentes de código autoalojados.
El Reglamento europeo de IA mira al proveedor del modelo, no a quien solo lo usa. Las obligaciones de los modelos de uso general recaen sobre quien los pone en el mercado, en este caso Reflection, y la exención para modelos de código abierto no cubre los modelos con riesgo sistémico. Una empresa que solo despliega Beam actúa como responsable del despliegue de su sistema. Si lo modifica de forma sustancial, las directrices de la Comisión fijan cuándo pasa a ser proveedora; el fine-tuning habitual de una empresa queda muy lejos de ese umbral, pero conviene documentarlo.
Dónde podría encajar Beam
No toda tarea necesita un generalista de frontera. En nuestro marco de portafolio de modelos, un modelo abierto como Beam sería candidato a los papeles en los que la custodia o el coste a gran volumen pesan más que tener la mejor respuesta posible: asistencia de código sobre repositorios sensibles o pasos de agentes que se ejecutan miles de veces al día. Solo su propio conjunto de evaluación puede decidir si se gana ese papel.
Qué hacer ahora
- Prepare un conjunto de evaluación con tareas reales de código y agentes antes de que lleguen los pesos.
- Dimensione la capacidad por el total de parámetros, con redundancia y memoria para contexto largo.
- Lea la ficha del modelo y el informe técnico cuando se publiquen, antes de cualquier piloto.
- Verifique los pesos descargados con las sumas de comprobación del editor y guárdelos como artefacto controlado.
- Planifique su propio red teaming para las herramientas y permisos de sus agentes.
- Compare el coste por respuesta aceptada con su API actual, no el coste por token.
En resumen
Beam puede sumar una opción sólida y con licencia permisiva a los portafolios de modelos, pero todavía no hay pesos y sus benchmarks son propios. Aproveche las semanas hasta el lanzamiento para decidir si quiere las tareas que conlleva operar un modelo, porque con pesos abiertos son suyas.