9 min read

Reflection Beam: el modelo abierto de 501B para código

Beam es el primer modelo abierto de Reflection AI: 501.000 millones de parámetros para código y agentes. Qué es, benchmarks, críticas y cómo acceder.

Respuesta corta: Beam es el primer modelo de pesos abiertos de Reflection AI, presentado el 5 de octubre de 2026. Es un modelo de mezcla de expertos con 501.000 millones de parámetros en total, de los que solo 23.000 millones trabajan en cada token, y está pensado para programar, razonar y ejecutar tareas como agente. Por ahora solo se puede probar con acceso anticipado; Reflection publicará los pesos, el informe técnico y la ficha del modelo a lo largo de octubre con licencia Apache 2.0 (Reflection).

Un haz de luz que ilumina solo unas pocas celdas de una gran red cristalina, como un modelo de mezcla de expertos

Reflection era uno de los laboratorios de modelos abiertos más vigilados de Estados Unidos por una razón incómoda: desde su fundación en 2024 no había lanzado ningún modelo. Beam es su estreno, y la empresa lo presenta como la apuesta occidental frente a los modelos abiertos chinos que hoy dominan el terreno, como GLM, Kimi, Qwen o DeepSeek. Aquí verás qué es Beam, qué dicen sus números, qué le critican y qué cambia si programas con IA. Si buscas el panorama completo de asistentes, agentes y modelos, empieza por nuestro hub de herramientas de IA.

¿Qué es Reflection Beam?

Beam es un modelo de lenguaje solo de texto creado por Reflection AI, una startup fundada en 2024 por dos exinvestigadores de Google DeepMind, Misha Laskin e Ioannis Antonoglou, y respaldada por Nvidia, según Reuters.

Su rasgo clave es que es disperso. Tiene 501.000 millones de parámetros, pero cada token solo activa 23.000 millones. En un modelo de mezcla de expertos (MoE), cada fragmento de texto pasa por unas pocas subredes especializadas en lugar de recorrer la red entera. Así conserva el conocimiento de un modelo enorme y gasta mucho menos cálculo por respuesta.

Reflection lo ha entrenado sobre todo para código y tareas agénticas: trabajos de varios pasos en los que el modelo planifica, llama a herramientas, ejecuta comandos en la terminal y comprueba el resultado. La empresa lo define como «el primer modelo de una serie» y asegura que ya entrena el siguiente.

¿Cómo se ha entrenado Beam?

En dos grandes fases, y Reflection ha dado cifras con un detalle poco habitual:

  • Preentrenamiento: 23,8 billones de tokens seleccionados de la web, fuentes públicas y datos con licencia, en un clúster de 6.144 GPU NVIDIA GB300 NVL72. Lo completó en menos de cuatro semanas.
  • Aprendizaje por refuerzo (RL): más de 100 millones de ejecuciones de práctica en 10.500 GPU NVIDIA GB300 durante cuatro semanas, con un contexto máximo de 256.000 tokens y unos 1.300 millones de entornos aislados (sandboxes) para entrenar y evaluar.

Para el refuerzo reunió casi un millón de entornos de ingeniería de software, terminal, programación competitiva, ciencia, búsqueda web y uso de herramientas. Según Reflection, el modelo siguió mejorando a medida que crecía el cálculo, sin señales de estancamiento.

Hay un detalle útil si desarrollas. Beam se entrenó con una penalización por longitud que premia acertar sin gastar tokens de más. Eso se traduce en un ajuste de esfuerzo de razonamiento: tú decides en cada petición si prefieres rapidez o profundidad.

¿Qué tal programa Beam según los benchmarks?

Compite con los modelos abiertos medianos, pero queda por detrás de los chinos más fuertes en código puro. Son resultados publicados por la propia Reflection, no pruebas independientes:

PruebaBeamGLM 5.2Qwen 3.8 MaxKimi K3DeepSeek V4.1 Flash
DeepSWE v1.144,444,051,068,074,2
Terminal Bench v2.180,181,086,688,390,6
SWE Bench Pro v165,562,167,7sin datosin dato

En SWE-bench Verified declara 80,9 y en SWE-bench Multilingual, 78,0. La propia Reflection reconoce que Kimi K3 «sigue por delante en capacidad bruta».

Así que la promesa no es «el mejor modelo para programar». Es la eficiencia. Reflection afirma que Beam razona al nivel de GLM-5.2 con entre tres y cuatro veces menos cálculo de inferencia. Como referencia, Reuters recuerda que GLM-5.2 tiene 744.000 millones de parámetros, con 40.000 millones activos, frente a los 501.000 y 23.000 millones de Beam.

¿Se sostiene la promesa de eficiencia?

Es verosímil, pero aproximada, y la letra pequeña de Reflection lo admite. La empresa estima el cálculo como dos veces los parámetros activos por los tokens generados. Esa cuenta deja fuera el procesamiento del prompt, el coste de atención que crece con el contexto y la sobrecarga del servidor, así que es una comparación aproximada y no un coste medido.

Las críticas apuntan justo ahí. Turing Post calificó el lanzamiento de decepcionante: subraya los 30 puntos que le saca DeepSeek V4.1 Flash en DeepSWE y sostiene que las cifras de eficiencia no permiten comparar el coste real por tarea.

La lectura justa es esta: el cálculo por token de Beam es bajo porque solo activa 23.000 millones de parámetros. Que eso acabe en una factura menor depende del precio que pongan los proveedores, de cuánto razone en tus tareas y de cuánto contexto le envíes. Hasta que no haya pesos públicos y precios de API, nadie puede medirlo.

¿Cómo se puede usar Beam hoy?

De momento, solo con acceso anticipado. Reflection ofrece una versión previa a un grupo reducido de usuarios mediante lista de espera mientras termina las pruebas de seguridad (red-teaming) y las evaluaciones.

Su documentación para desarrolladores ya explica cómo funcionará (documentación de Reflection):

  • Identificador: Beam-501B-A23B.
  • API compatible con OpenAI: basta con cambiar la URL base y la clave en el cliente que ya uses.
  • Contexto: 256.000 tokens en la API (en beta) y hasta 128.000 tokens de salida. El blog dice que el entrenamiento intermedio amplió el contexto efectivo a 1 millón de tokens, así que ese límite podría cambiar.
  • Esfuerzo de razonamiento: low, medium, high, xhigh o max; por defecto, medium. El razonamiento no se puede desactivar.
  • Funciones: llamadas a herramientas y salidas estructuradas.
  • Fecha de corte del conocimiento: 30 de junio de 2026.

Reflection aún no ha publicado precios. Cuando lleguen los pesos con licencia Apache 2.0, podrás ejecutarlo, ajustarlo y usarlo en productos comerciales siempre que conserves la licencia y los avisos. La empresa promete lanzarlo con socios de distribución e integraciones con librerías y entornos de agentes de código abierto.

¿Se puede ejecutar Beam en tu propio equipo?

En un portátil, no. Aunque solo active 23.000 millones de parámetros por token, los 501.000 millones tienen que estar en memoria. Con precisión de 16 bits, solo los pesos ocupan alrededor de 1 TB antes de cualquier cuantización. Hablamos de servidores con varias GPU.

Ahí está el valor real para las empresas. Reflection ofrece servir sus modelos por API o desplegarlos en tu propia infraestructura: nube privada, servidores propios, entornos aislados de internet o dispositivos en el borde. Para un banco, una aseguradora o una administración que no puede mandar su código a una API externa, un modelo abierto potente y alojado en casa marca la diferencia.

¿Qué ha construido Beam en las demostraciones?

Reflection enseñó cuatro ejemplos de su lado más agéntico:

  • Un mapa en directo del metro de Nueva York: buscó los datos públicos de la MTA, revisó la autenticación, montó el frontend y el backend y dejó el servidor en marcha para actualizar los trenes.
  • Un juego 3D en p5.js: un astronauta que cae hacia la Tierra esquivando o destruyendo asteroides. Beam no ve imágenes, pero razonó el aspecto visual desde el código.
  • Un cuaderno de ajuste fino: conectado al agente OpenCode, leyó la documentación de Unsloth y preparó un notebook para ajustar el modelo Gemma-4 más pequeño en una tarea de texto a SQL. Reflection habla de una mejora del 66,5 % en precisión sobre el conjunto de prueba.
  • Una prueba de generalización geográfica: una cuadrícula de 16.200 puntos de tierra o agua, con un 95,5 % de cobertura correcta.

Reflection añade que, durante el refuerzo con tareas de código y terminal, Beam mejoró navegando por la web sin haberlo entrenado para eso. Conviene tomar las demos como lo que son: muestran lo que es posible, no lo que obtendrás en cada ejecución.

¿Dónde encaja Beam entre los agentes de código?

Beam es un modelo, no una aplicación. No se «abre» como Cursor o Claude Code: se conecta a un agente, a una extensión del editor o a tu propio flujo de trabajo, igual que hoy se usan GLM, Qwen o DeepSeek.

Por eso el agente importa tanto como el modelo. En nuestra comparativa de mejores agentes de código verás cuáles aceptan modelos propios o alojados por ti, y el mapa de herramientas de IA para desarrolladores explica cómo se conectan modelos, agentes y editores.

La pregunta práctica es sencilla: cuando salgan los pesos, ¿superará Beam al modelo abierto que ya usas, a un coste asumible y en tus tareas reales? Antes de cambiar, pruébalo con una muestra de tu propio trabajo.

La habilidad que hay detrás de Beam

Cada mes llega un modelo abierto nuevo con su tabla de benchmarks. Las herramientas cambian rápido; lo que dura es saber evaluarlas. Eso significa leer una tabla de resultados con espíritu crítico, montar una pequeña batería de pruebas con tus tareas, conectar un modelo a un agente mediante una API compatible con OpenAI y revisar el código que genera antes de que llegue a producción.

Ese es el trabajo de un AI Engineer: construir con modelos como Beam y comprobar lo que producen, no solo escribirles prompts. Si quieres aprender ese oficio, compara nuestros programas y descubre cuál encaja contigo.

Conviértete en AI Engineer

Aprende a construir con modelos como Beam y a revisar lo que generan, con mentoría 1:1 y proyectos reales.

Preguntas Frecuentes