Reflection AI ha presentado Beam, su primer modelo de peso abierto. Beam es un modelo de mezcla de expertos (MoE) disperso, con 501 000 millones de parámetros en total y 23 000 millones de activos por token, diseñado para cargas de trabajo de codificación, razonamiento y agencias. Según el equipo de Reflection AI, Beam compite directamente con modelos abiertos más grandes, como el GLM 5.2, y utiliza entre 3 y 4 veces menos cómputos de inferencia

en los puntos de referencia del razonamiento.

¿Se puede implementar hoy en día? Aún no es apta para autohospedarse. Beam está en la final formando equipo rojo. El acceso anticipado pasa por una lista de espera en la

plataforma Reflection.

¿Qué es Reflection Beam?

Beam es un modelo de agente general entrenado desde cero por Reflection AI. Está dirigido a la codificación empresarial y a las cargas de trabajo de las agencias. Reflexión posiciona a Beam avanzando en la frontera occidental de los pesos abiertos. El equipo de investigación es sincero acerca de la brecha. Kimi K3 se mantiene a la vanguardia en cuanto a capacidad bruta, por lo que el argumento de Beam es la eficiencia a

la hora de inferir.

Los usuarios obtienen un parámetro de esfuerzo de razonamiento. Los ajustes más bajos favorecen las respuestas cortas. Los ajustes más altos permiten razonar durante más tiempo en las tareas difíciles. Los equipos pueden adaptar el esfuerzo a la dificultad de la tarea y calcular el presupuesto.

Cómo se entrenó previamente a Beam

Beam se entrenó previamente con 23,8 billones de tokens de la web, fuentes públicas y conjuntos de datos con licencia patentada. El equipo de Reflection afirma que su selección eliminó alrededor del 95% de los tokens de Internet sin procesar. También se quedó con aproximadamente 1,8 billones de fichas de alta calidad que los filtros convencionales habrían eliminado

.

La arquitectura combina la atención local y global con la de expertos expertos con experiencia. El equilibrio de carga se basa en el equilibrio auxiliar sin pérdidas de DeepSeek-v3, lo que añade una disminución coseno de las actualizaciones basadas en el sesgo de los expertos. El experto más ocupado solo alcanzó una carga media de 1,04 veces mayor al final de la formación previa. En las 52 capas, las normas residuales se mantuvieron limitadas mediante el escalado basado en la profundidad, SandwichNorm,

la regulación de la atención y la acumulación de residuos FP32.

El entrenamiento previo finalizó en menos de 4 semanas con 6144 GPU NVIDIA GB300 NVL72. Goodput alcanzó el 92,3% cerca del final, con 9 rebobinados semiautomáticos. La mitad del entrenamiento amplió el contexto efectivo

a 1 millón de fichas.

Aprendizaje reforzado con alto nivel de procesamiento

RL es el eje de escalado central de Beam. La serie utilizó 10.500 GPU NVIDIA GB300 durante 4 semanas y generó más de 100 millones de implementaciones. El contexto máximo de despliegue fue de 256 000 tokens. La capacitación y la calificación consumieron alrededor de 1300 millones de entornos de pruebas en casi 1 millón de entornos de codificación, agencias

y STEM.

La reflexión se entrenó con gradientes de políticas totalmente asincrónicos. Cada token se etiqueta con la versión de la política que lo generó. Los nuevos algoritmos mantuvieron el aprendizaje estable incluso con un solo día de inactividad, 107 versiones de peso por detrás de la política actual. El equipo informa de que no hubo ningún estancamiento a medida que aumentaba el cálculo del RL

.

Las cifras de infraestructura son notables. El sistema mantuvo un promedio de 110 000 despliegues simultáneos. Los nuevos pesos llegaron a la flota de inferencias en una mediana de aproximadamente 12 segundos. Se gestionaron 71 incidentes de inferencia sin interrumpir

el entrenamiento.

Una penalización de longitud controlable le enseñó a Beam a resolver tareas con menos fichas. Las habilidades de navegación también mejoraron sin tareas de navegación en la combinación de URL, lo que sugiere la transferencia entre dominios de agencia.

Seguridad y alineación

Reflection capacitó a un profesor de seguridad y alineación independiente del puesto de control previamente capacitado. Fusionó a ese profesor con el profesor de RL mediante la destilación de políticas de varios profesores. La capacitación en seguridad utilizó la alineación deliberativa. Los resultados de la evaluación de seguridad aparecerán en el informe técnico

.

Puntos de referencia (informados mediante reflexión)

En SWE-Bench Verified, Beam obtiene una puntuación de 80,9 frente a 70,7 en Nemotron 3 Ultra. En Terminal Bench v2.1, Beam obtiene una puntuación de 80,1, cerca de GLM 5.2 con 81.0. DeepSeek V4.1 Flash (90.6) y Kimi K3 (88.3) lideran la lista. Estas cifras provienen de la tabla de Reflection, que obtiene puntuaciones rivales de

Artificial Analysis y DataCurve.

Beam contra sus competidores más cercanos de peso abierto

(China) Moonshot AI Parámetros de de a
Función Reflection Beam GLM-5.2 Nemotron 3 Ultra DeepSeek V4.1 Flash Kimi K3
Desarrollador Reflection AI (EE. UU.) Z.ai (China) NVIDIA (EE. UU.) DeepSeek (China)
totales 501 B ~753 B 550 B 552B backbone + 196 GB Engram 2.8T Parámetros activos 23B ~40 B 55B 8B Prefillar/16B
decode 104B
Context 1M (efectivo) 1M Hasta 1 M M M M
Entradatexto Texto Texto + imagen Texto + imagen
Licencia Apache 2.0 (planificado) MIT OpenMDW-1.1 MIT Kimi K3 Licencias
pesofinales de octubre de 2026 Disponible Disponible Disponible
Terminal Bench v2.1* 81.0 56.4 90.6 88.3
Source Reflection Cara abrazándose NVIDIA abrazando cara abrazando cara

*Puntuaciones publicadas en el anuncio de Reflection sobre Beam. Especificaciones verificadas el 5 de octubre de 2026

.

Beam es el modelo más pequeño aquí según los parámetros totales. Su recuento activo de 23 000 millones se sitúa por debajo del GLM-5.2, el Nemotron 3 Ultra y el Kimi K3. Apache 2.0 y MIT son licencias permisivas estándar. La licencia personalizada de Kimi K3 añade requisitos de atribución

para productos de gran tamaño.
&

Conclusiones clave

  • Beam es un MoE de 501 B con 23 B de parámetros activos, solo texto y 1 millón de contexto efectivo.
  • Pretraining usó 23,8 billones de tokens en 6144 GPU NVIDIA GB300 en menos de 4 semanas.
  • RL realizó más de 100 millones de despliegues en GPU de 300 GB de 10.500 GB durante 4 semanas.
  • Reflection informa de un 80,9 en SWE-Bench Verified y de un 80,1 en Terminal Bench v2.1.
  • Los pesos de Apache 2.0 están programados para finales de este mes.

Consulta los detalles técnicos y el acceso anticipado.

The post Reflection AI presenta Beam: un modelo de MoE de peso abierto de 501 000 millones con 23 000 millones de parámetros activos para cargas de trabajo de codificación y agencia appeared first on MarkTechPost.

¿Tiene un proyecto de software o plataforma SaaS en mente?

Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.