¿Qué cambia Rho-1
La mayoría de los sistemas multimodales actuales son oleoductos. Un modelo central planifica y, a continuación, entrega las tareas a especialistas para obtener imágenes, vídeos o la detección. Cada transferencia añade latencia y cada especialista solo recibe una solicitud limitada
.Rho-1 elimina esos traspasos. El texto, la visión y las acciones robóticas se convierten en símbolos dentro de una ventana contextual. Según la investigación de Reka, una sesión sin editar muestra el ciclo completo. La modelo dibuja un faro, lo coloca en cajas, lo anima, edita el vídeo para convertirlo en una tormenta de nieve y explica la diferencia. Todo esto ocurre en 5 turnos, sin necesidad de utilizar herramientas ni de usar un segundo
modelo.Arquitectura: dos flujos, un KV de caché
Cada entrada y salida utiliza uno de los dos formatos nativos:
- Los tokens discretos contienen texto, razonamiento simbólico y comandos de alto nivel.
- Los tokens continuos contienen imágenes latentes, fotogramas de vídeo, acciones de robots y propiocepción.
Cada bloque transformador contiene dos flujos de peso expertos. El flujo de comprensión se encarga del análisis visual y lingüístico. El flujo de generación elimina las sustancias latentes y las convierte en imágenes y vídeos. Ambas transmisiones comparten la atención y funcionan en la misma caché de KV
.Cuando una respuesta necesita píxeles, la secuencia de comprensión emite un token de transferencia discreto. A continuación, el flujo de generación se renderiza a partir del estado acumulado completo. El entrenamiento combina la predicción del siguiente token para secuencias discretas con la adaptación del flujo para salidas continuas
.Este diseño tiene efectos prácticos. Los recuadros delimitadores salen como símbolos de coordenadas, no de un detector independiente. El primer fotograma de un vídeo reutiliza la representación de la imagen en contexto en lugar de una
copia recodificada. &Velocidad: base vs destilada
El modelo base genera vídeo a 0,79 veces más en tiempo real (media), con una transmisión que se puede ver en aproximadamente 6 segundos. El equipo de Reka tardó 7 segundos en ver el primer vídeo, frente a los 13,8 segundos de un proceso con varios agentes
.Una variante destilada reduce la eliminación de ruido de 99 a 8 pasos, con una pérdida de calidad mínima. Obtuvo un clip de 5,3 segundos en aproximadamente un segundo. En las pruebas internas de Reka, igualó a los modelos de imagen dedicados más rápidos. También fue el modelo más rápido que se probó con el primer token de texto. Se trata de pruebas ejecutadas por proveedores, no de puntos
de referencia independientes.El modelo mundial y la robótica
Rho-1 transmite continuamente, clip tras clip. Las nuevas instrucciones se introducen a través del flujo de comprensión y se actualizan a la mitad del lanzamiento. Reka demuestra una apertura bifurcada en continuaciones de «banco a la izquierda» y «banco a
la derecha». Enel caso de la robótica, las acciones y los marcos futuros se decodifican partiendo del mismo estado latente. Un episodio de simulación de LIBERO muestra a Rho-1 emitiendo 7 canales de acción. Para superar los escasos registros de teleoperación, Reka combina Rho-1 con su modelo de dinámica inversa, que deduce señales de control a partir de vídeo sin
procesar.Cómo se compara Rho-1
Datos verificados el 5 de octubre de 2026 de fuentes oficiales.
| Función | Reka Rho-1 | ByteDance BAGEL | BAAI Emu3.5 Google Genie 3 | Desarrollador | Reka | ByteDance | | Google DeepMind | | Parámetros 19B 14B en total, 7B | |
|---|---|---|---|---|---|---|---|
| active (MoT) | 34B | ||||||
| Entradas | no reveladas | Texto, imagen, vídeo, acciones, propiocepción | Texto, imagen Texto e imagen | intercalados | Mensaje detexto, entradas de navegación | ||
| Salidas | Texto, imagen, vídeo, acciones, propiocepción | Texto, imagen Texto e imagen | intercalados | Mundo de vídeo interactivo | |||
| Generación de vídeo nativo | Sí, con un límite de 672 × 384 | No | (marcos de imagen, no clips nativos) | Sí, 720p a 24 fps | |||
| Dirección en tiempo real | Sí, lanzamientos continuos | No | No | Sí, eventos mundiales | |||
| Acciones de robots | Tokens de acción continua nativos | Sin | demostraciones de manipulación encarnada | Realiza acciones de navegación, no las emite | |||
| Pesos abiertos | No | Sí, Apache 2.0 | Sí, Apache 2.0 | No | |||
| Access today | Vista previa de la investigación a través de contact@reka.ai |
Acceso a Genie 3 por Project Genie; recuento de parámetros de Emu3.5 según su tarjeta modelo Hugging Face.
Conclusiones clave
- Rho-1 es un modelo 19B que lee y escribe texto, imágenes, vídeos y acciones de robots.
- Dos transmisiones de expertos comparten la atención y una caché de KV en cada bloque.
- La destilación reduce la eliminación de ruido de 99 a 8 pasos, aproximadamente 1 segundo por clip de 5,3 s.
- Se entrenó con 320 H100 durante 3 meses; el vídeo tiene un límite de 672 × 384.
- Solo una versión preliminar de la investigación: aún no hay ponderaciones públicas, API ni precios.
Consulta los detalles técnicos y el anuncio en X. Todo el mérito es del investigador de este proyecto. Además, siéntete libre de seguirnos en Twitter y no olvides unirte a nuestro subReddit de más de 150 000 ml y suscribirte a nuestro boletín. ¡Espera! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.
¿Necesitas asociarte con nosotros para promocionar tu repositorio de GitHub, tu página de Hugging Face, el lanzamiento de un producto, un seminario web, etc.? ¡Conéctate con nosotros
The post Reka lanza Rho-1: un modelo omnirracional de 19 años que comprende, genera videos y produce las acciones de los robots en uno appeared first on MarkTechPost.