La mayoría de los recomendadores de producción son en cascada. Los generadores candidatos alimentan a un preranker, que alimenta a un ranker pesado construido sobre cientos de características de ingeniería. El informe técnico de Sona de Yandex describe un diseño diferente. Sona es un modelo de IA generativa que reúne la generación y clasificación de candidatos en un solo sistema, sustituyendo las múltiples etapas que normalmente se utilizan en los procesos de recomendación. Yandex probó el modelo en un experimento de producción en directo de siete días con sus altavoces inteligentes. En una prueba A/B en línea, sustituyó más de 15 generadores candidatos, la fase previa a la clasificación y la fase de clasificación por un transformador utilizado
.¿Qué problema resuelve Sona?
Cascades divide una decisión en modelos entrenados por separado. Cada etapa optimiza su propio objetivo, y el rankeador solo ve lo que dejan pasar las etapas anteriores. La anterior pila de Yandex en la superficie de Yandex Music consumía cientos de funciones, incluidas las señales de Argus, el anterior transformador de recomendaciones de Yandex. Sona sitúa la generación y clasificación de candidatos en torno a una representación de usuarios compartida. El codificador lee el historial del oyente una vez por solicitud. Un decodificador genera candidatos. Un módulo de clasificación los puntúa según los mismos estados del codificador. Ningún componente utiliza funciones diseñadas a mano. Las entradas son campos de eventos registrados (ID de pista, ID de artista, duración, me gusta, tiempo de reproducción, marcas de superficie) e identificadores semánticos aprendidos
.En los altavoces inteligentes Yandex, la reproducción puede comenzar sin que el usuario seleccione primero un artista, género o estado de ánimo. El equipo de investigación describe esto como una configuración basada únicamente en la recomendación
.Cómo funciona la arquitectura de Sona
1. Tokenizador semántico
Siguiendo la formulación de identificación semántica de Rajput et al. , cada pista se convierte en una tupla de 3 códigos discretos. Un LLM multimodal congelado lee el espectrograma de melación de los primeros 90 segundos junto con el título, los artistas y las etiquetas. Funciona solo en modo de prellenado. Luego, un transformador de refinamiento de 4 capas alinea esas características con el comportamiento de escucha, utilizando InFonce en pares de pistas colaborativos. Residual K-means cuantifica el resultado en 3 libros de códigos de 32 000 entradas cada uno. Esto superó la línea base de audio del CLMR: Recall @1000 pasó
de 0,8111 a 0,8524.2. Codificador con compresión de historial
Sona asiste a 8.192 eventos pasados. Prestar toda la atención a esa longitud es caro, por lo que el codificador utiliza la profundidad de forma desigual. Los 2.048 eventos recientes tienen una pila de autoatención de 7 capas. Los eventos más antiguos solo pasan por una capa de atención cruzada y por una capa de historial completo. El documento informa que esto mantiene la mayor parte de la calidad de la atención completa a aproximadamente la mitad del costo de la inferencia
.3. Módulo decodificador y de clasificación
Un decodificador de 2 capas emite tuplas de identificación semántica mediante una búsqueda de haz restringida con un ancho de 1.024. Un árbol de catálogo bloquea los prefijos no válidos. Cada tupla se expande para incluir todas las pistas que la comparten. El módulo de clasificación, que consta de cuatro capas de atención cruzada, clasifica esas pistas comparándolas con la memoria del codificador compartida
.Formación: un profesor que nunca hace envíos
El módulo de clasificación aprende de un clasificador de profesores congelado. El profesor es un transformador de 0,6 B de parámetros, que tampoco cuenta con funciones diseñadas a mano. Se entrena durante un año realizando eventos de interacción en dos etapas: preentrenamiento para predecir el siguiente objeto y, a continuación, ajustar la clasificación con varios jugadores. La eliminación de la fase previa al entrenamiento redujo la precisión de los pares ponderados
de 0,6215 a 0,6153.El equipo llama a su método de destilación Rollout Distillation. Durante el entrenamiento, el decodificador actual genera haces candidatos. El profesor los puntúa junto con las impresiones registradas. El módulo de clasificación devuelve los puntajes con un error medio absoluto. La pérdida conjunta es L = L_NTP + L_rollout + L_impression. Ambas pérdidas actualizan el codificador compartido. A la hora de servir, el profesor es destituido
.La capacitación permanece en línea. Los eventos se acumulan en sesiones durante un período de 15 minutos, alimentan a un entrenador con GPU y cada 10 minutos se reparten nuevos pesos por ración. La latencia de extremo a extremo es de 45 minutos en la mediana y de 60 minutos en el punto 99. El servicio se ejecuta en el servidor de inferencia Triton de NVIDIA con gráficos CUDA y alcanza el 41%
de utilización de los modelos FLOP.Resultados: Prueba A/B en línea sobre tráfico en vivo
El experimento final duró 7 días con un 15% de usuarios seleccionados al azar por división. Todos los cambios que se indican a continuación son estadísticamente significativos y están relacionados con el control de producción
:- Usuarios activos (métrica principal): +4,53%
- Tiempo total de escucha: +6,30%
- Me gusta: +11,42%
- Comandos de «repetición»: +17,99%
Estas ganancias se suman a las mejoras conservadas en las implementaciones anteriores. En cuanto a los usuarios activos, la mejora de Sona es 2,35 veces mayor que el incremento del 1,93% que Argus ofrecía anteriormente
en esta superficie.Sona, OneRec y HSTU: comparación de funciones
Sona no es el primer recomendador generativo integral en producción. El OneRec de Kuaishou ya ofrece un único modelo de codificador-decodificador. En 2024, los HSTU Generative Recommenders de Meta redefinieron la recomendación como una transducción secuencial de las acciones de los usuarios. Lo que Sona combina es un sistema de clasificación completo en cascada, sin funciones diseñadas a mano y una clasificación resumida, validada
en línea.| Función | Sona (Yandex) | OneRec (Kuaishou) | HSTU GR (Meta) | |
| Domain | Transmisión de música | Vídeo corto | Gran plataforma de Internet, múltiples superficies Un modelo servido reemplaza a la cascada Sí, |
| en la prueba A/B Sí, alrededor del 25% del QPS | total No, según | se informa como una nueva arquitectura para los modelos de recomendación Las entradas del usuario | |
| Solo campos de eventos registrados, sin funciones diseñadas a mano | Rutas de «ingeniería de funciones multiescala», que incluyen uid, edad, género | Secuencias de acción del usuario (transducción secuencial) | |
| Salida del artículo | IDsemánticos de 3 niveles, 3 x 32 000 | ID semánticos de 3 niveles a través de RQ-KMeans | |
| Señal de clasificación | Producida a partir de 0.6 mil millones de profesores Ranker | RL con modelo de recompensa P-Score (ECPO) | Modelo de clasificación HSTU | Aprendizaje por refuerzo | No, totalmente supervisado | Sí (ECPO)
| No reportado | |||
| Scale informó | de unhistorial de 8.192 eventos, 0.6 mil millones de profesores | ,10 veces más fracasos que el modelo de clasificación anterior | ,1,5 billones de parámetros |
| informó de una ganancia en línea | , un4,53% de usuarios activos, un 6,30% de tiempo de escucha, un 11,42% de me gusta | , un0,54% y un 1,24% de tiempo de estancia en la aplicación | ,un 12,4% en las pruebas A/B en línea |
| Código público o ponderaciones | No | ,no está en el informe | Sí, GitHub |
Fuentes : Sona, OneRec, HSTU. Las ganancias en línea provienen de diferentes plataformas y métricas, por lo que no son directamente comparables
.Conclusiones clave
- Sona reemplazó más de 15 generadores, clasificándolos previamente y clasificándolos por un modelo servido.
- Sin funciones diseñadas a mano: solo los eventos registrados y los identificadores semánticos aprendidos.
- Un maestro de 0.6 mil millones entrena al rankeador y luego se queda fuera de servicio.
- Prueba A/B: +4,53% de usuarios activos, 2,35 veces la ganancia anterior de Argus.
- No se puede implementar externamente: sin código ni ponderaciones, no con tráfico total.
Preguntas frecuentes
¿Qué es Yandex Sona?
Sona es un modelo de IA generativa que combina la generación de candidatos y la clasificación en un solo sistema. Yandex lo probó en un experimento de producción en directo de siete días con sus altavoces inteligentes, en el que sustituyó la línea de recomendaciones multietapa existente para el
OneRec utiliza rutas de funciones diseñadas para el usuario y RL