La mayoría de los recomendadores de producción son en cascada. Los generadores candidatos alimentan a un preranker, que alimenta a un ranker pesado construido sobre cientos de características de ingeniería. El informe técnico de Sona de Yandex describe un diseño diferente. Sona es un modelo de IA generativa que reúne la generación y clasificación de candidatos en un solo sistema, sustituyendo las múltiples etapas que normalmente se utilizan en los procesos de recomendación. Yandex probó el modelo en un experimento de producción en directo de siete días con sus altavoces inteligentes. En una prueba A/B en línea, sustituyó más de 15 generadores candidatos, la fase previa a la clasificación y la fase de clasificación por un transformador utilizado

.

¿Qué problema resuelve Sona?

Cascades divide una decisión en modelos entrenados por separado. Cada etapa optimiza su propio objetivo, y el rankeador solo ve lo que dejan pasar las etapas anteriores. La anterior pila de Yandex en la superficie de Yandex Music consumía cientos de funciones, incluidas las señales de Argus, el anterior transformador de recomendaciones de Yandex. Sona sitúa la generación y clasificación de candidatos en torno a una representación de usuarios compartida. El codificador lee el historial del oyente una vez por solicitud. Un decodificador genera candidatos. Un módulo de clasificación los puntúa según los mismos estados del codificador. Ningún componente utiliza funciones diseñadas a mano. Las entradas son campos de eventos registrados (ID de pista, ID de artista, duración, me gusta, tiempo de reproducción, marcas de superficie) e identificadores semánticos aprendidos

.

En los altavoces inteligentes Yandex, la reproducción puede comenzar sin que el usuario seleccione primero un artista, género o estado de ánimo. El equipo de investigación describe esto como una configuración basada únicamente en la recomendación

.

Cómo funciona la arquitectura de Sona

1. Tokenizador semántico

Siguiendo la formulación de identificación semántica de Rajput et al. , cada pista se convierte en una tupla de 3 códigos discretos. Un LLM multimodal congelado lee el espectrograma de melación de los primeros 90 segundos junto con el título, los artistas y las etiquetas. Funciona solo en modo de prellenado. Luego, un transformador de refinamiento de 4 capas alinea esas características con el comportamiento de escucha, utilizando InFonce en pares de pistas colaborativos. Residual K-means cuantifica el resultado en 3 libros de códigos de 32 000 entradas cada uno. Esto superó la línea base de audio del CLMR: Recall @1000 pasó

de 0,8111 a 0,8524.

2. Codificador con compresión de historial

Sona asiste a 8.192 eventos pasados. Prestar toda la atención a esa longitud es caro, por lo que el codificador utiliza la profundidad de forma desigual. Los 2.048 eventos recientes tienen una pila de autoatención de 7 capas. Los eventos más antiguos solo pasan por una capa de atención cruzada y por una capa de historial completo. El documento informa que esto mantiene la mayor parte de la calidad de la atención completa a aproximadamente la mitad del costo de la inferencia

.

3. Módulo decodificador y de clasificación

Un decodificador de 2 capas emite tuplas de identificación semántica mediante una búsqueda de haz restringida con un ancho de 1.024. Un árbol de catálogo bloquea los prefijos no válidos. Cada tupla se expande para incluir todas las pistas que la comparten. El módulo de clasificación, que consta de cuatro capas de atención cruzada, clasifica esas pistas comparándolas con la memoria del codificador compartida

.

Formación: un profesor que nunca hace envíos

El módulo de clasificación aprende de un clasificador de profesores congelado. El profesor es un transformador de 0,6 B de parámetros, que tampoco cuenta con funciones diseñadas a mano. Se entrena durante un año realizando eventos de interacción en dos etapas: preentrenamiento para predecir el siguiente objeto y, a continuación, ajustar la clasificación con varios jugadores. La eliminación de la fase previa al entrenamiento redujo la precisión de los pares ponderados

de 0,6215 a 0,6153.

El equipo llama a su método de destilación Rollout Distillation. Durante el entrenamiento, el decodificador actual genera haces candidatos. El profesor los puntúa junto con las impresiones registradas. El módulo de clasificación devuelve los puntajes con un error medio absoluto. La pérdida conjunta es L = L_NTP + L_rollout + L_impression. Ambas pérdidas actualizan el codificador compartido. A la hora de servir, el profesor es destituido

.

La capacitación permanece en línea. Los eventos se acumulan en sesiones durante un período de 15 minutos, alimentan a un entrenador con GPU y cada 10 minutos se reparten nuevos pesos por ración. La latencia de extremo a extremo es de 45 minutos en la mediana y de 60 minutos en el punto 99. El servicio se ejecuta en el servidor de inferencia Triton de NVIDIA con gráficos CUDA y alcanza el 41%

de utilización de los modelos FLOP.

Resultados: Prueba A/B en línea sobre tráfico en vivo

El experimento final duró 7 días con un 15% de usuarios seleccionados al azar por división. Todos los cambios que se indican a continuación son estadísticamente significativos y están relacionados con el control de producción

:
  • Usuarios activos (métrica principal): +4,53%
  • Tiempo total de escucha: +6,30%
  • Me gusta: +11,42%
  • Comandos de «repetición»: +17,99%
  • Usuarios muy comprometidos: +7,37%
  • Estas ganancias se suman a las mejoras conservadas en las implementaciones anteriores. En cuanto a los usuarios activos, la mejora de Sona es 2,35 veces mayor que el incremento del 1,93% que Argus ofrecía anteriormente

    en esta superficie.

    Sona, OneRec y HSTU: comparación de funciones

    Sona no es el primer recomendador generativo integral en producción. El OneRec de Kuaishou ya ofrece un único modelo de codificador-decodificador. En 2024, los HSTU Generative Recommenders de Meta redefinieron la recomendación como una transducción secuencial de las acciones de los usuarios. Lo que Sona combina es un sistema de clasificación completo en cascada, sin funciones diseñadas a mano y una clasificación resumida, validada

    en línea.
    ID Sí (ECPO) de un , , , , un , un , ,
    Función Sona (Yandex) OneRec (Kuaishou) HSTU GR (Meta)
    Domain Transmisión de música Vídeo corto Gran plataforma de Internet, múltiples superficies Un modelo servido reemplaza a la cascada Sí,
    en la prueba A/B Sí, alrededor del 25% del QPS total No, según se informa como una nueva arquitectura para los modelos de recomendación Las entradas del usuario
    Solo campos de eventos registrados, sin funciones diseñadas a mano Rutas de «ingeniería de funciones multiescala», que incluyen uid, edad, género Secuencias de acción del usuario (transducción secuencial)
    Salida del artículosemánticos de 3 niveles, 3 x 32 000 ID semánticos de 3 niveles a través de RQ-KMeans
    Señal de clasificación Producida a partir de 0.6 mil millones de profesores Ranker RL con modelo de recompensa P-Score (ECPO) Modelo de clasificación HSTU
    Aprendizaje por refuerzo No, totalmente supervisado
    No reportado
    Scale informóhistorial de 8.192 eventos, 0.6 mil millones de profesores10 veces más fracasos que el modelo de clasificación anterior1,5 billones de parámetros
    informó de una ganancia en línea4,53% de usuarios activos, un 6,30% de tiempo de escucha, un 11,42% de me gusta0,54% y un 1,24% de tiempo de estancia en la aplicaciónun 12,4% en las pruebas A/B en línea
    Código público o ponderaciones Nono está en el informe Sí, GitHub

    Fuentes : Sona, OneRec, HSTU. Las ganancias en línea provienen de diferentes plataformas y métricas, por lo que no son directamente comparables

    .

    Conclusiones clave

    • Sona reemplazó más de 15 generadores, clasificándolos previamente y clasificándolos por un modelo servido.
    • Sin funciones diseñadas a mano: solo los eventos registrados y los identificadores semánticos aprendidos.
    • Un maestro de 0.6 mil millones entrena al rankeador y luego se queda fuera de servicio.
    • Prueba A/B: +4,53% de usuarios activos, 2,35 veces la ganancia anterior de Argus.
    • No se puede implementar externamente: sin código ni ponderaciones, no con tráfico total.

    Preguntas frecuentes

    ¿Qué es Yandex Sona?
    Sona es un modelo de IA generativa que combina la generación de candidatos y la clasificación en un solo sistema. Yandex lo probó en un experimento de producción en directo de siete días con sus altavoces inteligentes, en el que sustituyó la línea de recomendaciones multietapa existente para el

    grupo de prueba. ¿En qué se diferencia Sona de OneRec?


    OneRec utiliza rutas de funciones diseñadas para el usuario y RL

    ¿Tiene un proyecto de software o plataforma SaaS en mente?

    Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.