Los investigadores de NVIDIA, junto con la Universidad de Princeton y la Universidad de Maryland, han presentado PivotPD, un método de destilación basado en políticas para agentes de LLM de varios turnos. La destilación basada en políticas de PivotPD entrena al agente para evitar el error inicial más perjudicial y, de todos modos, para que se recupere cuando ocurre. Con 13 puntos de referencia, obtiene el mejor promedio en ALFworld, WebShop y QA basado en búsquedas para estudiantes de Qwen3-1.7B y Qwen3-8B. La conclusión es que la recuperación se puede aprender y
la OPD estándar rara vez la enseña.TL; DR
- Tamaño: un método de entrenamiento, no un modelo. Probado en estudiantes de Qwen3-1.7B y Qwen3-8B, además de en un estudiante de Nemotron-3.5-SFT en SWE-Bench Verified.
- Funciona en: Se ha entrenado en nodos NVIDIA H100. Añade un coste de inferencia igual a cero, por lo que el agente capacitado se ejecuta dondequiera que se ejecute su modelo base .
- Rendimiento: primero en todos los 8 promedios por punto de referencia frente a 13 líneas de base, en 3 semillas.
- Mejor: se recupera del 72,7% de los errores fundamentales que se repiten, frente al 20,3% del OPD estándar.
- Lo peor: el 55,9% en las tareas de «aspecto» de AlfWorld con 1,7 mil millones de estudiantes, frente al 83,9% de SOD.
- En resumen: lo mejor: enseña la recuperación que RL no puede alcanzar si solo obtiene resultados. Lo peor: depende de los entornos en los que se pueda volver a jugar y de un profesor cuyos puntos de vista coincidan con los del oráculo en el 77,8% de los lanzamientos fallidos.
¿Qué es un error fundamental en un agente de varios turnos?
Un error fundamental es una acción que alarga el camino más corto que queda para terminar una tarea o la hace irresoluble. El oráculo simbólico de AlfWorld mide esto
en cada esquina.En las versiones Qwen3-8B, Qwen3-30B-A3B y Qwen3-235B-A22B, el 59% de las implementaciones fallidas (155 de 262) contenían una. El primer turno crucial llegó antes, con una mediana de 8 a 12 de un total de 30. Luego, los agentes desperdiciaron entre 18 y 21 turnos más sin recuperarse
.En las repeticiones de los fallos de la Qwen3-8B, corregir el giro fundamental aumentó el éxito del 8% al 59%. De todos modos, dejar el error en su lugar y forzar la acción correcta durante los 2 turnos siguientes alcanzó el 58%
.¿Por qué la destilación estándar basada en la política pasa por alto?
LaOPD estándar redujo la tasa de fallos retenidos del 79% al 56%. Los fallos tras un giro crucial solo cayeron del 51% al 49%. La acción correcta se mantuvo por debajo del 1% de probabilidad en cada giro crucial, por lo que 8 lanzamientos rara vez
la toman como muestra.La RL, basada en los resultados, comparte el punto ciego: si todos los lanzamientos fallan, la ventaja relativa del grupo es 0.
¿Cómo funciona PivotPD?
PivotPD agrega 3 componentes a la RL basada en grupos, combinados en una única actualización de PPO.
- Detección de cambios: un modelo docente más amplio lee cada implementación y su resultado en retrospectiva. Elige los turnos de los candidatos y nombra una acción prioritaria en cada uno de ellos. Un turno se considera crucial cuando la acción del alumno difiere de la acción dorada. En AlfWorld, los pivotes detectados caen a menos de 1 turno del giro del oráculo, lo que representa una media del 77,8% de los lanzamientos fallidos.
- Destilación preventiva (KL inversa): una copia congelada del alumno, con una insinuación con la acción dorada, resalta la propia respuesta del alumno. Esto aleja al estudiante del error cometido.
- Destilación de recuperación (KL hacia adelante): después de cada giro, el profesor nombra una acción de recuperación para un máximo de K. El autoprofesor con insinuaciones escribe las respuestas de recuperación, y el alumno sin pistas se entrena en ellas. Forward KL cubre en masa, por lo que levanta acciones que el estudiante casi nunca toma muestras.
El profesor solo nombra las acciones. Los objetivos a nivel simbólico provienen de la distribución sugerida por el propio estudiante
.¿Cuál es el rendimiento de PivotPD en las pruebas comparativas de los agentes?
Con 1,7 mil millones de estudiantes, PivotPD tiene un promedio del 73,7% en AlfWorld, 5,5 puntos por encima del SDAR. Su promedio es del 44,5% en el control de calidad basado en búsquedas, 5,9 puntos por encima del RLSD. En WebShop, supera a RLSD por un 1,2 en puntuación, pero por un 14,1 en tasa
de éxito (76,6%).Con 8 mil millones de alumnos, alcanza el 93,0% en AlfWorld, el 47,4% en el control de calidad basado en búsquedas y el 81,9% de éxito en WebShop. Los márgenes son
más pequeños, de al menos 1,8 puntos.Con Qwen3-8B como su propio profesor, PivotPD sigue ganando los 3 puntos de referencia por al menos 1,5 puntos, 3,9 de media.
73,0%.La recuperación es lo más destacado. De los 72 errores fundamentales repetidos, el PivotPD se recuperó el 72,7% de las veces, frente al 8,3% del modelo base, el 20,3% del OPD estándar y el 45,8% del modelo solo preventivo. La recuperación tuvo una media de 9,7 turnos, frente a un óptimo 6,2.