Los investigadores de NVIDIA, junto con la Universidad de Princeton y la Universidad de Maryland, han presentado PivotPD, un método de destilación basado en políticas para agentes de LLM de varios turnos. La destilación basada en políticas de PivotPD entrena al agente para evitar el error inicial más perjudicial y, de todos modos, para que se recupere cuando ocurre. Con 13 puntos de referencia, obtiene el mejor promedio en ALFworld, WebShop y QA basado en búsquedas para estudiantes de Qwen3-1.7B y Qwen3-8B. La conclusión es que la recuperación se puede aprender y

la OPD estándar rara vez la enseña.

TL; DR

  • Tamaño: un método de entrenamiento, no un modelo. Probado en estudiantes de Qwen3-1.7B y Qwen3-8B, además de en un estudiante
  • de Nemotron-3.5-SFT en SWE-Bench Verified.
  • Funciona en: Se ha entrenado en nodos NVIDIA H100. Añade un coste de inferencia igual a cero, por lo que el agente capacitado se ejecuta dondequiera que se ejecute su modelo base
  • .
  • Rendimiento: primero en todos los 8 promedios por punto de referencia frente a 13 líneas de base, en 3 semillas.
  • Mejor: se recupera del 72,7% de los errores fundamentales que se repiten, frente al 20,3% del OPD estándar.
  • Lo peor: el 55,9% en las tareas de «aspecto» de AlfWorld con 1,7 mil millones de estudiantes, frente al 83,9% de SOD.
  • En resumen: lo mejor: enseña la recuperación que RL no puede alcanzar si solo obtiene resultados. Lo peor: depende de los entornos en los que se pueda volver a jugar y de un profesor cuyos puntos de vista coincidan con los del oráculo en
  • el 77,8% de los lanzamientos fallidos.

¿Qué es un error fundamental en un agente de varios turnos?

Un error fundamental es una acción que alarga el camino más corto que queda para terminar una tarea o la hace irresoluble. El oráculo simbólico de AlfWorld mide esto

en cada esquina.

En las versiones Qwen3-8B, Qwen3-30B-A3B y Qwen3-235B-A22B, el 59% de las implementaciones fallidas (155 de 262) contenían una. El primer turno crucial llegó antes, con una mediana de 8 a 12 de un total de 30. Luego, los agentes desperdiciaron entre 18 y 21 turnos más sin recuperarse

.

En las repeticiones de los fallos de la Qwen3-8B, corregir el giro fundamental aumentó el éxito del 8% al 59%. De todos modos, dejar el error en su lugar y forzar la acción correcta durante los 2 turnos siguientes alcanzó el 58%

.

¿Por qué la destilación estándar basada en la política pasa por alto?

La

OPD estándar redujo la tasa de fallos retenidos del 79% al 56%. Los fallos tras un giro crucial solo cayeron del 51% al 49%. La acción correcta se mantuvo por debajo del 1% de probabilidad en cada giro crucial, por lo que 8 lanzamientos rara vez

la toman como muestra.

La RL, basada en los resultados, comparte el punto ciego: si todos los lanzamientos fallan, la ventaja relativa del grupo es 0.

¿Cómo funciona PivotPD?

PivotPD agrega 3 componentes a la RL basada en grupos, combinados en una única actualización de PPO.

  1. Detección de cambios: un modelo docente más amplio lee cada implementación y su resultado en retrospectiva. Elige los turnos de los candidatos y nombra una acción prioritaria en cada uno de ellos. Un turno se considera crucial cuando la acción del alumno difiere de la acción dorada. En AlfWorld, los pivotes detectados caen a menos de 1 turno del giro del oráculo, lo que representa una media del 77,8% de los lanzamientos
  2. fallidos.
  3. Destilación preventiva (KL inversa): una copia congelada del alumno, con una insinuación con la acción dorada, resalta la propia respuesta del alumno. Esto aleja al estudiante del error cometido.
  4. Destilación de recuperación (KL hacia adelante): después de cada giro, el profesor nombra una acción de recuperación para un máximo de K. El autoprofesor con insinuaciones escribe las respuestas de recuperación, y el alumno sin pistas se entrena en ellas. Forward KL cubre en masa, por lo que levanta acciones que el estudiante casi
  5. nunca toma muestras.

El profesor solo nombra las acciones. Los objetivos a nivel simbólico provienen de la distribución sugerida por el propio estudiante

.

¿Cuál es el rendimiento de PivotPD en las pruebas comparativas de los agentes?

Con 1,7 mil millones de estudiantes, PivotPD tiene un promedio del 73,7% en AlfWorld, 5,5 puntos por encima del SDAR. Su promedio es del 44,5% en el control de calidad basado en búsquedas, 5,9 puntos por encima del RLSD. En WebShop, supera a RLSD por un 1,2 en puntuación, pero por un 14,1 en tasa

de éxito (76,6%).

Con 8 mil millones de alumnos, alcanza el 93,0% en AlfWorld, el 47,4% en el control de calidad basado en búsquedas y el 81,9% de éxito en WebShop. Los márgenes son

más pequeños, de al menos 1,8 puntos.

Con Qwen3-8B como su propio profesor, PivotPD sigue ganando los 3 puntos de referencia por al menos 1,5 puntos, 3,9 de media.

En SWE-Bench Verified, un alumno de Nemotron-3.5-SFT enseñado por Nemotron-3-Super pasó del 62,8% al 66,0%. La OPD estándar alcanzó el 63,0% y el profesor obtuvo una puntuación del

73,0%.

La recuperación es lo más destacado. De los 72 errores fundamentales repetidos, el PivotPD se recuperó el 72,7% de las veces, frente al 8,3% del modelo base, el 20,3% del OPD estándar y el 45,8% del modelo solo preventivo. La recuperación tuvo una media de 9,7 turnos, frente a un óptimo 6,2.

¿Cómo se compara PivotPD con otros métodos de destilación de agentes?

el principio La Se 37.5 38.6 , Qwen3-1.7B 10,1 68,0 57,0
Metrics PivotPD OPSD (OPD estándar) OPID SDAR RLSD
Idea básica Prevenir y recuperarse cuando el profesor detecta giros fundamentales Privilegiado de autoprofesor en cada respuesta Habilidades jerárquicas desde
retrospectiva de políticas OPSD como pérdida auxiliar controlada por sigmoidesautodestilación establece el tamaño de actualización, RLVR establece la dirección
entrena según las respuestas de recuperación escritas por el profesor Sí (adelante KL) No No No No No
AlfWorld avg, Qwen3-1.7B 73.7 12.4 61.3 68.2 60.7
Search QA avg, Qwen3-1.7B 44.5 36.8 37.1WebShop success 76.6
62.5
AlfWorld avg, Qwen3-8B 93.0 46.7 83.7 83.8 90.8
Código Próximamente GitHub GitHub No revelado No revelado

Fuente de puntuación: Tabla 1 de PivotPD.

¿Cuánto cuesta la formación? ¿Se puede ejecutar?

PivotOPD solo cambia la formación, por lo que la inferencia no supone ningún coste adicional. En AlfWorld, con 1,7 mil millones de estudiantes y 4 GPU H100, la sobrecarga respecto al GRPO es del 12,4%, con K = 1. Se eleva al 94,2% con K = 2, ya que los turnos de recuperación posteriores requieren la reproducción en el entorno. El presupuesto seleccionado es K = 2 en AlfWorld y K = 1 en WebShop y QA basado en

búsquedas.

Conclusiones clave

  • Más de la mitad de las implementaciones fallidas de agentes se deben a un error temprano recuperable.
  • El OPD estándar apenas aborda estos errores: entre el 51 y el 49%.
  • PivotOPD se recupera del 72,7% de los errores repetidos, frente al 20,3% del OPD.
  • Mejor promedio con 13 puntos de referencia en AlfWorld, WebShop y Search QA.
  • No hay ninguna carga de inferencia, pero el código aún no se ha publicado.


Consulte el documento y la página del proyecto. Todo el mérito es para el investigador de este proyecto. Además, siéntete libre de seguirnos en Twitter y no olvides unirte a nuestro subReddit de más de 150 000 ml y suscribirte a nuestro boletín. ¡Espera! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.

[Patrocinado] La web es la única API que le falta a la mayoría de los agentes. Las bases de datos, los calendarios y los repositorios tienen API. La web abierta en su mayoría no las tiene. El servidor MCP de TinyFish proporciona a cualquier cliente de MCP cuatro herramientas: TinySearch, TinyFetch (páginas completas en formato Markdown, incluido JavaScript), TinyBrowser para inicios de sesión y formularios y TinyAgent para trabajos de varios pasos. La búsqueda y la búsqueda son

gratuitas.

The post NVIDIA PivotPD enseña a los agentes de IA de varios turnos a recuperarse de errores fundamentales appeared first on MarkTechPost.

¿Tiene un proyecto de software o plataforma SaaS en mente?

Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.