Sakana AI ha publicado Beyond Imitation, un artículo de investigación de TMLR sobre la revisión por pares asistida por LLM en torno a la detección de errores. La mayoría de los revisores de IA reciben una calificación en función del grado de fidelidad con el que copian las reseñas humanas. Este trabajo plantea una pregunta más difícil: ¿puede un revisor basado en IA encontrar un error cometido? El equipo de investigación presenta dos piezas: un sistema de comparación de contradicciones y un sistema de revisión multicapa (MLR). Para los desarrolladores que crean agentes de investigación, la lección es práctica. Tanto el diseño del sistema como la elección del modelo impulsan la detección de errores.

TL; DR

  • Tamaño: 1164 contradicciones insertadas en 257 artículos de 5 sedes. MLR lee hasta 10 páginas del texto principal
  • .
  • Funciona con: modelos API estándar (Claude Sonnet 4, Claude Haiku 3.5). Sin GPU, sin ajustes. Aproximadamente 0,47$ por
  • reseña.
  • Rendimiento: la detección de errores más alta de los 4 sistemas probados, con puntuaciones alineadas con los humanos.
  • El mejor: detectó el 73,43% de los errores principales en 4 revisiones, frente al 14,81% que obtuvo el mejor punto de referencia.
  • Lo peor: solo un 16,11% de coincidencias exactas en artículos reales de arXiv retractados.
  • En pocas palabras:
    • Lo mejor: lee antes de juzgar y encuentra errores mucho más graves.
    • Lo peor: todavía cae en la trampa de la inyección inmediata oculta.

¿Qué es la revisión multicapa?

La revisión multicapa es un sistema de revisión mediante IA basado en agencias de Sakana AI que comprende un trabajo de investigación antes de criticarlo. Utiliza 3 agentes en los modelos Claude disponibles en el mercado

:
  • Agente del apéndice (Claude Haiku 3.5): resume los experimentos y los detalles de implementación del apéndice.
  • Literature Review Agent (Claude Sonnet 4): utiliza una búsqueda en la web para colocar el artículo en un trabajo anterior. Es opcional
  • .
  • Review Agent (Claude Sonnet 4): ejecuta una cadena de tres pasos inspirada en el enfoque de tres pasos de Keshav.
El

pase 1 escribe un esquema de alto nivel. El paso 2 lee en detalle y señala las debilidades, suposiciones y lagunas. El pase 3 combina todos los resultados de los agentes en puntos fuertes, puntos débiles, preguntas, recomendaciones, puntuaciones y una lista de tareas pendientes. El PDF se pasa directamente, por lo que las figuras y ecuaciones sobreviven

.

¿Cómo funciona el Contradiction Benchmark?

El índice de referencia convierte los errores en artículos reales y comprueba si los revisores los detectan. El equipo de investigación recopiló 257 artículos con licencia CC de ACL, AISTATS, CVPR e ICML 2025, además

de NeuRIPS 2024.

Gemini 2.5 Pro crea un gráfico de conocimiento con las afirmaciones, las pruebas y los métodos de cada artículo. La distancia entre un nodo y una «reclamación principal» determina la gravedad. La distancia 0 afecta a una afirmación principal; las distancias más grandes afectan a los detalles. Luego, el GPT-4.1 reescribe 1 nodo por distancia para convertirlo en una contradicción, lo que arroja

1164 puntos de datos.

Un juez de o3 puntúa cada reseña 10 veces. En papel limpio, alcanzó una precisión del 99,9%. Mostró una sensibilidad del 86,8% en las capturas confirmadas manualmente, por lo que las puntuaciones notificadas pueden ser conservadoras

.

¿Qué tan bien detecta la MLR los errores?

El MLR lideró todos los puntos de referencia del índice de referencia. Con 4 reseñas, captó el 73,43% de las contradicciones con respecto a la distancia cero y el 40,95% en general. La mejor referencia, AgentReview, arrojó un 14,81% en la distancia 0. Una sola revisión de MLR

aún arrojó un 60,79%.

Una ablación separa el modelo del diseño. Al cambiar el GPT-4.1 por Claude Sonnet 4 en LLM-Review, la detección a distancia 0 pasó del 14,56% al 35,40%. El diseño de MLR sumó unos 25 puntos más en una sola reseña. La precisión disminuye a medida que aumenta la distancia entre los nodos, lo que respalda la puntuación de gravedad

.

En los artículos reales retractados de WithdrarXIV-Check (211 artículos), las ganancias se reducen. MLR obtuvo un 26,07% en partidos «similares» y un 16,11% en partidos «exactos». Las bases de referencia más sólidas obtuvieron un 18,48% y un 9,00%

.
&&&

¿Está MLR de acuerdo con los revisores humanos?

En cuanto a las puntuaciones, en su mayoría sí. En las presentaciones de la ICLR 2025, las puntuaciones previstas por la MLR alcanzaron una correlación de Pearson de 0,586 con las puntuaciones humanas. La referencia de persona a persona fue de 0,742. En ICML 2025, el AI Reviewer la superó, 0,439 frente a 0,429.

En el enfoque, no. La MLR hace hincapié en la validez y los experimentos, mientras que los humanos valoran más la claridad y la novedad. Los autores enmarcan esto como una perspectiva complementaria, no como una sustitutiva

.

¿Cuánto cuesta funcionar?

La MLR cuesta alrededor de 0,47 USD por reseña, sin incluir el agente bibliográfico opcional. Utiliza 189.062 fichas de entrada, aproximadamente la mitad de las 403.654 de AI Reviewer. Una variante con un solo uso inmediato redujo los costos en aproximadamente dos tercios. Su detección se redujo alrededor de 3,5 puntos en un subconjunto del índice de referencia

.

¿Cómo se compara MLR con otros revisores de IA?

LLM 0. 538 a
Artículo MLR (Sakana AI) LLM-Review AI Reviewer AgentReview
utilizado en este estudio Claude Sonnet 4 + Haiku
3.5 GPT-4.1 o4-mini GPT-4o Design 3 agentes, cadena de 3 pasos
rápido, texto truncado conjunto de 5 reseñas, meta-revisión, reflexión Revisor, autor, presidente de área roles
Contradiction Benchmark, completo 40,95% (4 reseñas) 6,39% 6,50% 5,95%
Errores de afirmación principal (distancia 0) 73,43% 14,56% 11,17% 14,81%
WidrarXiv-check, similar/exacto 26,07%/16,11% 5,21%/2,37% 13,74%/9,00% 18,48%/5,69%
ICLR 2025 Pearson vs humano 0,586 -0,013 0.195
Fichas de entrada por reseña 189.062 6.517 403.654 310.964
Coste por reseña ~0,47 $ ~0,01 ~0,49 ~0,81
Abrir códigopetición Sí Sí

Todas las cifras referenciales, de correlación, simbólicas y de costes provienen del artículo Beyond Imitation.

Conclusiones clave

  • Sakana AI califica a los revisores de IA por detectar errores, no por copiar
  • a los humanos.
  • La MLR detectó el 73,43% de los errores principales en las reclamaciones, aproximadamente 5 veces más que el mejor punto de referencia.
  • El cambio de modelo y el diseño de 3 pasos aumentan considerablemente la detección.
  • Los errores reales en papel retráctil siguen siendo evidentes: el 16,11% de coincidencias exactas.
  • La inyección de mensajes ocultos aún influye en todos los revisores de IA que han realizado pruebas.


Consulte el documento aquí. Todo el mérito es para el investigador de este proyecto. Además, siéntete libre de seguirnos en Twitter y no olvides unirte a nuestro subReddit de más de 150 000 ml y suscribirte a nuestro boletín. ¡Espera! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.

The post El sistema de revisión por pares de LLM de Sakana AI detecta el 73% de los errores principales en las reclamaciones aparecidas primero en MarkTechPost.

¿Tiene un proyecto de software o plataforma SaaS en mente?

Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.