Perplexity ha lanzado pplx-embed-v2-late, un par de modelos de incrustación multimodal al estilo Colbert. Vienen en 2 tamaños: 0,6 B para consultas rápidas y económicas y 9 B para obtener la máxima calidad. Ambos modelos recuperan texto, imágenes y páginas PDF renderizadas, y comparten un

espacio de incrustación.

¿Es desplegable? Sí, si lo alojas tú mismo. Ambos modelos están en Hugging Face bajo la licencia del MIT. Está previsto alojar un punto final de la API de Perplexity, pero no está activo

.

TL; DR

El mejor

  • El modelo de 0,6 mil millones usa alrededor de 340 millones de parámetros activos para las imágenes y se mantiene cerca de sus rivales de 8 mil millones.
  • Se pueden buscar en un índice de 9 000 millones con 0,6 000 millones de consultas, lo que permite recuperar aproximadamente la mitad de la diferencia de calidad de 9 000 millones que presenta el texto con un coste de consulta de 0,6 000 millones.
  • Sus vectores simbólicos de 128 dígitos son entre 16 y 32 veces más estrechos que los de sus rivales, de entre 2048 y 4096 dígitos.
  • Licencia MIT, con uso comercial permitido.

Lo peor

  • Almacena 1 vector por token, por lo que el tamaño del índice aumenta con la longitud del documento.
  • No ocupa el puesto #1 en la recuperación de imágenes de VideoRe v3; el EVIE de Tencent obtiene una puntuación más alta.
  • Una sola entrada no puede mezclar texto e imágenes.
  • Todas las puntuaciones se publican automáticamente y el informe técnico aún no se ha publicado.

Tamaño del modelo y con qué se ejecuta

~ 240 millones de texto, 340 M de imagen 7,4 Qwen3,5-0,8 B Salida 128 atenuaciones por token 128 tenues por token Pesos en memoria (bf16, nuestra estimación) ~1,2, :
Métricas pplx-embed-v2-late-0.6b pplx-embed-v2-late-9b Parámetros totales 594 M 9B (listas de caras abrazadas 8 B
) Parámetros activos B Modelo base
, reducido a 12 capas de texto Qwen3.5
GB
~16 a 18 GB Destinada
: máquina portátil, dispositivo periférico o GPU pequeñacentro de datos o GPU con gran capacidad de memoria
Función sugerida por Perplexitycodificador de consultas en vivo, 100% local Crear el índice de documentos

Perplexity diseñó el modelo de 0,6 GB como un codificador de consultas ligero que también puede ejecutarse en dispositivos periféricos. Ambos modelos de tarjetas muestran el uso de la GPU CUDA. Necesitan transformadores de oración >= 6.0.0 y transformadores >= 5.4.0. Los valores de memoria se calculan en 2 bytes por parámetro, solo para los pesos. Los puntos de control publicados se almacenan en F32, lo que duplica el tamaño de la descarga

.

Qué tan bien funciona: mejores y peores puntuaciones

Todos los números que aparecen a continuación son del anuncio de Perplexity:

92,4% (mejor) 9B lidera todos los modelos probados en 1,6 puntos; 0.6 B está 0,3 puntos por detrás de gemini-embedding-2Q2D-Web (Recall @1000) el 64,0% (peor))
Benchmark 0.6B 9B Dónde se encuentra
MADQA (control de calidad de PDF agentic, precisión) 90,1% Supera al retriever de Mixedbread (88,9%); sigue a Mixedbread Agentic Search (93,4%)
Texto específico de dominio (72 tareas, ndCG @10) 78,0% 81,3%
73,6% 74,8% Ambos superaron la mejor imagen anterior de
ViDore v3 (ndCG @10) 62,3% 65,2% 0,6 B está a 1,2 puntos porcentuales de nemotron-colembed-v2-8b; EVIE lidera
ViDore v3 Markdown (ndCG @10) 61,2% (peor) 64,7% Ambos superaron a todos los modelos externos probados
BrowseComp+ (precisión) No se dio más bajo Sigue 4,9 puntos por encima del siguiente modelo de ColBert

El resultado más sólido: 92,4% en MADQA, establecido por el modelo 9B. El mayor margen se encuentra en BrowseComp+, con 8,7 puntos porcentuales más que el

modelo más denso.

El resultado más débil: 61,2% en VideoRe v3 Markdown, frente al modelo de 0,6 MB. Sigue siendo la segunda mejor puntuación en ese punto de referencia. La búsqueda de imágenes es la verdadera diferencia: Gemini Embedding 2 supera al modelo 9B en Miracl-Vision y 2 puntos porcentuales en el

PPLX-Q2I.

Mezcla de tamaños: un índice de 9 000 millones consultado por el modelo de 0,6 000 millones obtuvo una puntuación del 63,5% en la recuperación de imágenes de VideoRe v3. Esta cifra supera al 62,3%, con 0,6 mil millones en ambos lados, con

el mismo coste de consulta.

¿Cómo funciona

Los modelos densos comprimen un documento en un vector. En cambio, pplx-embed-v2-late conserva un vector de 128 dígitos para cada token. Se puntúa con MaxSim: cada token de consulta encuentra su mejor token de documento y esos valores máximos se suman. Las páginas se codifican como imágenes, por lo que no es necesario realizar ningún paso de OCR. Perplexity resumió ambos modelos de un profesor de 18 años que utilizó un entrenamiento a nivel simbólico al estilo LEAF. Esa formación es lo que crea el espacio compartido

.

Mejores casos de uso

  • La mejor opción es la búsqueda visual de documentos en PDF, diapositivas e informes escaneados.
  • Búsqueda de baja latencia: indexa en la nube con 9 B y, a continuación, consulta en el dispositivo con 0,6 MB.
  • RAG agentic sobre grandes colecciones web o PDF.

Explicador interactivo

&

Cómo se compara

de 1 vector de
Cuenta con pplx-embed-v2 de NVIDIA nemotron-colembed-vl-8b-v2 Topk topk-embed-v1 Google Gemini Embedding 2 , tamaño 0.6 B, 9 B ~ 8.8 B, 0.8 B
, 2 B abierto
No revelado
Ancho vectorial 128 por token 4.096 por token 2.048 por token (pequeño) 128 a 3.072, entradas
Texto, imágenes, renderizados de páginas Consultas de texto, imágenespágina Texto, imágenes de página Texto, imagen, vídeo, audio, PDF
Se ejecuta en su GPU; 0,6 B en Edge NVIDIA A100/H100, GPU Linux CUDA (Ampere+) Google API
Espacio compartido en varios tamaños Sí No se indica No se indica No se aplica
Licencia MIT CC-BY-NC-4.0 Apache 2.0 Propietario (pequeño)

Conclusiones clave

  • El modelo 0.6B se adapta a dispositivos Edge; el modelo 9B está diseñado para ofrecer una calidad de indexación.
  • Mejor puntuación: 92,4% en MADQA. El más débil: 61,2% en VideoRe v3 Markdown
  • .
  • Los 0.6 mil millones de consultas sobre un índice de 9 mil millones superaron a los 0.6 mil millones en ambos lados.
  • El crecimiento del almacenamiento y las puntuaciones autodeclaradas son las principales advertencias.


Consulte los pesos del modelo en HF y los detalles técnicos. Todo el mérito es del investigador de este proyecto. Además, siéntete libre de seguirnos en Twitter y no olvides unirte a nuestro subReddit de más de 150 000 ml y suscribirte a nuestro boletín. ¡Espera! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.

[Patrocinado] La web es la única API que le falta a la mayoría de los agentes. Las bases de datos, los calendarios y los repositorios tienen API. La web abierta en su mayoría no las tiene. El servidor MCP de TinyFish proporciona a cualquier cliente de MCP cuatro herramientas: TinySearch, TinyFetch (páginas completas en formato Markdown, incluido JavaScript), TinyBrowser para inicios de sesión y formularios y TinyAgent para trabajos de varios pasos. La búsqueda y la búsqueda son

gratuitas.

The post Perplexity AI lanza pplx-embed-v2-late: un modelo Edge de 0.6 mil millones y un modelo de 9 mil millones con una puntuación del 92,4% en MADQA appeared first on MarkTechPost.

¿Tiene un proyecto de software o plataforma SaaS en mente?

Hable directamente con nuestros arquitectos de software en SoftAndino. Le brindamos asesoría técnica y cotización inmediata sin compromiso.