Perplexity ha lanzado pplx-embed-v2-late, un par de modelos de incrustación multimodal al estilo Colbert. Vienen en 2 tamaños: 0,6 B para consultas rápidas y económicas y 9 B para obtener la máxima calidad. Ambos modelos recuperan texto, imágenes y páginas PDF renderizadas, y comparten un
espacio de incrustación.¿Es desplegable? Sí, si lo alojas tú mismo. Ambos modelos están en Hugging Face bajo la licencia del MIT. Está previsto alojar un punto final de la API de Perplexity, pero no está activo
.TL; DR
El mejor
- El modelo de 0,6 mil millones usa alrededor de 340 millones de parámetros activos para las imágenes y se mantiene cerca de sus rivales de 8 mil millones.
- Se pueden buscar en un índice de 9 000 millones con 0,6 000 millones de consultas, lo que permite recuperar aproximadamente la mitad de la diferencia de calidad de 9 000 millones que presenta el texto con un coste de consulta de 0,6 000 millones.
- Sus vectores simbólicos de 128 dígitos son entre 16 y 32 veces más estrechos que los de sus rivales, de entre 2048 y 4096 dígitos.
- Licencia MIT, con uso comercial permitido.
Lo peor
- Almacena 1 vector por token, por lo que el tamaño del índice aumenta con la longitud del documento.
- No ocupa el puesto #1 en la recuperación de imágenes de VideoRe v3; el EVIE de Tencent obtiene una puntuación más alta.
- Una sola entrada no puede mezclar texto e imágenes.
- Todas las puntuaciones se publican automáticamente y el informe técnico aún no se ha publicado.
Tamaño del modelo y con qué se ejecuta
| Métricas | pplx-embed-v2-late-0.6b pplx-embed-v2-late-9b | Parámetros totales 594 M 9B (listas de caras abrazadas 8 B | ||
|---|---|---|---|---|
| ) Parámetros | activos | ~ 240 millones de texto, 340 M de imagen 7,4B | Modelo base | Qwen3,5-0,8 B|
| , reducido a 12 capas de texto Qwen3.5 | ||||
| GB | ||||
| ~16 a 18 GB Destinada | ||||
| : máquina | portátil, dispositivo periférico o GPU pequeña | ,centro de datos o GPU con gran capacidad de memoria | ||
| Función sugerida por Perplexity | :codificador de consultas en vivo, 100% local | Crear el índice de documentos |
Perplexity diseñó el modelo de 0,6 GB como un codificador de consultas ligero que también puede ejecutarse en dispositivos periféricos. Ambos modelos de tarjetas muestran el uso de la GPU CUDA. Necesitan transformadores de Los valores de memoria se calculan en 2 bytes por parámetro, solo para los pesos. Los puntos de control publicados se almacenan en F32, lo que duplica el tamaño de la descargaoración >= 6.0.0 y transformadores >= 5.4.0.
Qué tan bien funciona: mejores y peores puntuaciones
Todos los números que aparecen a continuación son del anuncio de Perplexity:
| Benchmark | 0.6B | 9B | Dónde se encuentra |
|---|---|---|---|
| MADQA (control de calidad de PDF agentic, precisión) | 90,1% | 92,4% (mejor)Supera al retriever de Mixedbread (88,9%) | ; sigue a Mixedbread Agentic Search (93,4%) |
| Texto específico de dominio (72 tareas, ndCG @10) | 78,0% | 81,3% | 9B lidera todos los modelos probados en 1,6 puntos; 0.6 B está 0,3 puntos por detrás de gemini-embedding-2|
| Q2D-Web (Recall @1000) | 73,6% | 74,8% | Ambos superaron la mejor imagen anterior de |
| ViDore v3 (ndCG @10) | 62,3% | 65,2% | 0,6 B está a 1,2 puntos porcentuales de nemotron-colembed-v2-8b; EVIE lidera |
| ViDore v3 Markdown (ndCG @10) | 61,2% (peor) | 64,7% | Ambos superaron a todos los modelos externos probados |
| BrowseComp+ (precisión) | No se dio | el 64,0% (peor)más bajo | )Sigue 4,9 puntos por encima del siguiente modelo de ColBert |
El resultado más sólido: 92,4% en MADQA, establecido por el modelo 9B. El mayor margen se encuentra en BrowseComp+, con 8,7 puntos porcentuales más que el
modelo más denso.El resultado más débil: 61,2% en VideoRe v3 Markdown, frente al modelo de 0,6 MB. Sigue siendo la segunda mejor puntuación en ese punto de referencia. La búsqueda de imágenes es la verdadera diferencia: Gemini Embedding 2 supera al modelo 9B en Miracl-Vision y 2 puntos porcentuales en el
PPLX-Q2I.Mezcla de tamaños: un índice de 9 000 millones consultado por el modelo de 0,6 000 millones obtuvo una puntuación del 63,5% en la recuperación de imágenes de VideoRe v3. Esta cifra supera al 62,3%, con 0,6 mil millones en ambos lados, con
el mismo coste de consulta.¿Cómo funciona
Los modelos densos comprimen un documento en un vector. En cambio, pplx-embed-v2-late conserva un vector de 128 dígitos para cada token. Se puntúa con MaxSim: cada token de consulta encuentra su mejor token de documento y esos valores máximos se suman. Las páginas se codifican como imágenes, por lo que no es necesario realizar ningún paso de OCR. Perplexity resumió ambos modelos de un profesor de 18 años que utilizó un entrenamiento a nivel simbólico al estilo LEAF. Esa formación es lo que crea el espacio compartido
.Mejores casos de uso
- La mejor opción es la búsqueda visual de documentos en PDF, diapositivas e informes escaneados.
- Búsqueda de baja latencia: indexa en la nube con 9 B y, a continuación, consulta en el dispositivo con 0,6 MB.
- RAG agentic sobre grandes colecciones web o PDF.
Explicador interactivo
&Cómo se compara
| Cuenta con | pplx-embed-v2 de NVIDIA nemotron-colembed-vl-8b-v2 Topk topk-embed-v1 Google Gemini Embedding 2 | , tamaño 0.6 B, 9 B ~ 8.8 B, 0.8 B | , 2 B abierto | ||
|---|---|---|---|---|---|
| No revelado | |||||
| Ancho vectorial | 128 por token | 4.096 por token | 2.048 por token (pequeño) | 128 a 3.072, | entradas | de 1 vector
| Texto, imágenes, renderizados de páginas | Consultas de texto, imágenes | depágina Texto, imágenes | de página Texto, imagen, vídeo, audio, PDF | ||
| Se ejecuta en | su GPU; 0,6 B en Edge | NVIDIA A100/H100, GPU Linux | CUDA (Ampere+) | Google API | |
| Espacio compartido en varios tamaños | Sí | No se indica | No se indica No se | aplica | |
| Licencia | MIT | CC-BY-NC-4.0 | Apache 2.0 | Propietario (pequeño) |
Conclusiones clave
- El modelo 0.6B se adapta a dispositivos Edge; el modelo 9B está diseñado para ofrecer una calidad de indexación.
- Mejor puntuación: 92,4% en MADQA. El más débil: 61,2% en VideoRe v3 Markdown .
- Los 0.6 mil millones de consultas sobre un índice de 9 mil millones superaron a los 0.6 mil millones en ambos lados.
- El crecimiento del almacenamiento y las puntuaciones autodeclaradas son las principales advertencias.
Consulte los pesos del modelo en HF y los detalles técnicos. Todo el mérito es del investigador de este proyecto. Además, siéntete libre de seguirnos en Twitter y no olvides unirte a nuestro subReddit de más de 150 000 ml y suscribirte a nuestro boletín. ¡Espera! ¿Estás en Telegram? ahora también puedes unirte a nosotros en Telegram.
gratuitas.The post Perplexity AI lanza pplx-embed-v2-late: un modelo Edge de 0.6 mil millones y un modelo de 9 mil millones con una puntuación del 92,4% en MADQA appeared first on MarkTechPost.