Liquid AI ha lanzado Open d1, dos modelos multimodales de peso abierto en su familia de modelos de decisión d1. El D1-3b lee texto e imágenes. El D1-Omni-600m lee texto con una imagen o texto con audio. Ninguno de los modelos escribe texto. Cada uno devuelve respuestas calibradas y mecanografiadas en una sola pasada sin ningún resultado. El objetivo son las decisiones en tiempo real sobre la gama NVIDIA: servidores DGX, estaciones de trabajo RTX
y placas Jetson Edge.¿Se puede implementar? ¿Sí?. Ambos puntos de control están en Hugging Face, se cargan en Transformers y son compatibles con llama.cpp desde el primer día. La versión 1.0 de la licencia abierta de LFM permite un uso comercial gratuito por debajo de los 10 millones de dólares de ingresos anuales. D1-omni-600m
es una de las primeras versiones de investigación sin cifras de latencia publicadas.¿Qué es un modelo de decisión?
Un LLM generativo escribe su respuesta ficha por ficha y tu código la analiza. Un modelo de decisión toma un estado y un conjunto de preguntas con nombre. Las lee una vez y devuelve una probabilidad por cada respuesta permitida. La IA de Liquid define tres tipos de preguntas:
- noul: una pregunta de sí o no, devuelta como P (sí).
- elección: una etiqueta de las opciones nombradas, con una distribución de probabilidad completa.
- puntuación: posición ponderada por probabilidad en una rúbrica ordenada de 2 a 10 niveles.
Varias preguntas pueden compartir un estado en una sola llamada. Cada respuesta indica output_tokens: 0. Liquid AI recomienda d1 para el enrutamiento, la moderación, la clasificación de intenciones, el cambio de clasificación, la puntuación de LLM como juez, las barreras de protección de los agentes y la inspección visual. Ninguno de los
¿Cómo se construyen los modelos D1-3b y D1-omni-600m?
El D1-3b tiene 3,12 B de parámetros y parte del LFM2.5-VL-3B, un modelo de lenguaje visual exclusivo para decodificadores. Liquid AI calculó un promedio de los pesos de LFM2.5-2.6B con la estructura de texto de ese modelo. A continuación, ajustó varios puntos de control con diferentes semillas y mezclas de datos, y los volvió a combinar. Utiliza un codificador de visión SigliP2 NaFlex de 400 M y un contexto de 32.768 fichas. Las entradas largas, las opciones de respuesta mezcladas y la corrección de los atajos de datos eran más importantes que las técnicas avanzadas
.El D1-Omni-600m tiene 587 millones de parámetros y comienza con el LFM2.5-Encoder-350m, un codificador bidireccional. Esto incluye un cabezal de toma de decisiones y troncal compartidos de 381 M, un codificador de visión de 94 M y un codificador de audio de 112 M. El codificador de audio es un FastConformer de 17 capas. El contexto es de 16.384 fichas. Los clips de audio tienen un límite de 30 segundos. Una solicitud contiene imágenes o audio, nunca ambos. La capacitación en audio solo cubría las solicitudes de personas de habla inglesa a asistente
.¿Dónde encaja mejor Open d1?
- Soporte y clasificación de tickets: una llamada D1-3b puede responder a un cheque de reembolso de sí o no, elegir el equipo propietario y calificar la urgencia en lugar del mismo mensaje, sin ningún token de salida que analizar.
- Inspección visual y moderación en tiempo real: D1-3b lee una imagen de 384 píxeles en 35 ms en Jetson AGX Thor, y Open d1 Arcade, de Liquid AI, la ejecuta cuadro por cuadro con la entrada de una cámara en directo para moderar el contenido y controlar los gestos.
- Enrutamiento mediante comandos de voz en dispositivos pequeños: el D1-Omni-600m captura hasta 30 segundos de la voz junto con el texto y devuelve directamente la intención o el tema del orador. Su tarjeta incluye el enrutamiento de comandos de voz y las barreras de protección contra agentes entre los usos recomendados .
¿Cómo funciona d1 en los puntos de referencia?
En el Decision Index v0.2.1, D1-3b obtiene una puntuación de 48,57. Esto supera a todos los modelos de menos de 10 B y supera al Decider 35B-A3B (47,11). Solo el Winnow-12B obtiene una puntuación más alta, con 50,02. Liquid AI obtuvo la puntuación oficial en sí misma, por lo que las puntuaciones de d1 no corresponden a las posiciones de clasificación. D1-3b lidera las categorías de Herramientas (74,5) y Artes (36,3), pero está por detrás de Conocimiento (23,8
).En siete puntos de referencia de texto públicos, D1-3b tiene un promedio de 82,9, por delante del Decider 4B con 81,1. D1-omni-600m tiene un promedio de 78,4 y publica las puntuaciones más altas de Civil Comments (95,8) y PAWS-X (79,5). En 11 pruebas de imagen, el D1-3b tiene un promedio de 74,1 frente a 73,9 de su modelo base. Liquid AI considera que los puntos de referencia para las decisiones de audio son
un problema abierto.¿Qué velocidad tiene el D1-3b en el hardware de NVIDIA?
Liquid AI midió la latencia de extremo a extremo, una solicitud activa a la vez. Una pregunta requiere 8 ms en una RTX 4090 y 9 ms en una AMD MI325X. En Jetson, AGX Thor tarda 16 ms, AGX Orin tarda 26 ms y Orin Nano tarda 50 ms. En el Jetson AGX Thor, tres preguntas en un estado tardan 20 ms frente a 16 ms en una. La figura del RTX 4090 usa model.compile (mode="reduce-overhead»). Sin ella, una pregunta tarda 16 ms. El laboratorio de inteligencia artificial Jetson de NVIDIA también alberga guías D1-3b.
¿Cómo se compara Open d1 con otros modelos de decisión abiertos?
| Función | D1-3B | D1-Omni-600m | Decider 4B Decider 35B-A3B Winnow-12B | Maker | Liquid AI Liquid AI | Mapika (independiente)Mapika (independiente) | EldanRing (independiente) | Parámetros | 3,12B | |
|---|---|---|---|---|---|---|---|---|---|---|
| LFM2.5-VL-3B | ||||||||||
| LFM2.5-Codificador-350m | Qwen3.5-4B-Base | |||||||||
| Qwen3.5-35B-A3B-Base | Gemma 4 12B IT | Introduce|||||||||
| texto, imágenes | Texto + imagen o | texto | + audioTexto | Texto, imágenes | ||||||
| Contexto | 32.768 | 16.384 | Estado | de32 000 fichas Estado | 65.536 (probado en el último trimestre) | |||||
| Índice de decisiones v0.2.1 | 48.57 | 15.95 | 40.70 | 47.11 | 50.02 | |||||
| Licencia | LFM Open v1.0 | Apache 2.0 | Apache 2.0 | Apache 2.0 | ||||||
| latencia | 8 ms por pregunta, RTX 4090 | no publicado | 5,2 ms por solicitud de 3 preguntas, B300 47 ms por solicitud | de 3 preguntas, B300 143 ms por solicitud | de 4 preguntas en caché de 143 ms cerca de un contexto de 64 000, RTX 5070 Ti |
Fuentes: tarjetas modelo D1-3b, D1-Omni-600m, Decider 4B, Decider 35B-A3B y Winnow-12B. Indexe las puntuaciones tal y como figuran en las tarjetas d1. Las latencias utilizan diferentes cargas de trabajo y hardware, por lo que no son directamente comparables
.¿Cómo se ejecuta d1 localmente?
D1-3b necesita transformadores>=5.14 y TRUST_REMOTE_CODE=true. D1-omni-600m necesita transformadores>=5.15.Ambos muestran Liquid AI recomienda float16 para D1-omni-600M en GPU, ya que bfloat16 cambió algunas de las respuestas principales. Puedes probar diez demos del D1-3b con cámara en el espacio Open d1 Arcade. Con NVIDIA, Liquid AI también mostró a D1-3bsystem_one (state, questions) para un estado y system_one_batch para las solicitudes empaquetadas.
Conclusiones clave
- Los modelos d1 generan probabilidades sobre opciones fijas en una sola pasada, nunca generan tokens.
- D1-3b obtiene una puntuación de 48,57 en el índice de decisión v0.2.1, el mejor resultado por debajo de 10 B.
- El D1-3b responde a una pregunta en 8 ms en una RTX 4090.
- El D1-Omni-600M maneja texto con imágenes o audio con 587M de parámetros.
- La licencia es gratuita para uso comercial por debajo de los 10 millones de dólares de ingresos anuales.
Consulta el D1-3b, el D1-omni-600m y los detalles técnicos. Todo el mérito es para la r