NOVEDADES + GUÍA PRÁCTICA
LFM2.5-VL-DSpark acelera modelos de visión-lenguaje con decodificación especulativa
Liquid AI ha presentado LFM2.5-VL-DSpark, un modelo borrador experimental diseñado para añadir decodificación especulativa a su modelo de visión-lenguaje LFM2.5-VL-3B, logrando incrementos sustanciales de velocidad en dispositivos locales y centros de datos.
Qué cambia
El lanzamiento introduce un modelo borrador simplificado de atención con cuatro capas y un número aproximado de 280 millones de parámetros, lo que incrementa el recuento total del modelo principal en un 8.9%. Utiliza la misma arquitectura que los borradores de texto de la compañía para capturar los estados ocultos y proponer bloques de tokens candidatos.
La solución cuenta con compatibilidad desde el primer día para herramientas y entornos como llama.cpp, MLX-VLM y SGLang. Las pruebas realizadas muestran mejoras significativas tanto en entornos de borde, como en equipos con silicio de Apple, como en procesadores gráficos de centros de datos.
Por qué importa
Las tareas de visión-lenguaje procesan una cantidad masiva de tokens visuales antes de que el modelo de lenguaje comience a generar texto, lo que suele ralentizar la ejecución en dispositivos con recursos limitados. Esta técnica de decodificación especulativa acelera la fase de decodificación de forma exacta, verificando cada token propuesto sin sacrificar la calidad de las respuestas.
Al mantener la precisión intacta y reducir el tiempo de respuesta final, la propuesta facilita el despliegue eficiente de capacidades multimodales avanzadas en una mayor variedad de hardware.
Mini tutorial
El modelo borrador y los formatos compatibles se encuentran publicados en la plataforma Hugging Face para su descarga y exploración mediante las integraciones mencionadas.
- Abrir la fuente oficial en el blog de Liquid AI o la página del repositorio en Hugging Face para revisar la documentación y los formatos disponibles (Safetensors y GGUF).
- Identificar los requisitos técnicos y las versiones compatibles necesarias para las plataformas de ejecución soportadas como llama.cpp, MLX-VLM o SGLang.
- Probar la configuración empleando exclusivamente los parámetros y comandos documentados en la página oficial del anuncio.