Liquid AI dice que LFM2.5-VL-DSpark acelera la inferencia hasta 3,13 veces
Liquid AI lanzó LFM2.5-VL-DSpark, un modelo experimental de borrador para su modelo de visión y lenguaje LFM2.5-VL-3B. La empresa afirma que la decodificación especulativa acelera la generación sin cambiar la calidad de las respuestas, con mejoras de hasta 3,13 veces en dispositivos y 2,66 veces en una H100, mientras que la latencia de extremo a extremo mejora hasta 2,62 y 2,27 veces, respectivamente. El modelo de borrador agrega unos 280 millones de parámetros, o 8,9% al modelo de 3.000 millones de parámetros.
El lanzamiento incluye soporte desde el primer día para llama.cpp, MLX-VLM y SGLang. Liquid AI evaluó seis tareas de visión, entre ellas preguntas y respuestas sobre imágenes y gráficos, generación de descripciones y razonamiento complejo. La técnica acelera solo la decodificación; la codificación de imágenes y el procesamiento inicial no cambian, lo que puede limitar la mejora total cuando esas etapas representan una parte importante del tiempo de respuesta.
Por qué importa · interpretación editorial
La técnica podría reducir el tiempo de generación de LFM2.5-VL-3B en distintos entornos de ejecución, con soporte desde el lanzamiento para llama.cpp, MLX-VLM y SGLang. Como solo acelera la decodificación, el beneficio total puede ser menor cuando la codificación de imágenes y el prefilling concentran la mayor parte de la latencia.
Fuentes
Investigación