Liquid AI diz que LFM2.5-VL-DSpark acelera inferência em até 3,13 vezes
A Liquid AI lançou o LFM2.5-VL-DSpark, um modelo experimental de rascunho para o modelo de visão e linguagem LFM2.5-VL-3B. Segundo a empresa, a decodificação especulativa acelera a geração sem mudar a qualidade das respostas: os ganhos chegam a 3,13 vezes no dispositivo e 2,66 vezes em uma H100, enquanto a latência de ponta a ponta melhora em até 2,62 e 2,27 vezes, respectivamente. O modelo adiciona cerca de 280 milhões de parâmetros, ou 8,9% ao modelo de 3 bilhões de parâmetros.
O lançamento inclui suporte para llama.cpp, MLX-VLM e SGLang. A Liquid AI avaliou seis tarefas de visão, como perguntas e respostas sobre imagens e gráficos, legendagem e raciocínio complexo. A técnica acelera apenas a etapa de decodificação; a codificação da imagem e o preenchimento inicial continuam sem aceleração, o que pode limitar o ganho total, especialmente quando essas fases representam grande parte do tempo de resposta.
Por que importa · interpretação editorial
A técnica pode reduzir o tempo de geração do LFM2.5-VL-3B em diferentes ambientes de execução, com suporte desde o lançamento a llama.cpp, MLX-VLM e SGLang. Como ela acelera apenas a decodificação, o ganho total pode ser menor quando a codificação da imagem e o preenchimento inicial dominam a latência.
Fontes
Pesquisa