A Liquid AI publicou um texto sobre o DSpark para o LFM2.5-VL-3B, um rascunho que ajuda na inferência de modelos de visão e linguagem. Ele reaproveita a mesma estrutura usada nos rascunhos de texto da empresa: lê estados internos do modelo principal em camadas fixas e, a partir deles, propõe blocos de candidatos que depois são verificados pelo próprio modelo.

Segundo a empresa, o rascunho tem cerca de 280 milhões de parâmetros e acrescenta 8,9% ao total do modelo implantado. A recomendação é usar blocos de 8 ou 9 tokens, dependendo do hardware. O material também diz que a versão para o LFM2.5-VL-3B funciona com llama.cpp, MLX-VLM e SGLang.
Nos testes citados, o M5 Max com MLX teve aceleração de 2,30x a 3,13x na decodificação e de 1,56x a 2,62x no tempo total. No M3 Ultra, com llama.cpp, os ganhos foram de 1,57x a 2,14x e de 1,30x a 1,77x. Em uma H100, a decodificação variou de 2,66x a 20,4x e o tempo total, de 1,64x a 2,27x.
A própria Liquid AI observa que esse tipo de aceleração atua só na etapa de gerar respostas, não no processamento da imagem nem no começo da execução, o que limita o ganho final quando essas etapas já consomem boa parte do tempo.