
Intel brengt nieuwe LLM-Scaler-vLLM beta uit
Intel heeft vandaag de beta-versie 0.26.0-b1 van zijn LLM-Scaler-vLLM project gepubliceerd. De build draait op Docker en is geoptimaliseerd voor Intel Arc (Pro) grafische kaarten. Hij baseert zich op de recente vLLM 0.26 release die DeepSeek-V4 kernelondersteuning, verbeterde KV offloading en een JIT warm-up infrastructuur bevat. Diverse prestatie-optimalisaties en bugfixes zorgen voor een stabielere werking op Intel GPU's.
De nieuwe versie verkort de tijd tot het eerste token bij Qwen-modellen en biedt beter FP8 KV cache gedrag. Verbeterde FP8 KV cache prestaties en verbeterde tijd-tot-eerste-token worden gecombineerd met een reeks bugfixes. Beschikbare binaries en installatie-instructies staan op GitHub. Meer details staan op de pagina van Phoronix.









