SAK · MODELLER_

vLLM 0.20.0 forbedrer effektiviteten drastisk – nye åpne modeller lanseres

vLLM har utgitt versjon 0.20.0 med betydelige forbedringer i hukommelses- og MoE-servering, inkludert TurboQuant 2-bit KV cache som gir 4× økt kapasitet og 2,1% latensyforbedring. Samtidig lanserer Poolside kodemodellen Laguna XS.2 (33B/3B MoE) under Apache 2.0-lisens, og NVIDIA presenterer Nemotron 3 Nano Omni, en 30B multimodal MoE-modell med 256K kontekstvindu.

HVORFOR DET BETYR NOE

Disse utviklingene gjør det betydelig billigere og raskere å kjøre store modeller lokalt, spesielt på enkle GPU-er, noe som accelererer demokrstiseringen av avansert AI. Det markerer også et skifte bort fra NVIDIAs CUDA-monopoi mot heterogene akselerator-løsninger.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.