SAK · VERKTOY_
Utvikler får GLM 5.2 til å kjøre på vanlig PC med smart caching
En utvikler har laget Colibrì, et verktøy som gjør det mulig å kjøre Zhipu GLM 5.2 (en 744B Mixture-of-Experts-modell) på en vanlig datamaskin med 32GB RAM. Ved å konvertere modellen til int4 og streame eksperter fra disk on-demand med LRU-caching, oppnår han inferens på ~0.1 tokens/sekund uten GPU.
HVORFOR DET BETYR NOE
Dette demonstrerer at svært store modeller kan gjøres praktisk tilgjengelige for folk uten AI-dedikert hardware, ved hjelp av smarte minnehåndteringsteknikker. Det åpner opp lokale frontier-modeller for breiere brukergrupper.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.