SAK · VERKTOY_

Utvikler får GLM 5.2 til å kjøre på vanlig PC med smart caching

En utvikler har laget Colibrì, et verktøy som gjør det mulig å kjøre Zhipu GLM 5.2 (en 744B Mixture-of-Experts-modell) på en vanlig datamaskin med 32GB RAM. Ved å konvertere modellen til int4 og streame eksperter fra disk on-demand med LRU-caching, oppnår han inferens på ~0.1 tokens/sekund uten GPU.

HVORFOR DET BETYR NOE

Dette demonstrerer at svært store modeller kan gjøres praktisk tilgjengelige for folk uten AI-dedikert hardware, ved hjelp av smarte minnehåndteringsteknikker. Det åpner opp lokale frontier-modeller for breiere brukergrupper.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.