SAK · VERKTOY_
Open source-motor kjører Gemma 4 26B med bare 2 GB RAM på M-series Mac
En utvikler har bygget TurboFieldfare, en inferensmotor skrevet i Swift og Metal som gjør det mulig å kjøre 4-bit-kvantisert Gemma 4 26B-modellen på Mac med begrenset RAM. Motoren bruker en hybrid-tilnærming der den holder kjernen og KV cache i RAM, mens eksperts streames fra SSD etter behov, og oppnår 5–6 tokens/sekund på M2 og 31–35 tokens/sekund på M5.
HVORFOR DET BETYR NOE
Dette åpner muligheten for kraftig on-device AI på standard forbruker-Mac-er uten cloud-avhengighet, noe som har implikasjoner for privatliv, latens og tilgjengelighet av avanserte modeller lokalt.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.