SAK · VERKTOY_
Kjør Kimi K3 med 29 GB RAM ved 0,50 tokens per sekund
WASTE er en C-basert inferens-engine som muliggjør kjøring av Kimi K3 – en modell med 2,78 billioner parametere – på en 64 GB MacBook Pro med 0,49–0,54 tokens per sekund. Motoren holder modelltrunkus i minne, streamer eksperter direkte fra disk etter behov, og bruker gjenværende RAM som en begrenset expert-cache.
HVORFOR DET BETYR NOE
Dette demonstrerer at frontier-skala modeller kan kjøres lokalt uten nettverksavhengighet eller cloud-kostnader, noe som åpner for applikasjoner der datasikkerhet og datakontroll er kritisk. Det viser at grensen for hva som er mulig på forbruker-maskinvare har forskjøvet seg betydelig.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.