SAK · PRODUKTER_

Cloudflare optimaliserer serving av store språkmodeller med kvantisering og kompresjon

Cloudflare har implementert tre teknikker for å kjøre Moonshot Kimi K-serien og Z.ai GLM effektivt på sin Workers AI-plattform: kvantisering av KV-cache fra 16-bit til 8-bit, kompresjon av modellvekter fra 8-bit til 4-bit, og integritetstsjekking av delt cache. Optimaliseringene dobler kontekstlengden som kan holdes i minnet og reduserer kostnader uten tap av modellnøyaktighet.

HVORFOR DET BETYR NOE

Disse optimaliseringene gjør det mulig for Cloudflare å servere flere kundeforespørsler samtidig på samme maskinvare, noe som senker kostnader og forbedrer tilgjengeligheten av store langkontekst-modeller for sluttbrukere.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.