SAK · FORSKNING_

DeepSeek presenterer mHC-arkitektur for mer effektiv neural-nettverksskalering

DeepSeek publiserte en ny paper om mHC (Manifold-Constrained Hyper-Connections), en metode som forbedrer residual-path design i dype nevralnett ved å begrense miksingsmatriser til Birkhoff-polytopen. Tilnærmingen krever bare 6,7% treningskostnader og kombineres med systemoptimalisering som fused kernels. Forskningen introduserer også Recursive Language Models (RLMs) som håndterer kontekst dynamisk, en løsning på flaskehalser i lange agent-kjøringer.

HVORFOR DET BETYR NOE

Dette representerer en viktig grenseforskning i hvordan man kan trene større modeller mer effektivt – en kombinasjon av matematikk og kernelengineering som har direkte innvirkning på kostnader og ytelse. Skiftet mot dynamisk kontekstbehandling i stedet for større context windows kan bli avgjørende for praktisk deployment av lange agentkjøringer.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.