SAK · FORSKNING_

Anthropic utviklet teknikk som avslører hva som skjer inne i Claude

Anthropic har utviklet et verktøy kalt Jacobian lens som gir innsikt i hvordan store språkmodeller prosesserer konsepter internt når de svarer på spørsmål. Funnene spenner fra ordinære mekanismer til potensielt bekymringsfulle mønstre.

HVORFOR DET BETYR NOE

Dette er et gjennombrudd for interpretability - forståelsen av hvordan AI-systemer faktisk fungerer internt. Bedre innsikt i modellenes resonnement er kritisk for sikkerhet og tillitt når disse systemene tas i bruk for stadig viktigere oppgaver.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.