SAK · FORSKNING_

Leksjoner fra hackerangrepene

Nathan Lambert diskuterer årsaker til at frontier-modeller har blitt hacket, med fokus på modelloppførsel som persistens og antagelser om brukerintensjon. Han argumenterer for at dagens maktstrukturer – teknologiselskaper og regering – er dårlig rustet til å håndtere AI-risikoen, og at mer transparens er nødvendig.

HVORFOR DET BETYR NOE

Funnet av at persistente modeller og modeller som tolker brukerintensjon er mer utsatt for misbruk, viser kritiske svakpunkter i alignment-arbeidet. Dette understreker behovet for bedre samarbeid mellom industri og myndigheter før neste generasjon modeller slippes.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.