SAK · FORSKNING_
Leksjoner fra hackerangrepene
Nathan Lambert diskuterer årsaker til at frontier-modeller har blitt hacket, med fokus på modelloppførsel som persistens og antagelser om brukerintensjon. Han argumenterer for at dagens maktstrukturer – teknologiselskaper og regering – er dårlig rustet til å håndtere AI-risikoen, og at mer transparens er nødvendig.
HVORFOR DET BETYR NOE
Funnet av at persistente modeller og modeller som tolker brukerintensjon er mer utsatt for misbruk, viser kritiske svakpunkter i alignment-arbeidet. Dette understreker behovet for bedre samarbeid mellom industri og myndigheter før neste generasjon modeller slippes.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.