SAK · FORSKNING_
Mennesker oversåt trusler i hver tredje kommando fra AI-agenter i testspill
En forsker publiserte et interaktivt spill der mennesker skal godkjenne eller avslå kommandoer fra en AI-kode-agent. Analyse av over 40.000 spillekjøringer viser at gjennomsnittsspilleren miste 1 av 3 trusler (66,3% nøyaktighet), og at skriptkall som npm run analyze ble godkjent 64,7% av tiden selv når løsørt skadelig kode var dokumentert i historikken.
HVORFOR DET BETYR NOE
Funnene illustrerer at den menneske-i-løkka-modellen (human-in-the-loop) for å kontrollere AI-agenter er svakere enn antatt, særlig fordi gjentatte godkjennelser fører til trøtthet og oppmerksomhetsproblemer, noe som har direkte sikkerhetskonsekvenserfor systemer som Claude Code.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.