SAK · FORSKNING_
Hvor store programvareprosjekter kan AI gjennomføre alene?
MirrorCode-benchmarken gir AI tilstrekkelig beregningsbudsjett til å forsøke større programvareoppdrag. Noen oppgaver kostet 2 600 dollar og lot AI arbeide i 19 dager uten menneskelig inngrep, i motsetning til tradisjonelle benchmarker som begrenser budsjett til 1–10 dollar.
HVORFOR DET BETYR NOE
Dette viser skalaen på oppgaver AI nå kan håndtere alene, og hvordan realistiske evaluerings-rammer avslører større kapabiliteter enn tidligere benchmarker.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.