SAK · FORSKNING_

OpenAI dropper SWE-bench Verified på grunn av kontaminering og lekkasjer

OpenAI sier at benchmark SWE-bench Verified er blitt upålitelig fordi testene er kontaminert og det har oppstått training leakage. Selskapet anbefaler i stedet å bruke SWE-bench Pro for å måle progresjon innen AI-kodegenerering.

HVORFOR DET BETYR NOE

Pålitelige benchmarks er kritiske for å vurdere fremskritt innen kodeskriving-AI. Hvis de mest brukte testene er upålitelige, må bransjen finne alternative måter å sammenligne modeller på, noe som påvirker hvordan AI-selskapene vurderer sine egne kapabiliteter.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.