SAK · FORSKNING_
OpenAI dropper SWE-bench Verified på grunn av kontaminering og lekkasjer
OpenAI sier at benchmark SWE-bench Verified er blitt upålitelig fordi testene er kontaminert og det har oppstått training leakage. Selskapet anbefaler i stedet å bruke SWE-bench Pro for å måle progresjon innen AI-kodegenerering.
HVORFOR DET BETYR NOE
Pålitelige benchmarks er kritiske for å vurdere fremskritt innen kodeskriving-AI. Hvis de mest brukte testene er upålitelige, må bransjen finne alternative måter å sammenligne modeller på, noe som påvirker hvordan AI-selskapene vurderer sine egne kapabiliteter.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.