SAK · FORSKNING_

OpenAI avslører mangler i populær kodingsbenchmark

OpenAI har publisert en analyse som dokumenterer problemer i SWE-Bench Pro, en mye brukt benchmark for å evaluere AI-modellers kodingsevner. Analysen reiser spørsmål om påliteligheten av resultatene fra denne benchmarken.

HVORFOR DET BETYR NOE

Pålitelige benchmarks er kritiske for å sammenligne AI-modeller og vurdere fremgang. Hvis en av de mest brukte kodingsbenchmarkene har systematiske problemer, kan det føre til feil konklusjoner om hvilke modeller som faktisk er best.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.