SAK · FORSKNING_

Test-time compute endrer hvordan AI-modeller blir målt, ifølge OpenAI-forsker

OpenAI-forskeren Noam Brown argumenterer at industriens tradisjonelle benchmark-grid ikke tar hensyn til hvor lenge modeller får tid til å tenke. Med store mengder test-time compute kan dagens modeller resonnere i uker eller måneder på komplekse oppgaver, noe som gjør gamle evalueringer meningsløse.

HVORFOR DET BETYR NOE

Dette endrer grunnlaget for hvordan vi måler AI-modellers kapabilitet og sikkerhet. Hvis modeller faktisk kan løse problemer som tidligere så ut uløselige gitt nok tid, må vi omvurdere både benchmarking-praksis og sikkerhetstesting når kapabilitet skalerer med beregningsbudsjett.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.