SAK · FORSKNING_
Test-time compute endrer hvordan AI-modeller blir målt, ifølge OpenAI-forsker
OpenAI-forskeren Noam Brown argumenterer at industriens tradisjonelle benchmark-grid ikke tar hensyn til hvor lenge modeller får tid til å tenke. Med store mengder test-time compute kan dagens modeller resonnere i uker eller måneder på komplekse oppgaver, noe som gjør gamle evalueringer meningsløse.
HVORFOR DET BETYR NOE
Dette endrer grunnlaget for hvordan vi måler AI-modellers kapabilitet og sikkerhet. Hvis modeller faktisk kan løse problemer som tidligere så ut uløselige gitt nok tid, må vi omvurdere både benchmarking-praksis og sikkerhetstesting når kapabilitet skalerer med beregningsbudsjett.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.