SAK · FORSKNING_

RLVR kan være dårlig til vitenskap fordi verifikasjonsløkker varer tiår

En diskusjon i Dwarkesh Podcast peker på at reinforcement learning from verification (RLVR) kan ha grunnleggende problemer når det brukes på vitenskap. Problemet er at det tar tiår eller århundrer å verifisere om en teori er korrekt, og selv etablerte teorier gjør ofte dårligere spådommer enn tidligere teorier.

HVORFOR DET BETYR NOE

Dette utfordrer en populær ide om at AI kan læres til å gjøre vitenskapelige gjennombrudd. Hvis AI-systemene trenger umiddelbar tilbakemelding for å lære, og vitenskapelig validering er ekstremt treg, kan ikke RLVR fungere som høpet for å akselerere fundamental forskning.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.