SAK · VERKTOY_

smevals – verktøy for evaluering av AI-modeller og prompts

Simon Willison har sammen med Jesse Vincent's Prime Radiant-lab utviklet smevals, et åpent verktøy for å kjøre små evaluerings-suiter på tvers av ulike modellkonfigurasjoner. Verktøyet lar brukere definere evalueringer som YAML-filer, kjøre dem mot modeller som GPT-5.5 eller Claude Opus 4.6, og visualisere resultatene gjennom en webserver eller statisk HTML-rapport.

HVORFOR DET BETYR NOE

Smevals adresserer et langvarig behov innen AI-utvikling for å systematisk evaluere modellers kapabiliteter på måtmål som definert av brukeren. Verktøyet senker barrieren for folk som ønsker å benchmarke modeller og prompts.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.