SAK · MODELLER_
Anthropics nye modellsyklus og agent-benchmarks avslører fortsatt utfordringer
Anthropic lanserte Mythos/Opus-serien hvor Claude Mythos får skryt for one-shot-workflows, mens Opus 4.8 viser regresjoner i benchmarks. Samtidig presenteres nye testverktøy som Agents' Last Exam og SWE-Marathon som avslører at selv topmodeller som GPT 5.5 og Claude Opus 4.7 mangler pålitelighetsframgang på langvarige oppgaver.
HVORFOR DET BETYR NOE
Dette viser en kritisk gap mellom modellmarketering og faktisk ytelse på komplekse agenttasks. Resultatet presiserer hvor AI-systemene fortsatt sliter og driver agentframework-utviklingen mot RL-miljøstil-evaluering.
KILDER
MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.