SAK · MODELLER_

Anthropics nye modellsyklus og agent-benchmarks avslører fortsatt utfordringer

Anthropic lanserte Mythos/Opus-serien hvor Claude Mythos får skryt for one-shot-workflows, mens Opus 4.8 viser regresjoner i benchmarks. Samtidig presenteres nye testverktøy som Agents' Last Exam og SWE-Marathon som avslører at selv topmodeller som GPT 5.5 og Claude Opus 4.7 mangler pålitelighetsframgang på langvarige oppgaver.

HVORFOR DET BETYR NOE

Dette viser en kritisk gap mellom modellmarketering og faktisk ytelse på komplekse agenttasks. Resultatet presiserer hvor AI-systemene fortsatt sliter og driver agentframework-utviklingen mot RL-miljøstil-evaluering.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.