SAK · VERKTOY_

Prime Intellect lanserer verifiers v1 for effektivere agent-training

Prime Intellect har lansert verifiers v1, et redesignet miljø for agentic reinforcement learning som reduserer beregningskompleksitet fra O(n²) til O(n) ved å lagre rollout-traces som message DAGs. Dette muliggjør praktisk testing av lange agent-oppgaver, som vist med en 100B-modell som kjørte 40-turn SWE agent-oppgaver på 6 H200-noder på under 2 dager.

HVORFOR DET BETYR NOE

Dette representerer et betydelig skifte i hvordan man trener og evaluerer coding agents ved å gjøre lange horisont-oppgaver beregningsmessig gjennomførbar. Samtidig ser vi et paradigmeskifte der "harnesses" blir sentrale produktflater for agent-development, og cost per task blir det nye benchmarking-målet i stedet for token-pris.

KILDER

MASKINGENERERT SAMMENDRAG Sammendraget er skrevet maskinelt fra kildene under. Vi sorterer og forklarer — men vi er en inngang til feltet, ikke en fasit. Sjekk kilden når noe betyr noe for deg.