Bli kjent med DeepSWE: en ny måte å vurdere AI-agenter på
DeepSWE er en ny benchmark fra selskapet Datacurve som evaluerer AI-agenters evner innen reell programvareutvikling. I stedet for enkle GitHub-issues gir den oppgaver som krever at agenten utforsker, implementerer og verifiserer endringer i hele kodebaser selv – 113 oppgaver fordelt på 91 aktive open source-repoer og fem programmeringsspråk (TypeScript, Go, Python, JavaScript og Rust).
Merk: Ikke å forveksle med DeepSWE-Preview, en eldre og helt urelatert kodeagent fra Agentica og Together AI fra 2025 – samme navn, forskjellig prosjekt.
Hva som skiller DeepSWE fra andre benchmarks
DeepSWE er bygget for å unngå to kjente problemer med eksisterende benchmarks. For det første kontaminasjon: oppgavene er skrevet fra bunnen av og aldri slått sammen tilbake til de originale repoene, så løsningene kan ikke ha havnet i noen modells treningsdata. For det andre upresis verifisering: Datacurve reviderte 30 tilfeldige oppgaver fra både DeepSWE og konkurrenten SWE-Bench Pro og fant at SWE-Bench Pros verifisering feilvurderte resultater i rundt 32 % av tilfellene (8,5 % falske positive, 24 % falske negative), mot bare 1,4 % for DeepSWE (0,3 % falske positive, 1,1 % falske negative).
Prompt-lengden er faktisk kortere enn konkurrentene – i snitt 2 158 tegn mot SWE-Bench Pros 4 614 – men løsningene krever i snitt 668 linjer kode mot SWE-Bench Pros 120, og berører syv filer mot fem. Kortere oppgavebeskrivelse, men langt mer arbeid for å løse den riktig – nettopp fordi agenten selv må utforske hvor og hvordan endringen skal gjøres, ikke bare følge en detaljert oppskrift.
Hva resultatene viser
I snapshotet fra 26. mai 2026 topper GPT-5.5 (kjørt med høy resonneringsinnsats) leaderboardet med 70 % løsningsgrad, foran GPT-5.4 (56 %) og Claude Opus 4.7 (54 %). Åpne modeller skårer merkbart lavere: Kimi K2.6 og GLM-5.1 lander på henholdsvis 24 % og 18 %, mens DeepSeek-V4-Pro havner helt nede på 8 %. Spredningen på DeepSWE er dessuten mye bredere enn på andre benchmarks – 70 prosentpoeng fra beste til dårligste modell, mot bare 30 prosentpoeng på det offentlig rapporterte SWE-Bench Pro. Modeller som ser tett sammen på andre benchmarks skiller seg altså tydelig fra hverandre her, noe som stemmer bedre med det utviklere faktisk opplever i praksis.
Et interessant sidefunn fra Datacurves kvalitative analyse: Claude-modeller er mer tilbøyelige til å glemme deler av flerdelte krav (for eksempel å implementere støtte for "både synkron og asynkron" og bare huske den ene), mens GPT-modellene er mer bokstavtro til det som faktisk blir spurt om. Sterkere modeller skriver også egne tester uoppfordret langt oftere enn svakere modeller.
Oppsummering
DeepSWE fyller et reelt hull i evalueringen av AI-agenter ved å bruke realistiske, kontaminasjonsfrie programvareutviklingsoppgaver med langt mer pålitelig verifisering enn eksisterende alternativer. GPT-5.5 leder klart, og gapet til åpne modeller er stort og godt dokumentert – ikke bare en påstand. Relaterte artikler fra verktøy-klyngen:
- Kreativitet med Pantheon 360: 360-video i din hånd
- Utforsk virtuell realitet med Genrecon: fra rom til 3D
- Astribot T1: din nyeste robotics-hjelp i hjemmet
- CubePart: lag detaljerte 3D-modeller med letthet
- Opplev magiske lysforandringer med ControLight