Exa forhåndsviser ATLAS: ny benchmark tester søkeagenter på 547 oppgaver fra ekte søketrafikk
Exa publiserte i oktober 2026 en forhåndsvisning av ATLAS, en benchmark for agentisk websøk med 547 oppgaver bygget på ekte, anonymisert søkeetterspørsel. Ifølge selskapets egne kjøringer klarer ingen agent under én dollar per oppgave en rad-F1 over 0,5, og selv de dyreste agentene bommer på omtrent en tredjedel av gullsvarene. Men alle tallene kommer fra et selskap som selv selger søk.
Hva som er nytt
Søkeselskapet Exa har publisert en forhåndsvisning av ATLAS (Agentic Tasks for Large Aggregation + Search), en benchmark som skal måle nøyaktigheten og fullstendigheten av agentsvar på virkelige arbeidsflyter som er avhengige av websøk. Ifølge Exas blogginnlegg kombinerer benchmarken spørringer forankret i reell søkeetterspørsel med verifiserte gullsvar, og en automatisert pipeline som lar både spørringer og svar oppdateres etter hvert som nettet og modellene endres.
Tidspunktet er ikke tilfeldig. Eksisterende benchmarks for agentisk søk som BrowseComp, WideSearch og DeepSearchQA er ifølge Exa i stor grad mettet og delvis memoriert av frontiermodeller. Det etterlater feltet uten gode verktøy for å skille gode søkesystemer fra middels.
Hvordan ATLAS fungerer
Benchmarken består av 547 dype og brede forskningsoppgaver. Metodikken, slik Exa beskriver den:
- Ekte etterspørsel som utgangspunkt: Oppgavene genereres fra frøemner hentet fra klynging av anonymisert søkeetterspørsel, altså det folk faktisk søker på.
- Entitetsoppdagelse: Hver oppgave ber systemet om å finne alle entiteter – en person, et sted eller et selskap – som oppfyller presise betingelser.
- Flertrinnsberikelse: Hver funnet entitet skal deretter suppleres med 2–10 attributter som krever flere søkesteg.
- Automatisk oppfrisking: Gullsvarene er verifiserte og kan oppdateres automatisk via en pipeline, i motsetning til statiske benchmarks.
Resultatene rapporteres med rad-F1, måltypen Exa bruker i sine kjøringer. Exa har foreløpig ikke publisert en fullstendig beskrivelse av hvordan poengsetteren er implementert.
Tallene – rapportert av Exa selv
Alle resultatene nedenfor stammer fra Exas egne kjøringer og er ikke uavhengig verifisert:
- Ingen agentkjøring som koster under én dollar per oppgave oppnådde rad-F1 over 0,5.
- Agenter med maksimal innsats slo konsekvent sine lavberegningsdyktige motstykker.
- Selv de dyreste agentene bommet på omtrent én av tre gullsvar. Exa tolker dette som at websøk har betydelig rom for forbedring i bruksområder der fullstendighet er kritisk.
- Ved å holde modellrammeverket fast, hevder Exa at dets eget søkebackend definerer kost-ytelse-grensen (Pareto-grensen), med scorevariasjon på 16 prosent mellom ulike søkebackender.
Det siste punktet fortjener en egen bemerkning: Exa selger en søkebackend. Påstanden om at nettopp Exas backend ligger i front av kost-ytelse-kurven er en produktpåstand fra interesseparten selv, uten uavhengig verifisering.
Argumentet om mettede benchmarks
En sentral del av publiseringen er Exas kritikk av eksisterende evalueringsverktøy. Selskapet argumenterer for at frontiermodeller nå håndterer komplekse oppgaver langt billigere og mer pålitelig enn før, og at flaskehalsen for dyp og bred forskning derfor har flyttet seg fra modellens intelligens til kvaliteten på søke-backend-en – om den faktisk finner relevant informasjon i verden, skriver Exa.
Eksisterende benchmarks, argumenterer selskapet, mister verdi over tid fordi søkeleverandører optimaliserer mot dem og kunnskapen de krever havner i nye frontiermodeller. For å underbygge dette viser Exa til et memorisjonsmål definert som andelen oppgaver som huskes av minst én av modellene GPT-6 Astra, GPT-5.6 Sol eller Claude Opus 5:
| Benchmark | Memorisering (Exas måling) |
|---|---|
| ATLAS | 9 % |
| BrowseComp | 48 % |
| WideSearch | 59 % |
| DeepSearchQA | 61 % |
Exa hevder også at ATLAS er billig å evaluere: to dollar for ti fullstendige kjøringer, mot 26–80 dollar for de eldre benchmarkene og 18 000–50 000 dollar for Perplexitys WANDR. Den siste sammenligningen bør leses med forsiktighet: WANDR og ATLAS bruker ulike poengsettingsmetoder, og tallene er derfor ikke direkte sammenlignbare.
Forbeholdene
Det er viktig å understreke hvor mye av denne historien som hviler på én kilde. Alle tallene – rad-F1-grensene, memorisjonsprosentene, prismålingene og Pareto-påstanden – kommer fra Exas eget blogginnlegg om sin egen benchmark, og det finnes foreløpig ingen separat teknisk rapport eller uavhengig replikering. Selskapet har et åpenbart kommersielt insentiv i å vise både at agentisk søk er uløst og at dets eget søk er best.
Flere åpne spørsmål gjenstår:
- Den fullstendige metodikken, implementeringen av poengsetteren og detaljer om ledertavlen er ikke publisert ennå – dette er en forhåndsvisning, ikke en full utgivelse.
- Memorisjonsmålingen er knyttet til spesifikke modeller (GPT-6 Astra, GPT-5.6 Sol og Claude Opus 5) og vil endre seg etter hvert som modellene utvikles.
- Sammenligningen med WANDR hviler på ulike evalueringsmetoder og er ikke direkte ekvivalent.
Hvorfor det betyr noe
Uavhengig av hvem som vinner kost-ytelse-racet, peker rapporten på noe reelt for alle som bygger på agentisk søk: hvis Exas kjøringer gir et riktig bilde, er fullstendig søk til rimelig pris fortsatt et uløst problem. For brukere som trenger komplette svarlister – markedsanalyser, samsvarssjekker, due diligence – betyr det at agentresultater fortsatt kan være betydelig ufullstendige, og at pris og kvalitet henger tett sammen.
Om ATLAS selv blir en bransjestandard, avhenger av metodikken bak tallene – og av om noen andre enn Exa får muligheten til å teste den.

