Når samme agentoppgave kan koste 30 ganger ulikt
Nesten ni av ti virksomheter bruker KI regelmessig, og de fleste eksperimenterer med KI-agenter. Likevel er det bare 37 prosent som kan tilskrive KI-programmene sine noen positivt resultat på driftsmarginen (EBIT).
Det er kjerndiagnosen i McKinseys Technology Trends Outlook 2026, og den setter ord på et problem som har fulgt agentbølgen helt siden den startet: innsatsen er enorm, avkastningen uteblir. I slutten av september 2026 tok McKinsey-partnere problemet opp offentlig, med harde tall på begge sider av regnskapet — både på bruk og resultat, og på kostnadene som driver gapet mellom dem.
Denne artikkelen går gjennom tallene, mekanismene bak kostnadsvariasjonene, kodingsagentenes blandede resultater, og rådene McKinsey selv gir for å styre bruk og forbruk. Alt datagrunnlaget er McKinseys egne tall, rapportert i etterkant av CIO, Fortune og Business Insider — rapportene selv foreligger ikke, så ingenting her er uavhengig verifisert.
Bruk ja, resultat nei
Ifølge Technology Trends Outlook 2026 bruker 89 prosent av virksomhetene KI regelmessig, og flertallet eksperimenterer i det minste med KI-agenter. Men mellom bruk og økonomisk suksess er det, slik McKinsey selv formulerer det, et betydelig gap: «Vi finner at bare 37 prosent av virksomhetene tilskriver KI-programmene sine noen positiv EBIT-effekt, for ikke å snakke om nyere agentbaserte utrullinger», skriver konsulentselskapet i rapporten, gjengitt av CIO.
Tallet er verdt å lese nøyaktig: 37 prosent gjelder altså KI-programmer overhodet — ikke spesifikt agentene, som er den nyeste og dyreste delen av porteføljen. Andelen som ser målbart positiv resultat av agentene alene, er derfor trolig lavere, selv om kildene ikke angir et eget tall.
Hvorfor agentene er så dyre
Mekanismen bak kostnadsproblemet er at agentsystemer ikke svarer på én spørring, men utfører flertrinnsoppgaver: de planlegger, kaller verktøy, leser resultater, justerer kursen og gjentar. Ifølge McKinseys egne beregninger krever en enkelt agentarbeidsflyt mellom fem og 30 ganger mer regnekraft enn en typisk chatbotspørring (CIO).
I en nylig undersøkelse oppga 93 prosent av deltakerne at dette førte til at de overskred KI-budsjettene sine, ifølge McKinsey via samme kilde. Det er et slående tall, men også et som må behandles forsiktig: CIO gjengir det uten oppgavenavn, utvalgsstørrelse eller metode, så det lar seg ikke etterprøve fra det tilgjengelige kildematerialet.
Til dette kommer en egen og kanskje enda mer plagsom egenskap ved agentøkonomien: kostnaden er ikke forutsigbar fra oppgave til oppgave. Slike oppgaver er ofte flertrinnsprosesser der samme mål kan nås på mange måter, og kostnadene varierer tilsvarende bredt. Ifølge en McKinsey-studie, gjengitt av seniorpartner Lari Hämäläinen overfor Business Insider via Yahoo Finance, kunne gjennomføringskostnaden for ulike agenter avvike med opptil 30 ganger — for samme type oppgave.
En forbeholdsmerknad er nødvendig her: CIO-artikkelen oppgir at en arbeidsflyt krever 5–30 ganger mer regnekraft enn en chatbotspørring, mens studien Hämäläinen siterte omtaler opptil 30 gangers kostnadsvariasjon mellom kjøringer. Det er uklart fra kildene om dette er to sider av samme måling eller to ulike funn — det ene handler om agentflyt kontra chat, det andre om variasjon mellom kjøringer av samme oppgave. Lesere bør derfor ikke slå dem sammen til én «30x»-påstand.
Kodingsagentene: gevinst for noen, fall for andre
Det tydeligste dokumenterte eksempelet på ulik avkastning kommer fra programvareutvikling — feltet McKinsey selv mener har størst potensial. I en McKinsey-studie klarte bare en fjerdedel av virksomhetene som bruker KI-agenter til programvareutvikling å akselerere utviklingssyklusene betydelig; McKinsey regner minst en dobling av produktiviteten for mer enn en fjerdedel av teamene som betydelig fremgang (CIO).
Ifølge CIOs oppsummering av McKinseys data så rundt 80 prosent av utviklerne produktivitetsgevinster på bare om lag 3 prosent, mens de øverste 20 prosent fikk 55 prosent — og produktiviteten falt i 30 prosent av virksomhetene etter innføring av kodingsagenter. Også disse splittene er gjengitt uten studienavn, utvalg eller datoer, så metodikken lar seg ikke etterprøve fra kildegrunnlaget. Men bildet de tegner, er konsistent med kostnadsdataene: gevinsten er konsentrert hos et mindretall, mens flertallet står igjen med marginale effekter — og et betydelig mindretall opplever faktisk at det blir verre.
Et utgiftsbilde som peker én vei
Mot dette står utgiftssiden. I McKinseys State of AI 2026-undersøkelse bruker rundt en tredjedel av organisasjonene mer enn 10 prosent av teknologi- og kommunikasjonsbudsjettene sine på KI. 60 prosent av respondentene planla å øke KI-utgiftene neste år, og rundt én av fem sa at KI-utgiftene begynte å skape begrensninger i driftskostnadene (Business Insider via Yahoo Finance).
Sett sammen tegner dette et paradoks som McKinsey-seniorpartnerne Tanguy Catlin og Lari Hämäläinen tok opp i et McKinsey Live-seminar med tittelen «Improving the Economics of Agentic AI», gjengitt av Fortune (via MSN): modellene blir billigere per token, men regningene blir større — fordi agentene bruker så mange flere tokens per arbeidsoppgave.
McKinseys motmidler: mål oppgaven, ikke tokenen
Det er verdt å merke seg at McKinsey ikke konkluderer med at agentene er verdiløse — konsulentselskapet er en betydelig interessent i markedet og argumenterer for at problemet primært er styringsbasert. Rådene faller i to kategorier: evaluering og kostnadskontroll.
Evaluer på oppgavenivå. Hämäläinen argumenterte i seminaret for at virksomheter bør vurdere agenter på oppgavenivå heller enn per token, med en tommelfingerregel: En agent kan gi mening når tiden det tar å verifisere outputen, er en liten brøkdel av tiden et menneske ville brukt på å gjøre oppgaven fra bunnen av. Hvis en oppgave tar et menneske en time, men agentens arbeid kan verifiseres på seks minutter, kan en agent med suksessrate over 10 prosent allerede begynne å skape verdi, sa han (Fortune via MSN). Logikken er at verifisering — ikke generering — er den menneskelige kostnaden som bestemmer netto gevinst, og at en agent med høy feilrate likevel kan lønne seg hvis feilene oppdages raskt og billig.
Tre spaker på kostnadssiden. Catlin pekte på tre styringshendler. Den første er synlighet: virksomheter trenger innsyn i hvilke bruksområder, forretningsenheter, agenter, modeller og brukere som driver forbruket, sa han ifølge Fortune. Den andre er arbeidsflytoptimalisering — modellruting (billigere modeller til enklere trinn), hurtigbuffer og begrensning av verktøykall og agentløkker, altså antall ganger en agent får lov til å utføre trinn i samme oppgave. Den tredje er innkjøpsdisiplin: fjerne ubrukte lisenser, håndtere kvoter og forhandle vilkår.
Disse rådene er fornuftige i seg selv, men de peker også på en organisatorisk virkelighet bak tallene: de fleste virksomheter mangler tilsynelatende oppgavenivå-evaluering og forbruksstyring i dag. At 93 prosent overskrider KI-budsjettene sine, er ikke et teknologiproblem alene — det er et styringsproblem.
Kapasitetsdebatten: når tall misforstås
En sidehistorie illustrerer hvor lett agentmetrikken misleses. McKinsey siterer METR, et uavhengig benchmarkinginstitutt, i sin rapportering om hva agentene faktisk klarer. For Claude Opus 4.6 estimerer METR at «50-prosents tidshorisonten» for programvareutviklingsoppgaver ligger på omtrent tolv timer — det vil si at for oppgaver av denne størrelsen er vellykket autonom gjennomføring forventet i halvtilfellene (CIO).
Men METR-forsker Sydney Von Arx har ifølge CIO, som videreformidler MIT Technology Review, påpekt at McKinsey har feiltolket metrikken: tolvtimerstallet refererer til tiden et menneske ville trengt for oppgaven, ikke til hvor lenge KI-en kan jobbe autonomt. Metrikken måler altså menneskelig oppgavetid som referanse, ikke KI-ens kapasitet i timer.
CIO-artikkelen presenterer METR-kritikken som en ferdig konstatering av feiltolkning, men den er selv gjengitt i andre hånd, og det foreligger ingen kjent respons fra McKinsey i kildematerialet. Dette er verdt å merke seg av to grunner. For det første viser det hvor skjørt grunnlaget er for de mest aggressive lesningene av agentkapasitet — tolvtimerstallet er blitt sirkulert som bevis på at agentene kan klare en hel arbeidsdag på egen hånd, men det er altså ikke det metrikken sier. For det andre er det en bekreftelse på McKinseys eget poenn: det finnes i liten grad felles, godt forstått målemetodikk for hva agentene faktisk presterer per oppgave og per krone — som er nøyaktig det gapet virksomhetene selv må tette.
Hva McKinsey mener om fremtiden — og hva som står igjen
Til tross for tallene forblir McKinsey optimistisk. Ifølge CIO estimerer selskapet at KI-agenter innen programvareutvikling, hvis de utrulles vellykket, kan frigjøre nesten en billion dollar i merverdi for virksomhetene. Dette er altså McKinseys eget fremtidige anslag, ikke et verifisert resultat. McKinsey argumenterer også for at verktøyene er i ferd med å bli bedre — med henvisning til agentverktøy fra Anthropic, OpenAI og rammeverk som LangGraph.
Det er altså to historier i dette materialet, og de er ikke like godt belagt. Den ene er datahistorien: en klar og konsistent beskrivelse av et økonomisk gap mellom høy innsats og lav avkastning, med konkrete mekanismer — flertrinnsflyt som multipliserer forbruk, variasjon mellom kjøringer som ødelegger kostnadsprediksjon, og evaluering som skjer på feil nivå. Denne historien hviler på McKinseys egne undersøkelser og studier og kan derfor ikke uavhengig etterprøves fra det kildematerialet som foreligger, men den er internt konsistent på tvers av tre ulike publikasjoner.
Den andre historien er fremtidshistorien: at gevinsten kommer når verktøyene blir bedre, arbeidsflytene riktig designet og styringsverktøyene modne. Det er en rimelig hypotese, men den er McKinseys egen — fra et selskap som tjener på at virksomhetene fortsetter å investere. Spørsmålene som står åpne, er i hovedsak tre: om 5–30-gangeren i regnekraft og 30-gangeren i kostnadsvariasjon handler om samme eller ulike målinger, om splittene i kodingsagentdataene gjenspeiler utvalg eller teknologi, og om gevinsten faktisk materialiserer seg når styringsverktøyene blir modnere — eller om agentøkonomien til syvende og sist trenger billigere modeller raskere enn virksomhetene klarer å håndtere forbruket.
Det siste er ikke bare McKinseys problem. Hvis 60 prosent av virksomhetene øker KI-budsjetttene sine neste år, mens rundt seks av ti fortsatt ikke kan tilskrive KI-programmene sine positiv EBIT-effekt, blir gapet mellom forventninger og avkastning større før det blir mindre — og da blir evaluering på oppgavenivå og forbruksstyring ikke lenger et råd fra konsulenter, men en forutsetning for å holde regnskapet i balanse.

