Anthropic lot Claude-agenter bytte bøker for 201 ansatte – markedet sviktet likevel
Anthropic har publisert Project Swap, et kontrollert eksperiment der selskapet bygget en liten bytteøkonomi med 201 ansatte og deres Claude-drevne agenter.

Anthropic lot Claude-agenter bytte bøker for 201 ansatte – markedet sviktet likevel
Anthropic har publisert Project Swap, et kontrollert eksperiment der selskapet bygget en liten bytteøkonomi med 201 ansatte og deres Claude-drevne agenter.
Nyheten
Agentene skulle forhandle og bytte bøker på vegne av eierne sine, og eksperimentet er ifølge Anthropic en mer kontrollert oppfølger til Project Deal, som selskapet beskriver som sitt første eksperiment med agenter som interagerer i et marked på folks vegne. Hovedpoenget fra selskapet selv er overraskende: Agentene handlet godt, men markedet strøk likevel – og årsaken var ifølge Anthropic ikke forhandlingsteknikk, men at agentene visste for lite om menneskene de representerte.
Slik fungerte eksperimentet
Opplegget var en barterøkonomi: ingen penger, bare direkte byttehandel av bøker mellom 201 Anthropic-ansatte via deres Claude-agenter. Hver agent måtte først forstå hva eieren faktisk likte, og deretter gå inn på handelsygulvet og forhandle frem bytter som helst skulle treffe eierens preferanser.
Grunnmålingen gikk på preferanseforståelse. Etter en samtale på bare fem minutter rangerte agenten ti bøker, og ifølge Anthropics egne tall stemte rangeringen med eierens preferanser på 61 prosent av parene. Selskapet beskriver selv resultatet som «overraskende bra» for så kort en samtale. Tallet er altså selskapsrapportert og ikke uavhengig verifisert, men det gir en konkret pekepinn på hvor raskt en språkmodell kan bygge seg et bilde av en persons smak.
Hva som fungerte – og hva som brast
Det mest interessante i Anthropics egen evaluering er fordelingen mellom suksess og svikt. Så snart agentene kom på handelsygulvet, handlet de godt, ifølge selskapet. Kortfallene i markedet tilskrev Anthropic derimot noe annet: «Markedet sviktet mest på grunn av informasjonen agentene manglet om deltakerne, snarere enn på grunn av hvordan de handlet», skriver selskapet (Anthropic).
Det er en betydningsfull tolkning, fordi den flytter oppmerksomheten fra et ofte antatt problem – at AI-agenter er dårlige forhandlere – til et annet: representasjon. Hvis agenten ikke forstår hvem den handler for, hjelper det ikke at den forhandler stramt. Alle disse vurderingene er imidlertid Anthropics egen lesning av sitt eget eksperiment, og det foreligger foreløpig ingen tredjepartskommentar eller uavhengig verifisering av resultatene.
For deltakerne var opplevelsen ifølge selskapets spørreundersøkelse i stor grad positiv. De fleste som leste boken agenten skaffet dem, likte den. Og den gjennomsnittlige deltakeren svarte at de ville gitt Claude omtrent en tredjedel av sitt årlige bokbudsjett til å bruke på deres vegne. Også dette er selvrapporterte undersøkelsestall fra et selskap som både bygget og evaluerte systemet.
Modellen betydde mer enn instruksene
Anthropic kjørte eksperimentet på nytt med variasjoner i både modeller og instruksjoner, og fant noe som kan bety mye for hvordan agent-tjenester bygges fremover: Underliggende modell betydde mer for forhandlingsresultatene enn instruksjonene agentene fikk. Markeder med sterkere modeller var også mer effektive, rapporterer selskapet.
Dette peker mot en slags økonomi der rå modellkapasitet kan bli et konkurransefortrinn i seg selv – ikke bare i kvaliteten på svarene, men i effektiviteten til hele markeder der agentene deltar. Det er Anthropics funn, ikke en etablert konklusjon, men det er eksplisitt målt i dette oppsettet.
To designproblemer
Anthropic trekker selv ut to designutfordringer fra eksperimentet. Den første gjelder agenter i markeder: Alle som bygger slike agenter trenger en måte å verifisere at agenten faktisk forstår deltakeren sin – altså en slags kvalitetskontroll på representasjonen. Fem minutters prat ga 61 prosent treff i dette tilfellet, men det finnes foreløpig ingen standard for hva som er godt nok.
Den andre gjelder markeder for agenter: Selskapet peker på behovet for klare regler om hvilke agenter som slipper inn, hva som skjer når en avtale ryker, og hvor mye av markedsaktiviteten som er synlig for deltakerne. Det siste punktet er verdt å merke seg: I et marked der agenter handler i raske serier, kan menneskene de handler for ha svært begrenset innsyn i hva som egentlig skjer.
Forbehold og åpne spørsmål
Det finnes vesentlige forbehold til denne historien. Alle tall og tolkninger – 61 prosent treffrate, en tredjedel av bokbudsjettet, vurderingen av at agentene handlet godt – kommer fra Anthropics egen fremstilling av sitt eget eksperiment, med ansatte i sitt eget selskap som deltakere. Ingen uavhengig part har verifisert resultatene, og ingen eksterne forskere eller kommentatorer er sitert.
Det er også uklart hva som skjedde med deltakere som eventuelt ikke fikk en bok hjem; kildeteksten behandler ikke dette i detalj. Selve feilmodusene i markedet – hva slags manglende informasjon som kostet mest, og hvordan kortfallene arte seg – er dermed ikke dokumentert i detalj.
Deltakergruppen er en annen begrensning: 201 Anthropic-ansatte er ikke et tverrsnitt av en befolkning, og deres preferanser og tiltro til selskapets egne systemer kan skille seg fra alminnelige brukere. Eksperimentet bør derfor leses som et kontrollert laboratorium, ikke som en fasit for reelle forbrukermarkeder.
Det betyr ikke at funnene er uten interesse. Project Swap er ifølge Anthropic en systematisk måling av hvordan det faktisk går når agenter opererer i et lukket marked på folks vegne. Hvis Anthropics hovedkonklusjon holder – at representasjon, ikke forhandling, er flaskehalsen – vil det antakelig forme både hva agent-leverandører tester og hvilke regler markeder stiller til agentene som slipper inn. Det neste spørsmålet er det selskapet selv reiser: Hvem kontrollerer at agenten virkelig forstår deg, før den forhandler på dine vegne?
Kilder
- Project Swap: What happens when agents trade for us? \ Anthropic — www.anthropic.com