Ny Georgia Tech-test måler robotminne – toppmodellene feiler halvparten av de vanskeligste oppgavene
En ny test fra Georgia Tech måler om visuelle språkmodeller husker det de har sett i et hjem – og ifølge rapporteringen feiler de beste modellene rundt halvparten av de vanskeligste oppgavene.
En hjemmerobot som har sett hvor sengetøyet ligger, når barna pleier å rydde og hvilke rom som endrer seg i løpet av dagen, må kunne hente frem den erfaringen igjen. Det er nettopp denne visuelle hukommelsen en ny benchmark fra Georgia Tech setter på prøve – med svake resultater for de mest kjente modellene, ifølge sekundær rapportering om prosjektet.
Hva FINDINGDORY tester
Benchmarken, kalt FINDINGDORY, består av minneevalueringer med 60 oppgaver som krever kontinuerlig engasjement og bevissthet om kontekst og omgivelser, ifølge rapporteringen om forskningsgruppen til Zsolt Kira, førsteamanuensis ved Georgia Techs School of Interactive Computing. Tre oppgavekategorier er merket som spesielt vanskelige: romlige (hvor ting var), temporale (når ting skjedde) og flermålsoppgaver som kombinerer flere krav. Dette er nettopp den typen kunnskap en robot trenger for å bevege seg og jobbe i et hjem over tid.
Rapporteringen oppgir at artikkelen ble presentert i tidlig september på European Conference on Computer Vision i Sverige, og at Yadav og Ali er likeregistrerte førsteforfattere. Merk at rapporteringen omtaler konferansen som «2026»-utgaven samtidig som den henviser til en arXiv-versjon med 2025-DOI (10.48550/arxiv.2506.15635); denne tidsmessige uenigheten lar seg ikke avklare ut fra de tilgjengelige kildene. Grunnmaterialet er dessuten én sekundær artikkel – resultatnivået og modellrangeringene er altså rapporterte tall, ikke uavhengig verifiserte.
Resultatene er ydmykende for bransjen: Den beste modellen klarte seg bare rundt 50 prosent på de vanskeligste oppgavene. Og overraskende nok var det ikke en av Gemini- eller GPT-modellene som lå øverst, ifølge rapporteringen. Det var en åpen kildekode-resonneringsmodell fra Qwen som vant benchmarken. Karmesh Yadav, doktorgradsstudent ved Georgia Tech og én av to likeregistrerte førsteforfattere, står bak studien sammen med Kiras gruppe. Artikkelen nevner at både Gemini 2.0-flash og GPT-4o ble testet, men rapporteringen oppgir ikke eksakt modellnavn eller størrelse på den vindende Qwen-modellen.
Hvorfor visuell hukommelse er flaskehalsen
Kira peker på en grunnleggende begrensning: De fleste aktive visuell-språkmodeller (VLM-er) kan ifølge ham bare behandle noen hundre bilder om gangen før de glemmer dem. En robot i et hjem genererer kontinuerlig visuelt innmat – timevis med observasjoner – som langt overskrider det modellene praktisk talt kan beholde i konteksten.
Det er derfor resultatene er relevante utover selve benchmarken: Problemet er ikke primært resonnering, men hukommelse. En modell kan være flink til å tolke et enkelt bilde, men likevel feile en oppgave fordi den ikke lengre har tilgang til det den så tidligere.
Kira foreslår to mulige løsninger for å omgå minnedilemmaet, gjengitt i rapporteringen:
- Konvertere bilder til tekst – beskrivende tekst som språkmodeller lett forstår, kan omgå lagringsproblemet.
- Hierarkisk beskjæring – lære modellen å identifisere irrelevante eller redundante bilder og slette dem fra lageret.
Ingen av tilnærmingene er demonstrert som fullverdige løsninger i rapporteringen – de er Kiras egne forslag til forskningsretninger.
Hvorfor målingene kommer nå
Interessen for robotminne er ikke rent akademisk. Humanoide roboter er allerede i hjem, og selskapet Figure rapporterte selv at Helix 2.5 fullførte 237 av 420 forsøk (56 prosent) med oppgaver som sengetøy, håndklefoldning og leketøysrydding på tvers av 30 hjem robotene ikke hadde sett før, ifølge TechRepublics dekning. Tallene er selskapets egne og ikke uavhengig verifisert, og de sier ingenting om benchmarken direkte – men de illustrerer gapet mellom dagens pålitelighet og det som trengs for daglig bruk.
Også 1X Technologies, ledet av den norske administrerende direktøren Bernt Børnich, peker på hukommelse som en prioritert forskningsretning for hjemmeroboter.
«Jeg vil at roboten jeg har hjemme, husker meg, barna mine og familien min», sa Børnich til Newsweek.
Benchmarken kommer dermed akkurat når bransjen trenger et felles mål for en kapabilitet som til nå har manglet objektiv testing.
Forskernes formål
Kira var tydelig på hvorfor benchmarken ble laget, ifølge rapporteringen:
«Det fantes ikke en benchmark som kunne teste disse spesialiserte kapabilitetene vi kanskje ønsker fra en robot», sa Kira. «Vårt formål med å lage en er å stimulere forskning på dette området, slik at andre kan utvikle metoder for å løse problemet.»
Med andre ord: Målet er ikke å kåre en vinner, men å synliggjøre et spesifikt, målbart gap som forskere kan jobbe mot.
Åpne spørsmål
Rapporteringen etterlater flere viktige usikkerheter. Den oppgir ikke hvor godt resultatene på benchmarken oversettes til reelle roboters ytelse i faktiske hjem – hvordan oppgaveskårene henger sammen med fysisk robotikk i praksis, er ikke dokumentert i kildene. Det er heller ikke demonstrert at Kiras foreslåtte løsninger (tekstkonvertering og hierarkisk beskjæring) skalerer til den kontinuerlige datastrømmen en robot faktisk produserer.
Og det gjenstår å se om Qwen-modellens forsprang skyldes egenskaper ved selve modellen – for eksempel resonneringssteg – eller at dens arkitektur passer bedre med begrensningene i benchmarken. Uansett gir FINDINGDORY forskningssamfunnet, hvis tallene holder, noe rapporteringen beskriver som nytt: et felles, konkret mål på en kapabilitet hjemmerobotene i praksis er avhengige av.

