Tilbake
AI-nyheter

Mistral slår LiDAR-roboter med 4,5 poeng – med bare ett kamera

Mistral AI lanserer sin første robotnavigasjonsmodell, Robostral Navigate, trent helt i simulering. Med ett vanlig RGB-kamera oppgir selskapet 76,6 prosent suksess på R2R-CE – 4,5 poeng foran de beste systemene med LiDAR og dybdesensorer. Om tallet holder utenfor benchmarken, endrer det hva en robot koster å bygge.

AIMag.no
AIMag.no
31. august 2026 · 5 min
Illustrasjon: ett enkelt kameraobjektiv står alene i skarpt lys på en blek overflate, mens et utydelig ansamling av dybdesensorer og flerkamerarigger ligger skjøvet til side i kanten av bildet.

Instruksen er helt vanlig språk: «Leave the lobby, walk through the corridor, enter the supply room, and stop to face the second shelf.» Ifølge Mistral AI klarer en robot å fullføre hele ruten på egen hånd – gjennom en arbeidsplass fulle av mennesker og hinder den aldri har sett før. Det eneste sansesystemet dens er ett ordinært RGB-kamera. Ingen LiDAR. Ingen dybdesensorer.

I dag lanserer det franske selskapet Robostral Navigate, sin første modell for innebygd navigasjon. Et 8B-modell – åtte milliarder parametre – som tar bilde og en instruksjon i vanlig språk og beveger roboten gjennom omgivelsene. Men den egentlige nyheten er ikke hva modellen gjør. Det er hva den klarer seg uten.

Tallene, med et forbehold

Mistral oppgir at Robostral Navigate oppnår 76,6 prosent suksess på R2R-CE (Room-to-Room in Continuous Environments) validation unseen – benchmarken for å følge instruksjoner i omgivelser holdt utenfor treningen – og 79,4 prosent på validation seen. Selskapet hevder modellen slår den beste tilnærmingen med ett kamera med 9,7 poeng og det beste systemet som bruker dybdesensorer eller flere kameraer med 4,5 poeng.

Disse resultatene er altså selskapets egne, ikke uavhengig verifiserte, og benchmarken er valgt av selskapet selv. Det er likevel en påfallende påstand: Hele robotindustrien har i årevis bygget navigasjonsstabler på antagelsen om at bedre roboter krever bedre sensorer. Dybdekamera, LiDAR og flertrådede sensorrigger er dyre, tunge og krevende å kalibrere. Mistral hevder det motsatte – at subtraksjon slår addisjon.

Mekanismen: å peke i stedet for å måle

Hvordan kan en modell uten dybdemåling navigere et kontor? Svaret ligger i hva modellen faktisk produserer. Gitt en oppgave og en historikk av observasjoner, bruker Robostral Navigate det Mistral kaller pointing: Den forutsier bildekoordinatene til målplasseringen i robotens nåværende kameravisning, sammen med ønsket orientering – og beveger seg dit.

Med andre ord: Modellen trenger ikke den slags sensorinformasjon som forteller hvor alt befinner seg i volum. Den trenger bare å peke på neste punkt i sitt eget synsfelt, gjentatte ganger, helt til instruksjonen er utført. For enkle gjenstander og gulvplan fungerer et vanlig kamera overraskende langt som grunnlag for denne typen beslutninger.

Ifølge Mistral er modellen finjustert med forsterkningslæring, slik at den forbedrer seg gjennom prøving og feiling. Treningen skal også være token-effektiv gjennom såkalt prefix-caching, en teknikk som gjenbruker beregninger i stedet for å regne dem ut på nytt.

Ingen år med kjøreturer i virkeligheten

Den kanskje mest ambisiøse detaljen står i treningen: Modellen er bygget internt hos Mistral og trent helt i simulering. Ingen flåte av fysiske roboter. Ingen år med innsamlede kjøreturer i virkeligheten. Bare simulerte omgivelser.

Det er her selskapet gjør noe lurt økonomisk. Datainnsamling i fysisk verden er en av de dyreste postene i moderne robotikk – hele selskaper er bygget for å skaffe treningsdata fra ekte maskiner. En modell som når toppresultater på rein simulering, trenger verken flåten eller dataene.

Mistral oppgir videre at samme modell kjører på hjulgående, beinte og flyvende roboter, generaliserer på tvers av robotstørrelser og er robust for ulikheter i kamerakalibrering. Det siste er praktisk viktig: Hvis modellen krever en bestemt kamertype, er det en låsinn på leverandør. Hvis den tåler vilkårlige intrinsiske egenskaper, kan den i prinsippet slippes løs på eksisterende flåter.

Hva dette betyr for regnskapet

Konsekvensen er først og fremst økonomisk. En navigasjonsstabel uten LiDAR og dybdesensorer kutter materialkostnaden for hver enkelt robot – og bedrifter innen produksjon, levering, logistikk og hotellbransjen er akkurat nå i ferd med å budsjettere nettopp slike navigasjonssystemer. Mistral skriver selv at dette er blant de mest etterspurte evnene blant kundene deres, og plasserer lanseringen direkte inn i markedet for varehus-, leverings- og logistikkroboter.

En enkelt generell modell som kan byttes inn i flere robotplattformer, endrer også innkjøpslogikken: I stedet for å kjøpe sensorer for å kompensere for snever programvare, kan man kjøpe programvare som sparer sensorer. Det er en omvendt regnestykke enn bransjen har vant seg med.

Simulering mot virkelighetens gulv

Motkraften er like reell. Resultatene kommer fra en benchmark selskapet selv valgte, og treningen har aldri forlatt simuleringen. Historien om sim-to-real-overføringer i robotikk er full av modeller som var briljante på skjermen og skjøre på et ekte gulv – der lys skifter, gulv er skitne, og mennesker beveger seg uforutsigbart.

Mistral oppgir at modellen håndterer lange instruksjonsruter fullautonomt gjennom en arbeidende arbeidsplass, men selskapet har ikke publisert feilrater fra reelle, langvarige utplasseringer. Nettopp der – i langvarig drift i fysiske omgivelser – har sensorredundans historisk sett tjent sin pris. En ekstra LiDAR er forsikring mot akkurat de situasjonene ingen har trent på.

Selskapet rammer selv inn lanseringen som et første steg mot det det kaller en samlet, innebygd agent – én modell som kan mer enn å navigere.

Spørsmålet lanseringen tvinger frem

Hvis 76,6-prosent-tallet holder utenfor benchmarken, har Mistral vist noe viktigere enn en modell: at den dyreste sensoren i en robot kan være den programvaren har lært seg å klare seg uten. Da er neste spørsmål ikke teknisk, men kommersielt – hva skal de gjenværende sensorene egentlig koste, og hvem har råd til å fortsette å betale for dem?


Kilder: Mistral AI: «Robostral Navigate: single-camera AI navigation» (primærkilde: selskapets egen kunngjøring; alle resultattall og påstander om ytelse er selskapets egne og ikke uavhengig verifisert).