Koordinater i stedet for fritekst: Flux 3 Image redigerer bilder via JSON-rutenett fra 0 til 1000

Black Forest Labs lanserte Flux 3 Image 1. oktober 2026 og fullfører med det bildegrenen av sin multimodale Flux 3-familie. Selskapet lover redigering i flere trinn der resten av bildet blir urørt — men selskapets egne publiserte målinger…

Et fotografi delt opp i et presist rutenett av tynne koboltblå linjer, der én eneste rute er løftet litt ut av posisjon og avslører et annet bilde under. Redaksjonell still-life i kremhvitt, svart og kobolt.
Gi artikkelen

Koordinater i stedet for fritekst: Flux 3 Image redigerer bilder via JSON-rutenett fra 0 til 1000

Black Forest Labs lanserte Flux 3 Image 1. oktober 2026 og fullfører med det bildegrenen av sin multimodale Flux 3-familie. Selskapet lover redigering i flere trinn der resten av bildet blir urørt — men selskapets egne publiserte målinger viser at mellom 67,8 og 89,7 prosent av pikslene forblir uendret i de offentliggjorte eksemplene. Det er stor, men langt fra fullstendig bevaring, og spenningen mellom markedsføringen og tallene er kanskje den mest interessante delen av lanseringen.

Hva modellen dekker

Flux 3 Image er bildesiden av Flux 3-familien og dekker ifølge Black Forest Labs tekst-til-bilde, bilde-til-bilde, tekstgjengivelse og fotorealisme. Flerrinnsredigering — altså at man kan gjøre flere endringer etter hverandre uten at andre deler av bildet endres — er BFLs egen påstand, ikke noe som er uavhengig verifisert (The Decoder).

I praksis betyr det at brukeren kan sette sammen scener med bounding-bokser, inkludere opptil ti referansebilder og produsere utdata opptil 4K. En gratis demo er tilgjengelig.

Hvordan koordinatsystemet fungerer

Den tekniske kernen er et strukturert JSON-sceneoppsett. Hvert element i scenen har en ID, en beskrivelse og koordinater. Koordinatene mappes til et normalisert rutenett fra 0 til 1000, målt fra bildets øverste venstre hjørne, i rekkefølgen [topp, venstre, bunn, høyre] — ifølge en MSN-syndikert artikkel som beskriver dokumentasjonen i BFLs materialer (MSN).

I stedet for å beskrive ønsket endring i fritekst alene, kan man altså angi nøyaktig hvor i bildet elementet skal være, med maskinlesbare identifikatorer. Det gjør komposisjonen deterministisk på et nivå ren tekstoppskriving sjelden er.

Hva BFLs egne tall faktisk viser

Det er her det blir nyansert. BFL har selv publisert piksel-differanse-målinger av redigeringsoperasjoner, gjengitt av MSN-artikkelen:

  • Fjerning av en katt: 80,7 prosent av totale bildepiksler identiske
  • Tillegging av en fugl: 86,4 prosent uendret
  • Trykk på en skjorte: 89,7 prosent intakt
  • Re-farging av hår: 67,8 prosent uendret — det laveste tallet i de publiserte eksemplene

Enkeltrammene i artikkelen presenterer dette sterkere, med formuleringer om at piksler utenfor valgt område bevares «bit-identisk». Men tallene BFL selv har publisert viser noe annet: store, men delvise bevaringer. MSN-artikkelen peker selv på at hårre-farging nødvendigvis «blør» farge inn i umiddelbart tilstøtende regioner, og kaller 67,8-prosent-tallet en meningsfull avsløring om garantiens grenser.

Hvorfor tallene ikke er 100 prosent — om de reflekterer total rammeflate, etterglid i modellen eller noe annet — forklares ikke i det tilgjengelige materialet. Det viktigste for leseren er dette: målingene er selskapspubliserte, videreformidlet gjennom sekundær rapportering, og ikke uavhengig verifisert. De viser samtidig en uvanlig grad av åpenhet: BFL kunne valgt å ikke publisere dem.

Agent-perspektivet: JSON som prosjekttilstand

MSN-artikkelen foreslår en videre lesning: Fordi element-ID-er og koordinater er stabil JSON-tilstand, kan en LLM-agent behandle elementtabellen som en vedvarende prosjektfil på tvers av samtalerunder — og redigere enkeltelementer uten å regenerere urørte regioner.

Dette er artiklenes analyse av arkitekturen, ikke en dokumentert kapasitet eller et benchmark. Men det peker på hvorfor JSON-basert sceneoppsett kan bli viktigere enn det ser ut: Et bilde som er beskrevet i maskinlesbar struktur kan i prinsippet redigeres programmatisk, ikke bare av mennesker som skriver instruksjoner.

Pris, lisensiering og åpen vektkappløp

Tidsvinduet er stramt. API-tilgang er 50 prosent rabattert frem til og med 8. oktober. Selskaper kan lisensiere kommersielle vekter for å kjøre og finjustere modellen på egen infrastruktur. En åpen vektversjon forventes «i kommende uker», ifølge The Decoder — ingen konkret dato er oppgitt.

Konteksten er en aktiv konkurranse om nettopp redigeringsfokuserte bildemodeller. Kort tid før lanseringen kunngjorde Ideogram sin egen redigeringsmodell, versjon 4.5, som også er ventet som åpne vekter snart. At begge selskapene åpner vektene sine, betyr at sammenligninger på egne maskiner — inkludert uavhengige tester av bevaringspåstandene — snart skal være mulig.

Hva som gjenstår å svare på

Tre spørsmål står åpne. For det første den tekniske: Hva betyr egentlig 67,8–89,7 prosent uendrede piksler i praksis, og hvorfor stemmer det ikke overens med «bit-identisk»-formuleringen i det samme materialet? Uavhengige målinger vil kunne avklare dette når vektene kommer. For det andre det kommersielle: Om den åpne vektversjonen blir lik API-modellen, og hvilke restriksjoner kommersiell lisensiering innebærer, er uklart i det tilgjengelige materialet. For det tredje det konkurransestrategiske: Ideogram 4.5 er kunngjort, men ikke lansert — det konkrete sammenligningsgrunnlaget mellom de to redigeringsmodellene finnes foreløpig ikke.

Foreløpig står det fast: Flux 3 Image bringer et strukturert, koordinatbasert redigeringssystem ut til brukere, med en rabattperiode som utløper 8. oktober, og BFL har publisert egne tall som viser både styrken og grensene i bevaringspåstanden.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.