Ny Qwen-Image-Turbo kutter diffusjonstrinn til åtte – men ikke fem ganger raskere i praksis

Alibabas Qwen-team lanserte 9. oktober 2026 Qwen-Image-2.1-Turbo, en akselerert versjon av sitt åpne bildegenererings­modell som genererer og redigerer bilder i åtte denoising-trinn i stedet for 40 – med billigere vertsbasert API, men kun…

Illustrasjon: Førti bittesmå letrinn i rekke hvor bare de åtte første er skarpe og blå – en visuell metafor for diffusjonsmodellen Qwen-Image-Turbo som kutter antall denoising-trinn fra førti til åtte.
Illustrasjon

Ny Qwen-Image-Turbo kutter diffusjonstrinn til åtte – men ikke fem ganger raskere i praksis

Alibabas Qwen-team lanserte 9. oktober 2026 Qwen-Image-2.1-Turbo, en akselerert versjon av sitt åpne bildegenererings­modell som genererer og redigerer bilder i åtte denoising-trinn i stedet for 40 – med billigere vertsbasert API, men kun forskningslisens på vektene.

Alibabas Qwen-team har lansert Qwen-Image-2.1-Turbo, et akselerert sjekkpunkt av selskapets bildegenereringsmodell Qwen-Image-2.1, skriver MarkTechPost 9. oktober 2026. Den grunnleggende modellen ble ifølge Lapaas Voice, som siterer Qwens offisielle modellrepositorium, utgitt 20. september 2026. Tre uker senere følger altså Turbo-varianten: samme arkitektur, samme parametervolum – men et denoising-opplegg som bruker åtte trinn i stedet for grunnmodellens standard på 40.

Hva som endret seg

Qwen-Image-2.1-Turbo genererer og redigerer bilder i åtte denoising-trinn mot grunnmodellens standard på 40, på samme 7B-arkitektur. Målet er, ifølge Lapaas Voice, å redusere regnebehovet for bildegenerering samtidig som modellen beholder støtten for detaljerte bilder, tekstgjengivelse og instruksjonsbasert bilderedigering.

I praksis betyr det færre diffusjonstrinn per bilde – den delen av genereringen som normalt dominerer beregningstiden. Modellen lastes direkte via QwenImage21Pipeline i Diffusers, rapporterer MarkTechPost fra Qwens modellkort.

Arkitekturen under panseret

Turbo bygger på samme tekniske grunnlag som Qwen-Image-2.1: en single-stream DiT (diffusion transformer) med 32 lag og 7 milliarder parametre. Modellen bruker block-causal attention, der tekst-tokens får en causal-maske på token-nivå, mens bilder bruker en bidireksjonal maske på chunk-nivå. Tekstkoderen er Qwen3-VL 8B, og en 64-kanals RGBA-VAE muliggjør naturlig gjennomsiktighet i genererte bilder, ifølge modellkortet slik det gjengis av MarkTechPost.

En implementeringsdetalj som kan lure utviklere

En viktig praktisk detalj: Tidsplanen på åtte trinn er lagret inne i selve sjekkpunktet. Å sette num_inference_steps alene overstyrer den ikke – da kjører modellen fortsatt med den lagrede planen. Kun et eksplisitt sigmas-argument endrer den, og Qwen opplyser at andre tidsplaner er utestet. Utviklere som antar at de kan tune trinntallet fritt via den vanlige parameteren, kan altså tro at de endrer noe som faktisk er fastlåst.

Pris og tilgang: to helt forskjellige veier til modellen

Tilgangen deler seg i to spor med svært ulike vilkår:

  • Hostet API via Alibaba Cloud Model Studio: qwen-image-2.1-turbo koster 0,1 yuan per bilde i de fleste regioner, med en grense på 120 forespørsler per minutt. Sammenlignet med qwen-image-2.1-pro (0,25 yuan per bilde, 20 forespørsler per minutt) er Turbo altså 60 prosent billigere og seks ganger høyere på hastighetsgrensen – tallene er imidlertid hentet fra én enkelt kilde, MarkTechPost.
  • Vektene for nedlasting: Distribueres under Qwen Research License, som kun tillater forskningsbruk. Kommersiell selvhosting krever separat tillatelse. Det er derfor misvisende å kalle vektene «åpen kildekode» i vanlig forstand – lisensen stenger ute kommersiell bruk uten forhandling.

For bedrifter betyr det at den billige, raske veien til modellen går gjennom Alibabas egen sky, ikke gjennom egne GPU-er.

Ikke forvent fem ganger raskere generering

Færre trinn betyr ikke automatisk femdobling av hastigheten fra ende til ende. Som Lapaas Voice peker på, avhenger total kjøretid også av modellasting, maskinvare, tilgjengelig minne, bildeoppløsning, programvareoptimaliseringer og andre prosesseringskostnader. Diffusjonstrinnene er bare én komponent i den totale latensen.

På minnekrav finnes ingen offisielt publisert minimum for Turbo. Unsloth anslår – ifølge MarkTechPost – 11 GB for GGUF-kvantiserte versjoner og 24 GB for INT8/FP8, men det gjelder grunnmodellen, ikke Turbo-sjekkpunktet.

Hva som er verifisert – og hva som ikke er det

Mye av historien hviler på Qwens egne opplysninger, videreformidlet gjennom to dekninger (MarkTechPost av Asif Razzaq og Lapaas Voice), som begge ser ut til å bygge på samme modellkort snarere enn å korrobore hverandre uavhengig.

Et nøkkeltall bør håndteres med særlig forsiktighet: Grunnmodellen Qwen-Image-2.1 skal score 60,28 på Qwen-Image-Bench – den høyeste poengsummen Qwen rapporterer blant modeller med åpne vekter. Men dette er en selskapsrapportert benchmark, og den gjelder grunnmodellen, ikke Turbo. Det finnes ingen uavhengige benchmarks av Turbo selv, og uavhengig evaluering under sammenlignbare betingelser mangler.

Åpne spørsmål

Tre forhold forblir åpne. For det første: Hvor godt holder bildekvaliteten ved åtte trinn når uavhengige tester kommer? Kvalitetsfall ved aggressiv trinnreduksjon er et velkjent fenomen i diffusjonsmodeller, men vi mangler foreløpig data på Turbo. For det andre: Vil Qwen tilby kommersielle lisensvilkår på definerte betingelser, eller forblir selvhosting for kommersiell bruk en sak-for-sak-vurdering? For det tredje: Enkeltdetaljer – som 40-trinnsstandarden, API-prisene og VRAM-anslagene – stammer fra én kilde og er ikke bekreftet av den andre dekningen, så de bør leses som rapporterte opplysninger snarere enn fullt verifiserte fakta.

For utviklere som vurderer bildegenereringsmodeller akkurat nå, er likevel hovedbudskapet konkret: Turbo tilbyr en billige, høygjennomstrømmings-vertsbasert rute fra dag én – mens den virkelig åpne ruten, med egne vekter i egen drift, foreløpig kun er tilgjengelig for forskning.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.