Ny talemodell kloner stemmer fra ti sekunder lyd og støtter over 90 språk

Tekst-til-tale-selskapet ElevenLabs lanserte 28. september 2026 sin nyeste talemodell Eleven v4, sammen med en lavlatensvariant kalt v4 Turbo bygget for sanntidsagenter.

Illustrasjon: én spole med lydbånd deler seg i dusinvis av tynne, fargede tråder som fanner ut over et varmt papirbakgrunn – én stemme som mangfoldiggjøres i mange språk.
Illustrasjon
Gi artikkelen

Ny talemodell kloner stemmer fra ti sekunder lyd og støtter over 90 språk

Tekst-til-tale-selskapet ElevenLabs lanserte 28. september 2026 sin nyeste talemodell Eleven v4, sammen med en lavlatensvariant kalt v4 Turbo bygget for sanntidsagenter. Ifølge det uavhengige benchmarkingfirmaet Artificial Analysis havnet v4 på førsteplass på deres lyd-lederboard timer etter lanseringen — men de fleste kvalitets- og latenstall i lanseringen er selskapets egne målinger.

Hva som er nytt i v4

Den mest synlige endringen er hvordan brukere styrer talen. Der tidligere versjoner brukte SSML-tagger (Speech Synthesis Markup Language), er SSML nå deaktivert i v4, ifølge produktssidens ofte stilte spørsmål som Unite.AI har gjengitt. I stedet leser modellen naturlig-språk-instruksjoner og inline-lydtagger direkte i teksten, som [laughs], [said angrily in French accent], [light rain] og [phone buzzing] — altså ler, sier sint på fransk aksent, lett regn og telefonen vibrerer.

TechCrunch skriver at v4 bygger på en ny arkitektur som utvider uttrykkstaggene som ble innført med v3, og som ifølge selskapet gir bedre stemmekonsistens over lange tekster — et velkjent problem der syntetiske stemmer kan gli bort fra originalens klang midt i et opptak.

Språk og stemmekloning

Språkstøtten øker fra 70 til mer enn 90 språk. ElevenLabs oppgir at den største kvalitetsforbedringen er observert i japansk, brasiliansk portugisisk, mandarin og kantonesisk — ifølge TechCrunchs gjengivelse av selskapets egne vurderinger, ikke en uavhengig måling.

Også kloningsterskelen er satt kraftig ned: Med v4 skal det ifølge selskapet (gjengitt av TechCrunch) være nok med ti sekunder lyd for å klone en stemme. Det gjør verktøyet langt mer tilgjengelig — og langt lettere å misbruke, noe vi kommer tilbake til.

Turbo: latens for sanntidsagenter

Eleven v4 Turbo er rettet mot sanntids taleragenter, der farten til første ord avgjør om en samtale føles naturlig. Her er det viktig å skille to tall som ElevenLabs oppgir, og som Windows Report skiller mellom:

  • ~100 ms median inferenslatens — tiden modellen bruker på selve genereringen.
  • ~150 ms median time-to-first-speech — tiden fra forespørsel til første tale, altså det brukeren merker.

Begge tallene er selskapsoppgitte. Ifølge metodikken i lanseringsinnlegget, som Unite.AI beskriver, ble målingene utført i september 2026 via WebSocket-streaming med identiske skript og standardoppsett, med nettverkslatens målt og fjernet for alle systemene. I samme sammenligning oppgir ElevenLabs at Cartesia Sonic 3.6 ligger på 262 ms og OpenAI GPT-4o mini TTS på 814 ms i tid til første tale; konkurrentenes xAI TTS og Google Gemini Flash-Lite TTS ble også testet. Siden tallene stammer fra ElevenLabs' egne benchmarker, er de ikke uavhengig verifisert.

Hva er uavhengig, og hva er selskapets egne tall?

Det finnes ett uavhengig datapunkt: Artificial Analysis' lyd-lederboard, der lyttere vurderer anonyme prøver side om side, plasserte v4 på førsteplass timer etter lanseringen, ifølge Martin Cid Magazine.

Derimot er tallet om at rundt tre av fire lyttere foretrakk v4 i blinde sammenligninger med konkurrentene basert på ElevenLabs' egne tester, og må attribueres selskapet. Det samme gjelder alle latens- og språkkvalitetstallene ovenfor. Lesere som vil vurdere modellen selv, bør altså legge mest vekt på lederboard-resultatet — som er basert på lytternes rangering av anonyme prøver — og vente på flere uavhengige målinger av latens og kvalitet.

Praktiske detaljer: tilgang og priser

Begge modellene er tilgjengelig umiddelbart i ElevenAgents, ElevenCreative og via ElevenLabs' API, med tilgang inkludert i gratisplanen, ifølge Unite.AI. Gratisplanen er imidlertid liten: rundt ti minutter generert lyd i måneden, ifølge Unite.AIs gjennomgang som Martin Cid Magazine gjengir. Betalte planer starter på 6 dollar i måneden.

Lanseringsinnlegget er skrevet av selskapets grunnleggere Mati Staniszewski og Piotr Dabkowski, ifølge Unite.AI.

Misbruk og sikkerhet

Ti sekunder lyd er nok til å lage en overbevisende klon, og det gjør svindel og stemmeimitasjon til en reell risiko — et poeng Martin Cid Magazine fremhever i sin dekning. Beskyttelsen består blant annet av krav om verifisert samtykke for umiddelbare kloner, og at generert lyd merkes av ElevenLabs' AI Speech Classifier, ifølge produktssidens FAQ. Men som magasinet påpeker, hviler en del av ansvaret på at den som laster opp lyd faktisk har rett til den. Et system som aksepterer ti sekunder, har begrenset mulighet til å stoppe noen som har ti sekunder av andres stemme.

Konteksten: rask vekst mot børskurs

Lanseringen kommer i en hektisk periode for selskapet. ElevenLabs samlet tidligere i år inn 500 millioner dollar fra Sequoia i en runde som verdsatte selskapet til 11 milliarder dollar, skriver TechCrunch. Selskapets annualiserte inntekt har steget fra rundt 330 millioner dollar ved årets begynnelse til over 600 millioner dollar. Ifølge TechCrunch har det dessuten svirret rykter om en ny runde til 22 milliarder dollar — rykter som verken er bekreftet eller dementert.

Grunnlegger og daglig leder Mati Staniszewski har overfor TechCrunch sagt at selskapet sikter mot en børsnotering i årene som kommer, uten å binde seg til en dato.

Det som gjenstår å se

V4 lanseres i et marked med hard konkurranse fra Google, OpenAI, Cartesia, Deepgram og Fish Audio, og Artificial Analysis' første rangering er bare en tidlig indikator. Det uavklarte er hvor stabil kvaliteten er over lengre tekster og i alle de 90+ språkene, om konkurrentene svarer med egne latensforbedringer, og hvor godt samtykke- og vannmerke-ordningene fungerer i praksis når kloningsterskelen nå er ti sekunder. Inntil flere uavhengige benchmarker foreligger, er det fornuftig å lese selskapets tall som mål — ikke som fakta.

Få de viktigste AI-nyhetene i innboksen

Nyheter, analyser og verktøy samlet for deg.