Case-studier5 min

Blindtest av norsk tekst-til-tale: 1 314 sammenligninger

159 norske lyttere avgjorde 1 314 blinde sammenligninger mellom fem tekst-til-tale-systemer. Her er resultatene, inkludert den ene kategorien vi ikke vant.

Vi ba 159 nordmenn dømme stemmen vår uten å fortelle dem at den var vår. Ved siden av lå fire konkurrenter, og oppgaven var bare å velge klippet som hørtes mest norsk ut.

Kvad er en norsk tekst-til-tale-tjeneste (TTS) bygget på norsk tale fra bunnen av, ikke en engelsk modell med norsk lagt på toppen. Problemet med den påstanden er at den som leser den ikke kan etterprøve den. Så 10. august 2026 lagde vi tallene: 1 314 gyldige parvise sammenligninger fordelt på ni kategorier norsk tale. Kvad Delta vant 76,3 % av dem. I én kategori vant vi ingenting.

Hvordan testen var satt opp

Hver deltaker hørte to klipp av samme setning, lest av to forskjellige systemer, uten å se navnene. Oppgaven var å velge klippet som hørtes mest naturlig norsk ut. Ni par per økt, ett fra hver kategori.

Systemene var Kvad Delta, Cartesia Sonic 3.5, Microsoft Azure, ElevenLabs Flash v2.5 og Google Chirp 3 HD, alle med sin beste norske stemme på testtidspunktet. 185 personer startet testen, 159 av dem avga minst én gyldig stemme, og 138 fullførte hele økten på ni par.

Deltakerne brukte i snitt 18,6 sekunder på hvert valg og spilte av klippene 2,64 ganger før de bestemte seg. Median beslutningstid var 15,0 sekunder. Det er ikke folk som klikker seg gjennom for å bli ferdige. Ingen av de 1 314 stemmene måtte forkastes.

Oppsettet, de ni testsetningene og eksklusjonskriteriene ligger i sin helhet på siden med full metodikk og alle ni kategorier.

Hva sa de 1 314 stemmene?

Samlet vinnrate, altså andel vunne sammenligninger av alle kampene systemet deltok i:

SystemVinnrateSeire av kamper
Kvad Delta76,3 %556 av 729
Cartesia Sonic 3.560,5 %288 av 476
Microsoft Azure35,2 %167 av 475
ElevenLabs Flash v2.533,9 %161 av 475
Google Chirp 3 HD30,0 %142 av 473

Cartesia var den eneste som ga reell motstand. Møtt direkte vant Kvad 114 mot 69, altså rundt 62 %. Mot Azure, ElevenLabs og Google var avstanden større: 144–38, 151–31 og 147–35.

To av de ni kategoriene sier mer enn de andre, fordi de treffer der norsk talesyntese vanligvis ryker.

Tall og penger ga den høyeste vinnraten i testen, 90,1 % (64 av 71). Setningen var «Prisen er 149,95 kroner, en økning på 3,5 prosent siden i fjor.» Systemer som er trent på engelsk leser gjerne desimaltall og beløp med engelsk frasering. Skal du lese ut fakturabeløp i en IVR-løsning, er det denne feilen kunden hører først.

Stedsnavn ga 84,0 % (63 av 75). Geiranger, Bardufoss og Hammerfest har trykk- og tonelagsmønstre en generisk flerspråklig modell ikke har noe grunnlag for å gjette riktig. Leser du opp adresser, holdeplasser eller avganger, er stedsnavn ikke en detalj i teksten. Det er hele beskjeden.

Kategorien vi ikke vant

I opplest nyhetstekst vant Kvad Delta 36 av 73 sammenligninger. 49,3 %. Det er ikke et tap, men det er heller ingen seier. Det er et myntkast, og den eneste av de ni kategoriene der lytterne ikke klarte å skille oss fra konkurrentene.

Vår hypotese, som dataene ikke beviser: nyhetsopplesning er den mest konvensjonaliserte taleformen som finnes på norsk. Jevnt tempo, flat følelse, forutsigbar frasering. Det er også registeret de store engelskspråklige modellene har mest av i treningsdataene sine. Der de åtte andre kategoriene belønner naturlig og litt uforutsigbar norsk prosodi, belønner denne kategorien det motsatte. Da forsvinner forspranget vårt.

Det er en hypotese. Vi har ikke kjørt testen som skal til for å bekrefte den, og vi skriver den ikke her for å forklare bort resultatet. Tallet står som det står.

En test vi har laget selv

Denne testen er utformet, gjennomført og publisert av Kvad, som selv er ett av de fem systemene i den. Vi valgte kategoriene. Vi valgte setningene. Vi rekrutterte deltakerne. Alt det er grunn til å lese resultatet med skepsis, og vi hadde gjort det samme i din situasjon.

Legg også merke til noe i tabellen over: Kvad deltok i flere sammenligninger enn de andre, 729 mot rundt 475 hver. Testplanen vektet parene mot oss, fordi det var vår egen modell vi ville måle. Vinnraten er en andel og blir ikke høyere av flere kamper, men det betyr at vårt tall hviler på et bredere grunnlag enn konkurrentenes innbyrdes tall gjør.

Det eneste vi kan gjøre med det, er å legge fram grunnlaget i stedet for bare konklusjonen. Hele datasettet ligger åpent som nedlastbar JSON, med én rad per stemme. Alle ni testsetningene er publisert ordrett, så du kan mate dem inn hos hvilken som helst leverandør og høre etter selv. Alle 20 systemparene ligger i krysstabellen, ikke bare de fire der vi vant.

Et resultat som hadde gått vår vei i alle ni kategoriene, ville vært et salgsargument og ikke et måleresultat. Derfor står nyhetstallet på 49,3 % like tydelig på blindtest-siden som de åtte kategoriene der vi gjorde det bra.

Det vi ikke vet ennå, er hvordan resultatene ser ut for lengre tekster. Ni enkeltsetninger sier lite om hvordan et system holder på tonefallet gjennom et kapittel eller en hel kundesamtale. Det er den testen vi vil kjøre neste gang, og den kommer til å bli publisert på samme måte, uansett hva den viser.

I mellomtiden kan du høre Delta lese din egen tekst på produktsiden. Gjerne de samme ni setningene som konkurrentene fikk, så slipper du å ta vårt ord for noe som helst.

Vanlige spørsmål

Kan jeg etterprøve tallene selv?
Ja. Hele datasettet ligger åpent som JSON på /blindtest, med én rad per stemme: kategori, testsetning, de to systemene som ble sammenlignet, hvilket som vant, beslutningstid og antall avspillinger. Filen inneholder ingen personopplysninger. Du kan regne ut alle tallene i denne artikkelen på nytt fra den.
Hvorfor skal jeg stole på en blindtest Kvad har gjennomført selv?
Du skal ikke stole på den. Du skal etterprøve den. Vi har utformet, betalt for og publisert testen, og vi er selv ett av de fem systemene i den. Det er nettopp derfor rådata, testsetninger og eksklusjonskriterier ligger åpent framfor bare konklusjonen. En vinnrate uten datagrunnlag er en påstand, ikke et resultat.
Hva betyr det at Kvad bare vant 49,3 % på nyhetsopplesning?
Det betyr at lytterne ikke klarte å skille Kvad Delta fra konkurrentene på opplest nyhetstekst. 36 seire av 73 sammenligninger er statistisk sett et myntkast. Skal du bruke syntetisk tale utelukkende til opplesning av nyhetstekst, er dette den ene kategorien der resultatene våre ikke gir deg noen grunn til å velge oss framfor de andre.