AI-stemmer afbryder nu brugeren midt i en sætning
Ny transskriptionsmodel skriver 60 sprog på godt 100 millisekunder, mens to talemodeller taler 23 sprog med samme stemme
Læs i dit tempo
Kort
Microsoft har lanceret lynhurtig tale-til-tekst på 60 sprog og to stemmer, der taler 23 sprog med lokal accent. Det giver mere naturlige samtaler, fordi digitale hjælpere kan svare mens brugeren taler, og stemmerne lyder næsten menneskelige. Modellerne kan nu prøves i Microsoft Foundry og MAI Playground til nedsat introduktionspris året ud.
Begynder
Tænk på en lynhurtig sekretær, der skriver med, mens du taler. Sådan virker Microsofts model med navnet MAI-Transcribe-2-Streaming. Den forstår 60 sprog. Den viser det første stykke tekst efter godt 100 millisekunder, altså godt en tiendedel af et sekund. Microsoft siger, at den er den mest præcise hos tjenesten Artificial Analysis, som sammenligner modeller. Det betyder, at et stemmeprogram, altså et program der taler med dig, kan begynde at svare, mens du stadig taler. En times lyd koster 0,54 dollar i en særlig startpris, som gælder året ud.
Hvad med stemmer, der kan tale mange sprog? Microsoft har også vist to nye modeller, der laver tale ud fra tekst. Den ene hedder MAI-Voice-2.1. Den kan tale 23 sprog med den samme stemme. Den skal lyde med den lokale måde at tale på i hvert sprog. Den anden hedder MAI-Voice-2.1-Flash. Den svarer efter 150 millisekunder, altså meget hurtigt. Den koster 15 dollar for en million tegn, altså bogstaver og andre tegn i teksten, mod en normal pris på 22 dollar.
Begge talemodeller kan efterligne en stemme ud fra kun få sekunders lyd. Du lægger et kort stykke lyd ind som eksempel. Så taler modellen videre med den stemme. Der er indbyggede værn, altså beskyttelse i systemet, som skal forhindre misbrug.
Modellerne kan bruges flere steder, blandt andet i Microsoft Foundry og i MAI Playground. De to talemodeller findes også hos tjenesten OpenRouter. I en test med 4.000 deltagere troede omkring halvdelen, at stemmerne kom fra et virkeligt menneske.

Microsofts model MAI-Transcribe-2-Streaming dækker 60 sprog og viser første delresultat efter godt 100 millisekunder. Modellen er bygget til løbende transskription, hvor teksten skrives mens der tales. Microsoft siger, at den ligger nummer et i nøjagtighed hos Artificial Analysis. Det gør det muligt for stemmeagenter at svare, mens brugeren stadig taler. En times lyd koster 0,54 dollar i introduktionspris året ud.
Microsoft har også lagt to nye talemodeller frem. MAI-Voice-2.1 taler 23 sprog med samme stemme og skal lyde med lokal accent på hvert sprog. Varianten MAI-Voice-2.1-Flash svarer efter 150 millisekunder. Den koster 15 dollar per million tegn mod normalt 22 dollar.
Begge talemodeller kan kopiere en stemme ud fra få sekunders lyd. Brugeren lægger et kort stykke reference-lyd ind, og modellen taler videre med den stemme. Indbyggede værn skal forhindre misbrug.
Modellerne findes i Microsoft Foundry og i MAI Playground, blandt andre steder. De to talemodeller ligger også på OpenRouter. I en test med 4.000 deltagere troede omkring halvdelen, at stemmerne tilhørte et virkeligt menneske.
Kilder
Produktionshistorie
- Radar Signal ? af 100 · spredning 1 kilder
- Vurdering Nyheds 4/5 — Nye tale-modeller til voice-agenter for udviklere.
- Skrevet Model: deepseek-v4-flash · temperatur 0.4
- Overskrift 5 kandidater, valgt af chat.dk
- Vedtagelse ainews-auto-v3 · score 0.4431