Microsoft julkaisi reaaliaikaisen puhetranskription ja MAI-Voice-2.1-äänimallit

0

Microsoft julkaisi 1. lokakuuta kolme uutta äänimallia: suoratoistavan puheentunnistusmallin MAI-Transcribe-2-Streamingin sekä puhesynteesimallit MAI-Voice-2.1 ja MAI-Voice-2.1-Flash.

aiuutiset.fi — Tekoälyuutiset suomeksi

Microsoft AI julkaisi 1. lokakuuta kolme uutta äänimallia. Merkittävin niistä on MAI-Transcribe-2-Streaming, yhtiön ensimmäinen suoratoistava puheentunnistusmalli: se tuottaa tekstiä sitä mukaa kun ihminen puhuu, sen sijaan että odottaisi tämän lopettavan. Mukana tulivat myös puhesynteesimallit MAI-Voice-2.1 ja sen nopeampi versio MAI-Voice-2.1-Flash. Kaikki kolme ovat saatavilla Microsoft Foundryn kautta.

Puhe tekstiksi kesken lauseen

Suoratoistotranskriptio tarkoittaa, että puhe muutetaan tekstiksi sitä mukaa kun sitä kuullaan, ei vasta tallenteen loputtua. Microsoftin mukaan malli tuottaa ensimmäiset arvauksensa eli osittaiset transkriptit hieman yli 100 millisekunnissa äänen vastaanottamisesta ja tarkentaa niitä, kun asiayhteyttä kertyy lisää. Lopullinen, vakaa transkriptio syntyy 0,13 sekunnissa.

Malli tukee 60 kieltä ja tunnistaa puhutun kielen automaattisesti ja jatkuvasti. Microsoftin mukaan malli on Artificial Analysis -vertailussa ensimmäisellä sijalla sekä lopullisten että osittaisten transkriptien tarkkuudessa. Vertailutestissä sen lopullinen virheprosentti on 2,5 prosenttia ja ensimmäisen osittaisen transkriptin 2,8 prosenttia. Yhtiön oman arvion mukaan sanat ilmestyvät transkriptiin kaksi kertaa nopeammin kuin lähimmällä kilpailijalla.

Käytännössä osittaiset transkriptit antavat tekoälyagentin alkaa toimia jo ennen kuin puhuja on lopettanut: se voi aloittaa päättelyn tai kutsua työkaluja kesken lauseen. Malli on esittelyhintaan 0,54 dollaria äänitunnilta vuoden loppuun saakka.

Kaksi puhesynteesimallia

MAI-Voice-2.1 on Microsoftin mukaan yhtiön vahvin monikielinen puhesynteesimalli eli tekstistä puheeksi -malli. Se tukee 23 kieltä ja 26 kielialuetta, ja sama ääni pystyy puhumaan kaikkia niitä natiivilla korostuksella. Puhujan ääni pysyy tunnistettavasti samana kieleltä toiselle siirryttäessä, joten esimerkiksi opetussovellus voi vaihtaa kieltä kesken oppitunnin ilman, että puhuja vaihtuu. Mallin hinta on 22 dollaria miljoonalta merkiltä.

MAI-Voice-2.1-Flash tukee samoja kieliä ja puhujia, mutta se on rakennettu suuren käyttömäärän ja matalan viiveen tarpeisiin. Se voi tuottaa enintään 45 sekuntia ääntä, ja viive päästä päähän on 150 millisekuntia. Microsoftin mukaan Flash on 55 prosenttia nopeampi laskea ja noin 60 prosenttia halvempi kuin vastaavat mallit, ja sen hinta on 15 dollaria miljoonalta merkiltä.

Äänen kloonaus ja suostumusrajoitteet

Molemmat puhemallit tukevat äänen kloonausta kaikilla tuetuilla kielillä. Kloonaus onnistuu muutaman sekunnin mittaisella referenssiäänitteellä, joten yritys voi ottaa käyttöön oman brändiäänensä. Mallit sisältävät Microsoftin mukaan sisäänrakennetut suostumusrajoitteet, joilla pyritään estämään väärinkäyttö.

Microsoft teetti 4 000 kuuntelijan Turing-testin, jossa yhdistettiin kaksi uutta puhemallia. Testissä 50,3 prosenttia kuuntelijoista arvioi MAI-Voicen yhtä ihmismäiseksi tai ihmismäisemmäksi kuin oikeat ihmistallenteet. Puhemalli on tekoäly, joka ymmärtää puhuttua kieltä ja vastaa puhumalla ilman, että puhe muutetaan ensin tekstiksi ja takaisin.

Miksi mallit julkaistiin yhdessä

Microsoft kuvaa ääniapuria silmukkana, jossa järjestelmän pitää kuulla, ymmärtää, päättää ja puhua. Jokainen osa joko säästää tai kuluttaa aikaa siinä ikkunassa, jossa ihminen kokee vuorovaikutuksen vielä keskusteluna. Yhdistämällä nopea puheentunnistus ja nopea puhesynteesi yhtiö pyrkii säästämään aikaa molemmista päistä, jolloin agentille jää enemmän aikaa päätellä, käyttää työkaluja ja tarkistaa vastauksensa.

Yhtiö listaa valmiita käyttötapauksia: asiakaspalveluagentit, jotka kirjoittavat pyynnön muistiin sitä mukaa kun se lausutaan ja vastaavat luonnollisella puheella, monikieliset avustajat, jotka tunnistavat puhutun kielen ja vastaavat samalla äänellä, sekä oppimis- ja mediasisällöt, joissa tarvitaan useita eri puhujia.

Saatavuus ja esittely

MAI-Voice-2.1 ja MAI-Voice-2.1-Flash ovat saatavilla OpenRouterissa. Kaikki kolme mallia ovat saatavilla Microsoft Foundryssa, MAI Playgroundissa, Vercelissä ja Azure Voice Livessä, ja LiveKit on tulossa myöhemmin. Näyttääkseen mallit yhdessä toiminnassa Microsoft rakensi Chatter-nimisen esittelyn MAI Playgroundiin. Siinä käyttäjä voi puhua ääniavustajalle, jota pyörittävät sekä puheentunnistus- että puhesynteesimallit.

Mallit täydentävät Microsoftin aiempaa MAI-äänimallistoa, johon kuuluu jo ei-suoratoistava puheentunnistusmalli MAI-Transcribe-2. Uusien mallien myötä yhtiö kiristää kilpailua puheteknologiassa muun muassa ElevenLabsia ja Deepgramia vastaan.

Lähteet

Microsoft AI: Our first streaming transcription model debuts at no. 1 on Artificial Analysis, 1.10.2026. https://microsoft.ai/news/our-first-streaming-transcription-model/

Unite.AI: Microsoft Launches MAI-Transcribe-2-Streaming and Two MAI-Voice Models, 1.10.2026. https://www.unite.ai/microsoft-launches-mai-transcribe-2-streaming-and-two-mai-voice-models/

Progressive Robot: MAI Playground: Microsoft Adds Powerful, Quick Voice Models, 1.10.2026. https://www.progressiverobot.com/2026/10/01/mai-playground-microsoft-mai-voice-transcribe-models/

All Weather Finance: Microsoft launches three new voice AI models: MAI-Voice 2.1 tops the benchmark for real-time text-to-speech accuracy, 1.10.2026. https://allweatherfinance.com/microsoft-launches-three-new-voice-ai-models-mai-voice-2-1-tops-the-benchmark-for-real-time-text-to-speech-accuracy-covering-23-languages/

WinCentral: Microsoft Launches MAI Voice AI Models for Real-Time Conversations, 2.10.2026. https://thewincentral.com/microsoft-mai-voice-ai-models-real-time-conversations/

AlphaSignal: Microsoft’s MAI-Transcribe-2-Streaming Tops 38 Models With 2.5% Error Rate, 1.10.2026. https://alphasignal.ai/news/microsoft-s-mai-transcribe-2-streaming-tops-38-models-with-2-5-error-rate

OrcaRouter: MAI-Transcribe-2-Streaming: Microsoft’s 2.5% WER claim, 1.10.2026. https://www.orcarouter.ai/blog/mai-transcribe-2-streaming-release


Vastuuvapauslauseke: Tämä artikkeli on tarkoitettu vain tiedotustarkoituksiin. Sitä ei tarjota tai ole tarkoitettu käytettäväksi oikeudellisena, verotuksellisena, sijoitus-, rahoitus- tai muuna neuvona.

Mainos: alla on kumppanimainoksia ja mainoslinkkejä.

Kvarn X – kryptot, osakkeet ja ETF:t samassa paikassa

Coinmotion – suomalainen kryptopalvelu vuodesta 2012

Leave a Reply

Pakolliset kentät on merkitty *