Zum Hauptinhalt springen
S-EDV news
← Alle News
Künstliche Intelligenz 03.10.2026 · 5 min Lesezeit

Microsoft MAI-Transcribe-2-Streaming und MAI-Voice-2.1: Bausteine für Voicebots

Microsoft AI hat am 1. Oktober 2026 MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash vorgestellt. Die Modelle zielen auf Voicebots und Callcenter, laufen über Foundry als Public Preview und werfen Fragen zu Region und Stimmklonen auf.

Mit KI erstellt – redaktionelle Prüfung ausstehend

Editoriales Titelbild: Schallwellen fließen über leuchtende Textbalken zu einem Headset, links die Überschrift Sprachagenten hören und sprechen

Microsoft AI hat am 1. Oktober 2026 drei neue Audiomodelle für Sprachagenten vorgestellt: das Echtzeit-Transkriptionsmodell MAI-Transcribe-2-Streaming sowie die Sprachausgabemodelle MAI-Voice-2.1 und MAI-Voice-2.1-Flash. Alle drei laufen über Microsoft Foundry und Azure Speech, laut Microsoft Learn derzeit als Public Preview ohne SLA. Damit bietet Microsoft erstmals eine eigene Kette aus Zuhören und Sprechen für Telefonbots, Callcenter-Automatisierung und mehrsprachige Assistenten an.

Relevant ist das für Unternehmen, die Voicebots, IVR-Strecken oder Live-Untertitel auf Azure planen oder bereits Azure Speech nutzen. Wer keine Sprachanwendungen betreibt, muss nichts tun. Heute muss niemand handeln. Vor einem produktiven Einsatz sind allerdings Datenschutzfragen zu Region, Stimmklonen und Aufzeichnung zu klären.

Was ist passiert?

Der Microsoft-AI-Blogbeitrag vom 1. Oktober 2026 nennt drei Modelle. MAI-Transcribe-2-Streaming wandelt Sprache fortlaufend in Text um, unterstützt 60 Sprachen mit automatischer, laufender Spracherkennung und liefert laut Microsoft erste vorläufige Ergebnisse (sogenannte Partials) nach gut 100 Millisekunden. Diese Zwischenstände werden mit mehr Kontext überarbeitet und dann als finales Segment bestätigt. Ein Sprachagent kann so schon mitten im Satz mit der Verarbeitung beginnen. SiliconANGLE berichtet dagegen von durchschnittlich 320 Millisekunden bis zur ersten Hypothese und dem Hinweis, dass Netzwerk und nachgelagerte Systeme die Antwortzeit mitbestimmen. Die Werte sind also nicht unabhängig gemessen. Microsoft nennt einen Einführungspreis von 0,54 US-Dollar pro Audiostunde bis Jahresende.

MAI-Voice-2.1 ist ein Text-to-Speech-Modell für 23 Sprachen und 26 Locales. Eine einzelne Stimme soll alle Sprachen mit jeweils muttersprachlichem Akzent sprechen, der Preis liegt laut Microsoft bei 22 US-Dollar pro Million Zeichen. MAI-Voice-2.1-Flash unterstützt dieselben Sprachen, ist auf hohes Volumen und geringe Latenz ausgelegt, soll eine Ende-zu-Ende-Latenz von 150 Millisekunden erreichen und kostet 15 US-Dollar pro Million Zeichen. Beide Stimmenmodelle können laut Microsoft aus wenigen Sekunden Referenzaudio eine Stimme klonen. In einem Hörtest mit 4.000 Teilnehmern hielt laut Microsoft etwa die Hälfte die Stimmen für menschlich, wie THE DECODER zusammenfasst.

Verfügbar sind alle drei Modelle über Microsoft Foundry, den MAI Playground, Vercel und Azure Voice Live, die beiden Stimmenmodelle zusätzlich über OpenRouter.

Für wen ist das relevant?

  • Callcenter und Kundenservice, die Anrufe automatisiert annehmen, vorqualifizieren oder in mehreren Sprachen beantworten wollen.
  • Entwickler und Admins, die bereits Azure Speech nutzen: Die MAI-Stimmen verwenden dieselbe Speech-API und dasselbe SDK, angesprochen über einen Stimmnamen wie de-DE-Klaus:MAI-Voice-2.1-Flash im SSML.
  • Teams mit Live-Untertitelung oder Diktat. Für die Transkription nennt Microsoft Learn Azure Speech SDK v1.52.0 oder eine Realtime-API-kompatible WebSocket-Schnittstelle.

Deutsch ist laut Microsoft Learn bei Transkription und Sprachausgabe unterstützt, inklusive mehrerer vorgefertigter deutscher Stimmen. Nicht relevant ist die Meldung für Umgebungen, die Sprache ausschließlich lokal verarbeiten, etwa mit Whisper.

Wie kritisch ist das?

Sicherheitskritisch ist die Produktankündigung nicht. Der wichtigste Punkt für die Planung ist der Status: Microsoft Learn kennzeichnet MAI-Transcribe-2-Streaming und die MAI-Voice-Modelle als Public Preview, ohne Service Level Agreement und ausdrücklich nicht für produktive Workloads empfohlen. Preise und Eigenschaften können sich bis zur allgemeinen Verfügbarkeit ändern.

Offen ist die Datenschutzfrage. Laut Learn sind die Modelle „global“ erreichbar, Azure bedient sie aus bestimmten Regionen und leitet Anfragen dorthin weiter. Für MAI-Transcribe-2-Streaming listet die Doku Sweden Central, Central US und Southeast Asia als verfügbar, East US 2 als „coming soon“. Für die Stimmenmodelle stehen unter anderem France Central, West Europe, North Europe und Sweden Central in der Liste, daneben Regionen in den USA und Asien. Ob eine in einer EU-Region angelegte Ressource Audio garantiert nur in EU-Rechenzentren verarbeitet, geht aus den gelesenen Quellen nicht eindeutig hervor.

Was sollten Admins jetzt tun?

  • Inventar prüfen: Welche Azure-Speech- oder Foundry-Ressourcen existieren, in welcher Region, und welche Anwendungen (IVR, Bot, Untertitel) nutzen sie heute.
  • Regionsfrage vor jedem Test klären: Ressourcen nur in EU-Regionen wie Sweden Central anlegen und bei Microsoft schriftlich nachfragen, ob Anfragen in andere Regionen geroutet werden können.
  • Stimmklonen nur mit dokumentierter Einwilligung: Laut Learn ist Instant Voice Cloning zugangsbeschränkt (Limited Access Review), verlangt eine Einwilligungsaufnahme und 5 bis 60 Sekunden Referenzaudio. Eine Stimme ist ein personenbezogenes Datum, die Einwilligung der sprechenden Person gehört in die Dokumentation.
  • Anrufer transparent informieren, dass sie mit einer KI-Stimme sprechen und ob Gespräche transkribiert werden.
  • Auftragsverarbeitung und Löschfristen für Audio und Transkripte festlegen, Transkripte nicht länger als nötig speichern.
  • In der Anwendung Partials und finale Ergebnisse trennen. Learn weist darauf hin, dass Zwischenstände vorläufig sind und erst finale Ergebnisse ein Segment bestätigen.

Einordnung für Unternehmen

Für kleine und mittlere Unternehmen ist die Ankündigung vor allem eine Kostenfrage und eine Vereinfachung: Erkennung, Sprachausgabe und auf Wunsch ein Sprachmodell können aus einem Azure-Abonnement kommen, statt mehrere Anbieter zu kombinieren. Die genannten Latenzen und Benchmark-Platzierungen stammen allerdings von Microsoft selbst, unabhängige Messungen fehlen bisher. Ein Pilot mit realen Gesprächsaufnahmen in deutscher Sprache ist deshalb sinnvoller als eine Entscheidung auf Basis von Herstellerangaben.

Wer Gesprächsdaten nicht in die Cloud geben darf oder will, bleibt mit lokalen Lösungen besser bedient. Für Cloud-Piloten gilt: erst Region, Auftragsverarbeitung und Einwilligungen klären, dann testen. Bis zur allgemeinen Verfügbarkeit taugen die Modelle für Prototypen, nicht für den Kundenkontakt ohne Rückfallebene.

Passende Anleitungen auf S-EDV

Quellen

MicrosoftMAISpracherkennungText-to-SpeechVoicebotAzure SpeechMicrosoft Foundry