<- Zur Startseite

Microsoft erweitert MAI-Modellfamilie um neue Audio-Funktionen

Quelle: Heise - Veroeffentlicht: 02 Oct 2026 14:23

Microsoft hat seine KI-Modellfamilie MAI um drei neue Audio-Modelle erweitert: MAI-Transcribe-2-Streaming, MAI-Voice-2.1 und MAI-Voice-2.1-Flash. Diese Modelle zielen darauf ab, Echtzeit-Transkription und Sprachausgabe für Voice-Agents zu ermöglichen und unterstützen mehrere Sprachen. MAI-Transcribe-2-Streaming bietet eine hohe Genauigkeit und schnelle Transkriptionsergebnisse, während die Voice-Modelle für verschiedene Anwendungen im Bereich Text-to-Speech optimiert sind.

Die neuen Modelle sind Teil von Microsofts Strategie, unabhängiger von OpenAI zu werden und die eigene KI-Kompetenz auszubauen. Die Einführungspreise sind bis Ende des Jahres festgelegt, während die Integration in bestehende Microsoft-Produkte wie Teams und Windows noch unklar bleibt. Die Konkurrenz im Markt für Sprach- und Audio-KI ist stark, mit zahlreichen spezialisierten Anbietern.

Dieser Text wurde von KI zusammengefasst.