MAI-Transcribe-2
Das schnelle Batch-Transkriptionsmodell von Microsoft für lange Aufnahmen, Sprecherbezeichnungen, Wort-Timing, Keyword-Bias und saubere oder wörtliche Transkripte.
Das schnelle Batch-Transkriptionsmodell von Microsoft für lange Aufnahmen, Sprecherbezeichnungen, Wort-Timing, Keyword-Bias und saubere oder wörtliche Transkripte.
Übersicht in einfacher englischer Sprache
MAI-Transcribe-2 zielt darauf ab, große Audiodateien schnell in brauchbaren Text umzuwandeln. Microsoft kombiniert mehrsprachige Erkennung mit Diarisierung, Zeitstempeln auf Wortebene, automatischer Spracherkennung und steuert, ob das Transkript Füllwörter beibehält oder sauberere Prosa zurückgibt.
Der Zugriff erfolgt über Microsoft Foundry, wodurch sich das Modell ideal für Organisationen eignet, die bereits Identitäten, Regionen und Datenkontrollen in Azure verwalten. Der Einführungspreis ist ausdrücklich zeitlich begrenzt, daher sollten Kostenprognosen eine Marge für einen zukünftigen Standardpreis enthalten.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
Preise und Vergleiche
Geben Sie Ihre Nutzung ein. Die Schätzung wird sofort aktualisiert.
Nutzt die Aufnahmedauer in Stunden: 30 Minuten = 0,5 Stunden. Zusatzfunktionen und Mindestgebühren können die Rechnung ändern.
MAI-Transcribe-2
Microsoft
Geschätzte Summe (USD)
Für die angegebene Nutzung · USD · API-Preis, kein Abonnement
Schätzungen ohne Steuern, Tools, Cache-Speicherung/-Schreiben, Freikontingente und individuelle Rabatte. Bei Bildern zählt nur die Ausgabe, nicht Prompt oder Referenzbilder. Qualitätsmodi unterscheiden sich. Nicht aufgeführte Einstellungen gelten nicht als kostenlos.
API- und Provider-Zugriff
Verfügbarkeit
Verfügbar über Microsoft Foundry für Batch- und Langform-Spracherkennung.
Die Bereitstellungsverfügbarkeit richtet sich nach dem Live-Modellkatalog Microsoft Foundry und der vom Kunden gewählten Azure-Region.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Microsoft besagt, dass an Foundry Models übermittelte Eingabeaufforderungen, Ausgaben, Einbettungen und Trainingsdaten für Modellanbieter nicht verfügbar sind und nicht ohne Genehmigung zum Trainieren von Foundation-Modellen verwendet werden. Details zur Aufbewahrung und Missbrauchsüberwachung hängen vom bereitgestellten Dienst ab.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das schnelle Batch-Transkriptionsmodell von Microsoft für lange Aufnahmen, Sprecherbezeichnungen, Wort-Timing, Keyword-Bias und saubere oder wörtliche Transkripte. MAI-Transcribe-2 zielt darauf ab, große Audiodateien schnell in brauchbaren Text umzuwandeln. Microsoft kombiniert mehrsprachige Erkennung mit Diarisierung, Zeitstempeln auf Wortebene, automatischer Spracherkennung und steuert, ob das Transkript Füllwörter beibehält oder sauberere Prosa zurückgibt.
MAI-Transcribe-2 wurde gemäß den zitierten Anbietermaterialien auf 3. September 2026 veröffentlicht.
Verfügbar über Microsoft Foundry für Batch- und Langform-Spracherkennung. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Microsoft AI und Microsoft Foundry.
0,10 $/Audiostunde für den zeitlich begrenzten Vorschautarif. Microsoft bezeichnet dies als zeitlich begrenzten Preis. Bestätigen Sie den Live-Foundry-Katalog, bevor Sie nachhaltige Produktionskosten prognostizieren.
Verfügbar über Microsoft Foundry für Batch- und Langform-Spracherkennung. Die Bereitstellungsverfügbarkeit richtet sich nach dem Live-Modellkatalog Microsoft Foundry und der vom Kunden gewählten Azure-Region.
Microsoft besagt, dass an Foundry Models übermittelte Eingabeaufforderungen, Ausgaben, Einbettungen und Trainingsdaten für Modellanbieter nicht verfügbar sind und nicht ohne Genehmigung zum Trainieren von Foundation-Modellen verwendet werden. Details zur Aufbewahrung und Missbrauchsüberwachung hängen vom bereitgestellten Dienst ab. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Streaming-Spracherkennungsmodell von Meta für Live-Untertitel, lange Audioinhalte, viele Sprecher, Code-Switching und domänenbezogene Transkription.
Vollständigen Vergleich öffnenDas allgemeine Sprach-zu-Text-Modell von Google Cloud für Streaming, Datei und kostengünstige dynamische Batch-Transkription in vielen Sprachen und Regionen.
Vollständigen Vergleich öffnenDas auf Genauigkeit ausgerichtete Transkriptionsmodell von AssemblyAI für Dateien und Live-Audio mit Code-Umschaltung, Sprecherbezeichnungen, Zeitstempeln und kontextbezogenen Eingabeaufforderungen.
Vollständigen Vergleich öffnenDas mehrsprachige Speech-to-Text-Modell von ElevenLabs für detaillierte Transkripte mit vielen Sprechern, Wortzeit, Audioereignissen und großen benutzerdefinierten Schlüsselbegriffslisten.
Vollständigen Vergleich öffnen