MAI-Transcribe-2
Modèle de transcription par lots rapide de Microsoft pour les enregistrements longs, les étiquettes des locuteurs, la synchronisation des mots, la polarisation des mots clés et les transcriptions claires ou textuelles.
Modèle de transcription par lots rapide de Microsoft pour les enregistrements longs, les étiquettes des locuteurs, la synchronisation des mots, la polarisation des mots clés et les transcriptions claires ou textuelles.
Présentation de l'anglais simple
MAI-Transcribe-2 vise à transformer rapidement des fichiers audio volumineux en texte utilisable. Microsoft associe la reconnaissance multilingue à la diarisation, aux horodatages au niveau des mots, à la détection automatique de la langue et aux contrôles permettant de déterminer si la transcription préserve les mots de remplissage ou renvoie une prose plus claire.
L’accès s’effectue via Microsoft Foundry, ce qui fait du modèle un choix naturel pour les organisations qui gèrent déjà les contrôles d’identité, de régions et de données dans Azure. Le prix de lancement est explicitement limité dans le temps, les projections de coûts doivent donc conserver une marge pour un futur tarif standard.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Tarifs et comparaisons
Indiquez votre utilisation. L’estimation se met à jour à chaque modification.
Utilise la durée en heures : 30 minutes = 0,5 heure. Options et frais minimums peuvent modifier la facture.
MAI-Transcribe-2
Microsoft
Total estimé (USD)
Pour l’utilisation indiquée · USD · Tarif API, hors abonnement
Les estimations excluent taxes, outils, stockage/écriture du cache, quotas gratuits et remises personnalisées. Pour les images, seule la sortie est incluse, pas le prompt ni les références. Les modes de qualité varient. Un paramètre non répertorié n’est pas gratuit.
Accès API et fournisseur
Disponibilité
Disponible via Microsoft Foundry pour la reconnaissance vocale par lots et longue durée.
La disponibilité du déploiement suit le catalogue de modèles Microsoft Foundry en direct et la région Azure choisie par le client.
Vérifier la disponibilité en directDonnées et formation
Microsoft indique que les invites, les sorties, les intégrations et les données de formation soumises à Foundry Models ne sont pas disponibles pour les fournisseurs de modèles et ne sont pas utilisés pour former des modèles de base sans autorisation. Les détails de conservation et de surveillance des abus dépendent du service déployé.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle de transcription par lots rapide de Microsoft pour les enregistrements longs, les étiquettes des locuteurs, la synchronisation des mots, la polarisation des mots clés et les transcriptions claires ou textuelles. MAI-Transcribe-2 vise à transformer rapidement des fichiers audio volumineux en texte utilisable. Microsoft associe la reconnaissance multilingue à la diarisation, aux horodatages au niveau des mots, à la détection automatique de la langue et aux contrôles permettant de déterminer si la transcription préserve les mots de remplissage ou renvoie une prose plus claire.
MAI-Transcribe-2 a été publié sur 3 septembre 2026 selon les documents du fournisseur cités.
Disponible via Microsoft Foundry pour la reconnaissance vocale par lots et longue durée. Les voies d'accès répertoriées dans ce guide sont Microsoft AI et Microsoft Foundry.
0,10 $/heure audio pour le tarif d'aperçu à durée limitée. Microsoft qualifie cela de tarification à durée limitée. Confirmez le catalogue Foundry en direct avant de prévoir des coûts de production soutenus.
Disponible via Microsoft Foundry pour la reconnaissance vocale par lots et longue durée. La disponibilité du déploiement suit le catalogue de modèles Microsoft Foundry en direct et la région Azure choisie par le client.
Microsoft indique que les invites, les sorties, les intégrations et les données de formation soumises à Foundry Models ne sont pas disponibles pour les fournisseurs de modèles et ne sont pas utilisés pour former des modèles de base sans autorisation. Les détails de conservation et de surveillance des abus dépendent du service déployé. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle de reconnaissance vocale en streaming de Meta pour les sous-titres en direct, l'audio long, de nombreux haut-parleurs, la commutation de code et la transcription sensible au domaine.
Ouvrir la comparaison complèteModèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions.
Ouvrir la comparaison complèteModèle de transcription axé sur la précision du AssemblyAI pour les fichiers et l'audio en direct, avec commutation de code, étiquettes de locuteur, horodatages et invites contextuelles.
Ouvrir la comparaison complèteModèle de synthèse vocale multilingue de ElevenLabs pour des transcriptions détaillées avec de nombreux locuteurs, une synchronisation des mots, des événements audio et de grandes listes de mots clés personnalisées.
Ouvrir la comparaison complète