MAI-Transcribe-2
El rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales.
El rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales.
Descripción general en inglés sencillo
MAI-Transcribe-2 tiene como objetivo convertir archivos de audio de gran tamaño en texto utilizable rápidamente. Microsoft combina el reconocimiento multilingüe con la diarioización, marcas de tiempo a nivel de palabra, detección automática de idioma y controles para determinar si la transcripción conserva palabras de relleno o devuelve una prosa más limpia.
El acceso se ejecuta a través de Microsoft Foundry, lo que hace que el modelo sea una opción natural para las organizaciones que ya administran controles de identidad, regiones y datos en Azure. El precio de lanzamiento es explícitamente por tiempo limitado, por lo que las proyecciones de costos deberían mantener un margen para una tarifa estándar futura.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Precios y comparaciones
Indica tu uso. La estimación se actualiza al escribir.
Usa la duración en horas: 30 minutos = 0,5 horas. Funciones extra y cargos mínimos pueden cambiar el total.
MAI-Transcribe-2
Microsoft
Total estimado (USD)
Para el uso indicado · USD · Precio de API, no de suscripción
Las estimaciones excluyen impuestos, herramientas, almacenamiento/escritura de caché, cuotas gratuitas y descuentos personalizados. En imágenes solo incluyen la salida, no el prompt ni las referencias. Los modos de calidad varían. Los ajustes no listados no se consideran gratuitos.
Acceso a API y proveedores
Disponibilidad
Disponible a través de Microsoft Foundry para reconocimiento de voz por lotes y de formato largo.
La disponibilidad de implementación sigue el catálogo de modelos Microsoft Foundry en vivo y la región de Azure elegida por el cliente.
Consultar disponibilidad en vivoDatos y entrenamiento
Microsoft dice que las indicaciones, resultados, incrustaciones y datos de entrenamiento enviados a Foundry Models no están disponibles para los proveedores de modelos y no se utilizan para entrenar modelos básicos sin permiso. Los detalles de retención y monitoreo de abuso dependen del servicio implementado.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
El rápido modelo de transcripción por lotes de Microsoft para grabaciones largas, etiquetas de oradores, sincronización de palabras, sesgo de palabras clave y transcripciones limpias o textuales. MAI-Transcribe-2 tiene como objetivo convertir archivos de audio de gran tamaño en texto utilizable rápidamente. Microsoft combina el reconocimiento multilingüe con la diarioización, marcas de tiempo a nivel de palabra, detección automática de idioma y controles para determinar si la transcripción conserva palabras de relleno o devuelve una prosa más limpia.
MAI-Transcribe-2 se lanzó en 3 de septiembre de 2026 según los materiales del proveedor citados.
Disponible a través de Microsoft Foundry para reconocimiento de voz por lotes y de formato largo. Las rutas de acceso enumeradas en esta guía son Microsoft AI y Microsoft Foundry.
$0.10 / hora de audio para la tarifa de vista previa por tiempo limitado. Microsoft etiqueta esto como precio por tiempo limitado. Confirme el catálogo de Foundry en vivo antes de pronosticar el costo de producción sostenido.
Disponible a través de Microsoft Foundry para reconocimiento de voz por lotes y de formato largo. La disponibilidad de implementación sigue el catálogo de modelos Microsoft Foundry en vivo y la región de Azure elegida por el cliente.
Microsoft dice que las indicaciones, resultados, incrustaciones y datos de entrenamiento enviados a Foundry Models no están disponibles para los proveedores de modelos y no se utilizan para entrenar modelos básicos sin permiso. Los detalles de retención y monitoreo de abuso dependen del servicio implementado. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
Modelo de reconocimiento de voz en streaming de Meta para subtítulos en vivo, audio largo, muchos parlantes, cambio de código y transcripción con reconocimiento de dominio.
Abrir comparación completaEl modelo general de voz a texto de Google Cloud para transmisión, archivos y transcripción por lotes dinámicos de bajo costo en muchos idiomas y regiones.
Abrir comparación completaEl modelo de transcripción centrado en la precisión de AssemblyAI para archivos y audio en vivo, con cambio de código, etiquetas de oradores, marcas de tiempo e indicaciones contextuales.
Abrir comparación completaModelo multilingüe de voz a texto ElevenLabs para transcripciones detalladas con muchos hablantes, sincronización de palabras, eventos de audio y grandes listas de términos clave personalizados.
Abrir comparación completa