Inworld Realtime TTS-2
El modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas.
El modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas.
Descripción general en inglés sencillo
Inworld Realtime TTS-2 convierte el texto en voz transmitida mientras utiliza turnos de audio anteriores para mantener la coherencia en la entrega de un personaje. Los desarrolladores pueden describir el estado de ánimo o la entrega deseada en lenguaje natural, cambiar de idioma y utilizar la clonación de voz cuando sus derechos y la configuración de su cuenta lo permitan.
El precio se basa en caracteres en lugar de tokens de audio, lo que hace que los guiones sean más fáciles de estimar. Inworld informa un tiempo medio inferior a 200 ms hasta el primer audio, pero la distancia de la red, el trabajo de la aplicación y el modelo de lenguaje ascendente aún afectan el tiempo de respuesta completo.
Comparación de categorías
Estas son especificaciones publicadas por el proveedor, no puntuaciones de referencia Cody. Siga las fuentes vinculadas para conocer los límites actuales y las excepciones específicas de los terminales.
Acceso a API y proveedores
Disponibilidad
Generalmente disponible a través de la API REST TTS de Inworld y la API en tiempo real compatible con OpenAI.
La cobertura regional estándar no aparece en la página del modelo; Los planes empresariales anuncian opciones de residencia de datos en la UE y la India.
Consultar disponibilidad en vivoDatos y entrenamiento
Inworld anuncia retención de datos cero como complemento empresarial, pero su página de soporte ZDR publicada actualmente solo nombra TTS-1.5 Mini y Max. Confirme la cobertura TTS-2 directamente antes de enviar mensajes de texto regulados o confidenciales.
Esta es una lectura concisa del material del proveedor citado, no un asesoramiento legal. Una puerta de enlace de terceros puede tener términos de almacenamiento, enrutamiento, capacitación y residencia diferentes a los de la API directa del fabricante del modelo.
Lea la política del proveedor.Preguntas frecuentes
El modelo expresivo de conversión de texto a voz en tiempo real más nuevo de Inworld, diseñado para recordar la entrega conversacional y hablar en más de 100 idiomas. Inworld Realtime TTS-2 convierte el texto en voz transmitida mientras utiliza turnos de audio anteriores para mantener la coherencia en la entrega de un personaje. Los desarrolladores pueden describir el estado de ánimo o la entrega deseada en lenguaje natural, cambiar de idioma y utilizar la clonación de voz cuando sus derechos y la configuración de su cuenta lo permitan.
Inworld Realtime TTS-2 se lanzó en 31 de agosto de 2026 según los materiales del proveedor citados.
Generalmente disponible a través de la API REST TTS de Inworld y la API en tiempo real compatible con OpenAI. Las rutas de acceso enumeradas en esta guía son Inworld AI.
$25 / 1 millón de caracteres a pedido. Las tarifas de suscripción publicadas caen a $20, $17,50, $15 y $12,50 por millón de caracteres por nivel, con precios empresariales anunciados tan bajos como $5.
Generalmente disponible a través de la API REST TTS de Inworld y la API en tiempo real compatible con OpenAI. La cobertura regional estándar no aparece en la página del modelo; Los planes empresariales anuncian opciones de residencia de datos en la UE y la India.
Inworld anuncia retención de datos cero como complemento empresarial, pero su página de soporte ZDR publicada actualmente solo nombra TTS-1.5 Mini y Max. Confirme la cobertura TTS-2 directamente antes de enviar mensajes de texto regulados o confidenciales. La política pertenece a la ruta del proveedor y a los términos de la cuenta, así que verifíquela nuevamente antes de usarla en producción.
Comparaciones relacionadas
Modelo de razonamiento de voz a voz en tiempo real de OpenAI para agentes de voz que utilizan herramientas que también necesitan contexto de texto e imagen.
Abrir comparación completaModelo de vista previa de audio a audio de Google para diálogos de baja latencia con conciencia, pensamiento, base de búsqueda y llamadas de funciones multimodales.
Abrir comparación completaModelo expresivo de conversión de texto a voz en tiempo real ElevenLabs para diálogo natural, entrega emocional, etiquetas de audio y más de 70 idiomas.
Abrir comparación completaModelo actual de voz a voz en tiempo real de SpaceXAI para agentes conversacionales en menos de un segundo con acceso a herramientas.
Abrir comparación completa