Inworld Realtime TTS-2
أحدث نموذج تعبيري لتحويل النص إلى كلام في العالم في الوقت الفعلي، مصمم لتذكر تسليم المحادثة والتحدث بأكثر من 100 لغة.
أحدث نموذج تعبيري لتحويل النص إلى كلام في العالم في الوقت الفعلي، مصمم لتذكر تسليم المحادثة والتحدث بأكثر من 100 لغة.
نظرة عامة على اللغة الإنجليزية البسيطة
يقوم Inworld Realtime TTS-2 بتحويل النص إلى كلام متدفق أثناء استخدام التحويلات الصوتية السابقة للحفاظ على اتساق تسليم الحرف. يمكن للمطورين وصف الحالة المزاجية أو التسليم المرغوب فيه باللغة الطبيعية، وتبديل اللغات، واستخدام استنساخ الصوت حيث تسمح حقوقهم وإعدادات الحساب بذلك.
يعتمد التسعير على الأحرف بدلاً من الرموز الصوتية، مما يجعل تقدير البرامج النصية أسهل. يُبلغ Inworld عن متوسط وقت يقل عن 200 مللي ثانية للصوت الأول، لكن مسافة الشبكة وعمل التطبيق ونموذج اللغة الأولية لا يزال يؤثر على وقت الاستجابة الكامل.
مقارنة الفئة
هذه مواصفات منشورة من قبل الموفر، وليست درجات معيار Cody. اتبع المصادر المرتبطة للحدود الحالية والاستثناءات الخاصة بنقطة النهاية.
الوصول إلى واجهة برمجة التطبيقات والموفر
التوفر
متاح بشكل عام من خلال REST TTS API وOpenAI المتوافقة مع Realtime API.
تغطية المنطقة القياسية غير مدرجة في صفحة النموذج؛ تعلن خطط المؤسسات عن خيارات إقامة البيانات في الاتحاد الأوروبي والهند.
تحقق من التوفر المباشرالبيانات والتدريب
تعلن شركة Inworld عن عدم الاحتفاظ بالبيانات كوظيفة إضافية للمؤسسة، لكن صفحة دعم ZDR المنشورة حاليًا تحمل أسماء TTS-1.5 Mini وMax فقط. قم بتأكيد تغطية TTS-2 مباشرة قبل إرسال نص منظم أو سري.
هذه قراءة موجزة لمواد المزود المذكورة، وليست نصيحة قانونية. يمكن أن تحتوي بوابة الطرف الثالث على شروط تخزين وتوجيه وتدريب وإقامة مختلفة من واجهة برمجة التطبيقات المباشرة الخاصة بصانع النموذج.
اقرأ سياسة المزودالأسئلة المتداولة
أحدث نموذج تعبيري لتحويل النص إلى كلام في العالم في الوقت الفعلي، مصمم لتذكر تسليم المحادثة والتحدث بأكثر من 100 لغة. يقوم Inworld Realtime TTS-2 بتحويل النص إلى كلام متدفق أثناء استخدام التحويلات الصوتية السابقة للحفاظ على اتساق تسليم الحرف. يمكن للمطورين وصف الحالة المزاجية أو التسليم المرغوب فيه باللغة الطبيعية، وتبديل اللغات، واستخدام استنساخ الصوت حيث تسمح حقوقهم وإعدادات الحساب بذلك.
تم إصدار Inworld Realtime TTS-2 على 31 أغسطس 2026 وفقًا لمواد الموفر المذكورة.
متاح بشكل عام من خلال REST TTS API وOpenAI المتوافقة مع Realtime API. مسارات الوصول المدرجة في هذا الدليل هي Inworld AI.
25 دولارًا / مليون حرف عند الطلب. تنخفض أسعار الاشتراك المنشورة إلى 20 دولارًا، و17.50 دولارًا، و15 دولارًا، و12.50 دولارًا لكل مليون حرف حسب الطبقة، مع الإعلان عن أسعار المؤسسة منخفضة تصل إلى 5 دولارات.
متاح بشكل عام من خلال REST TTS API وOpenAI المتوافقة مع Realtime API. تغطية المنطقة القياسية غير مدرجة في صفحة النموذج؛ تعلن خطط المؤسسات عن خيارات إقامة البيانات في الاتحاد الأوروبي والهند.
تعلن شركة Inworld عن عدم الاحتفاظ بالبيانات كوظيفة إضافية للمؤسسة، لكن صفحة دعم ZDR المنشورة حاليًا تحمل أسماء TTS-1.5 Mini وMax فقط. قم بتأكيد تغطية TTS-2 مباشرة قبل إرسال نص منظم أو سري. تنتمي السياسة إلى مسار الموفر وشروط الحساب، لذا تحقق منها مرة أخرى قبل استخدام الإنتاج.
المقارنات ذات الصلة
نموذج OpenAI للاستدلال المنطقي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء الصوت الذين يستخدمون الأدوات والذين يحتاجون أيضًا إلى سياق النص والصورة.
فتح المقارنة الكاملةنموذج معاينة الصوت إلى الصوت الخاص بـ Google للحوار منخفض زمن الوصول مع الوعي متعدد الوسائط والتفكير وتأريض البحث واستدعاء الوظائف.
فتح المقارنة الكاملةنموذج ElevenLabs المعبّر لتحويل النص إلى كلام في الوقت الفعلي للحوار الطبيعي والتوصيل العاطفي والعلامات الصوتية وأكثر من 70 لغة.
فتح المقارنة الكاملةنموذج SpaceXAI الحالي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء المحادثة دون الثانية مع إمكانية الوصول إلى الأداة.
فتح المقارنة الكاملة