GPT-Realtime-2.1
نموذج OpenAI للاستدلال المنطقي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء الصوت الذين يستخدمون الأدوات والذين يحتاجون أيضًا إلى سياق النص والصورة.
نموذج OpenAI للاستدلال المنطقي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء الصوت الذين يستخدمون الأدوات والذين يحتاجون أيضًا إلى سياق النص والصورة.
نظرة عامة على اللغة الإنجليزية البسيطة
تم تصميم GPT-Realtime-2.1 للمحادثات المباشرة حيث يجب على النموذج الاستماع والتحدث واتباع التعليمات وأدوات الاتصال في جلسة واحدة في الوقت الفعلي. يسلط OpenAI الضوء على تحسين الانقطاع والصمت والضوضاء والتعامل مع الحروف الأبجدية الرقمية مقارنة بالإصدار السابق.
تتم محاسبة إدخال الصوت والنص والصور في فئات رمزية مختلفة. وبالتالي، تحتاج الميزانية الواقعية إلى استخدام ملتقط من المحادثات الكاملة، وليس من تحويل بسيط من الدقائق الصوتية وحدها.
مقارنة الفئة
هذه مواصفات منشورة من قبل الموفر، وليست درجات معيار Cody. اتبع المصادر المرتبطة للحدود الحالية والاستثناءات الخاصة بنقطة النهاية.
الوصول إلى واجهة برمجة التطبيقات والموفر
التوفر
متاح من خلال Realtime API الخاص بـ OpenAI في البلدان والأقاليم المدعومة.
يتبع الوصول المباشر قائمة البلدان المدعومة المباشرة لـ OpenAI.
تحقق من التوفر المباشرالبيانات والتدريب
يقول OpenAI أن محتوى واجهة برمجة التطبيقات (API) لا يُستخدم للتدريب بشكل افتراضي. قد يتم الاحتفاظ بسجلات مراقبة إساءة الاستخدام الافتراضية لمدة تصل إلى 30 يومًا، مع توفر عناصر تحكم إضافية للمؤسسات المؤهلة.
هذه قراءة موجزة لمواد المزود المذكورة، وليست نصيحة قانونية. يمكن أن تحتوي بوابة الطرف الثالث على شروط تخزين وتوجيه وتدريب وإقامة مختلفة من واجهة برمجة التطبيقات المباشرة الخاصة بصانع النموذج.
اقرأ سياسة المزودالأسئلة المتداولة
نموذج OpenAI للاستدلال المنطقي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء الصوت الذين يستخدمون الأدوات والذين يحتاجون أيضًا إلى سياق النص والصورة. تم تصميم GPT-Realtime-2.1 للمحادثات المباشرة حيث يجب على النموذج الاستماع والتحدث واتباع التعليمات وأدوات الاتصال في جلسة واحدة في الوقت الفعلي. يسلط OpenAI الضوء على تحسين الانقطاع والصمت والضوضاء والتعامل مع الحروف الأبجدية الرقمية مقارنة بالإصدار السابق.
لا ينشر الموفر تاريخ إصدار واضح لـ GPT-Realtime-2.1 في المادة المصدر التي تمت مراجعتها بواسطة Cody.
متاح من خلال Realtime API الخاص بـ OpenAI في البلدان والأقاليم المدعومة. مسارات الوصول المدرجة في هذا الدليل هي OpenAI.
32 دولارًا أمريكيًا لإدخال الصوت · 64 دولارًا أمريكيًا لإخراج الصوت / 1 مليون رمز. النص هو إدخال بقيمة 4 دولارات وإخراج 24 دولارًا لكل مليون رمز؛ إدخال الصورة هو 5 دولارات لكل مليون رمز. تختلف معدلات الإدخال المخزنة مؤقتًا.
متاح من خلال Realtime API الخاص بـ OpenAI في البلدان والأقاليم المدعومة. يتبع الوصول المباشر قائمة البلدان المدعومة المباشرة لـ OpenAI.
يقول OpenAI أن محتوى واجهة برمجة التطبيقات (API) لا يُستخدم للتدريب بشكل افتراضي. قد يتم الاحتفاظ بسجلات مراقبة إساءة الاستخدام الافتراضية لمدة تصل إلى 30 يومًا، مع توفر عناصر تحكم إضافية للمؤسسات المؤهلة. تنتمي السياسة إلى مسار الموفر وشروط الحساب، لذا تحقق منها مرة أخرى قبل استخدام الإنتاج.
المقارنات ذات الصلة
نموذج معاينة الصوت إلى الصوت الخاص بـ Google للحوار منخفض زمن الوصول مع الوعي متعدد الوسائط والتفكير وتأريض البحث واستدعاء الوظائف.
فتح المقارنة الكاملةنموذج ElevenLabs المعبّر لتحويل النص إلى كلام في الوقت الفعلي للحوار الطبيعي والتوصيل العاطفي والعلامات الصوتية وأكثر من 70 لغة.
فتح المقارنة الكاملةأحدث نموذج تعبيري لتحويل النص إلى كلام في العالم في الوقت الفعلي، مصمم لتذكر تسليم المحادثة والتحدث بأكثر من 100 لغة.
فتح المقارنة الكاملةنموذج SpaceXAI الحالي لتحويل الكلام إلى كلام في الوقت الفعلي لوكلاء المحادثة دون الثانية مع إمكانية الوصول إلى الأداة.
فتح المقارنة الكاملة