جميع المقالات
الذكاء الاصطناعي في الوقت الحقيقي

مقارنة نماذج الصور الرمزية للذكاء الاصطناعي في الوقت الفعلي: زمن الوصول والهندسة المعمارية والتكلفة

البنية وتعريفات زمن الاستجابة والنقل والتسعير وطريقة قابلة للتكرار لتقييمها بنفسك ينشر كل بائع صور رمزية في الوقت الفعلي رقم زمن الوصول. يشير Anam إلى محادثة مدتها أقل من ثانية واحدة مع إنشاء جانب الخادم بحوالي 150 مللي ثانية. Tavus يقول sub-600... اقرأ المزيد »

بواسطة Om Kamathوقت القراءة: 18 دقائق
صورة رقمية للإنسان نصفها واقعي ونصفها الآخر يذوب في سحابة نقطية مضيئة

الهندسة المعمارية وتعريفات زمن الوصول والنقل والتسعير وطريقة قابلة للتكرار لتقييمها بنفسك

ينشر كل بائع صور رمزية في الوقت الفعلي رقم زمن الوصول. يشير Anam إلى محادثة مدتها أقل من ثانية واحدة مع إنشاء جانب الخادم بحوالي 150 مللي ثانية. Tavus يقول أقل من 600 مللي ثانية. يقول Beyond Presence أقل من 100 مللي ثانية. يقول Simli أقل من 300 مللي ثانية. LemonSlice يقول 471 مللي ثانية. يقول Ojin أقل من 200 مللي ثانية.

لا شيء من هذه الأرقام هو الأكاذيب. تقريبا لا أحد منهم يقيس نفس الشيء.

هذه هي المشكلة الأساسية في اختيار مزود الصور الرمزية في الوقت الفعلي في عام 2026، ولهذا السبب تختار الفرق بشكل روتيني واحدًا على ورقة المواصفات، وتدمجه، ثم تكتشف أن التجربة تبدو أبطأ من الرقم الموعود. هذه المقالة هي محاولة لإصلاح ذلك: ما هي هذه الأنظمة في الواقع، وكيف تختلف النماذج من الناحية المعمارية، وما الذي يقيسه كل رقم زمن الوصول المنشور بالفعل، وما تكلفته بمجرد النظر إلى ما بعد المعدل الرئيسي، و- الأكثر فائدة - بروتوكول اختبار يمكنك تشغيله بنفسك في فترة ما بعد الظهر.

منتجان يحملان نفس الاسم

قبل مقارنة أي شيء، قم بفصل الفئة إلى قسمين. يبيع كل مزود تقريبًا واحدًا أو كليهما مما يلي، وهما ليسا بديلين.

واجهة برمجة تطبيقات الوكيل. يمتلك الموفر المجموعة بأكملها: التعرف على الكلام، ونموذج اللغة، وتحويل النص إلى كلام، والعرض، والنقل، وعادةً ما تكون لوحة المعلومات مع حقل موجه وقاعدة معرفية. يمكنك تكوين شخصية وإسقاط عنصر واجهة المستخدم على الصفحة. يتم الشحن بسرعة، مع الحد الأدنى من التحكم، وجودة المحادثة الخاصة بك محدودة باختيار البائع للنماذج.

واجهة برمجة تطبيقات الصوت إلى الفيديو. يتوقف نطاق الموفر عند مهمة واحدة: التقاط صوت الوكيل، وإرجاع دفق فيديو متزامن مع الشفاه في الوقت الفعلي. يمكنك تحويل الكلام الخاص بك إلى نص، وماجستير القانون الخاص بك، وصوتك، وتنسيقك الخاص - عادةً Pipecat أو وكلاء LiveKit. هذا هو نموذج "طبقة الوجه"، وهو ما تستخدمه في نهاية المطاف معظم الفرق التي تبني منتجًا جادًا، لأن الصورة الرمزية تصبح طبقة واجهة اختيارية فوق وكيل صوتي يعمل بالفعل.

التمييز مهم تجاريا أيضا. يتقاضى Beyond Presence رسومًا مضاعفة تمامًا لوضع Agent مقابل وضع Speech-to-Video. يبلغ سعر الوضع البسيط في HeyGen (أنت تجلب العقل) ما يقرب من نصف سعر الوضع الكامل.

قاعدة مفيدة: أنشئ الوكيل الصوتي أولاً واحصل عليه جيدًا، ثم أضف الوجه. تميل الفرق التي تبدأ بالصورة الرمزية إلى الحصول على نظام جميل يقول أشياء غير مفيدة.

كيف تعمل هذه النماذج في الواقع

هناك ثلاث طرق عرض مختلفة بشكل أساسي قيد الإنتاج حاليًا، وتظهر الاختلافات بطرق مهمة.

رسم تخطيطي تجريدي لشكل موجة صوتية يمر عبر طبقات النموذج ويظهر كسلسلة من إطارات الفيديو التي يتم حلها تدريجيًا

كل صورة رمزية في الوقت الفعلي لها نفس الشكل الموجود أسفلها: إدخال الصوت، وإخراج الإطارات، بسرعة كافية للبقاء متزامنًا. الصورة التي تم إنشاؤها باستخدام صورة GPT 2.

انتشار بكسل الفضاء

النهج السائد. يقوم نموذج الانتشار بإنشاء إطارات فيديو مباشرة، بشرط صوت القيادة والهوية المرجعية. يصف Tavus Phoenix-4 بأنه نموذج انتشار غاوسي؛ يستخدم LemonSlice محول الانتشار. نظرًا لأن النموذج يولد وحدات بكسل بدلاً من تشغيل جهاز، فإنه يمكنه إنتاج تعبيرات وحركات دقيقة وإيماءات يدوية لم يتم تأليف أي نموذج مُجهز بها. وهو أيضًا النهج الأكثر جوعًا للحوسبة، ولهذا السبب فإن تسعير الدقيقة في هذه الفئة هو ما هو عليه الآن.

الرش الغاوسي والتمثيلات المستفادة

يتم عرض Simli من تمثيل Gaussian-splatting بدلاً من إنشاء مساحة بكسل كاملة. تظهر المقايضة في كلا الاتجاهين: تكلفة الدقيقة في Simli هي تقريبًا أقل من موفري نشر البكسلات، وقد أشار المراجعون المستقلون باستمرار إلى سلوكها الخامل - حركة العين الدائرية، والدوران الميكانيكي للرأس، والانتقالات الضعيفة بين الاستماع والتحدث.

عرض ثلاثي الأبعاد

يقوم Uneeq ببناء البشر الرقميين الحجميين في Unreal Engine ويقدمهم عبر WebRTC مع تدفق البكسل. يأخذ مكدس ACE الخاص بـ NVIDIA مسارًا ذا صلة: إنه Audio2Face-3D تقوم الخدمة الصغيرة بتحويل الكلام إلى أشكال مزيج ARKit التي تحرك شخصية ثلاثية الأبعاد، ويتم شحنها كحاوية NIM ذاتية الاستضافة بموجب ترخيص NVIDIA AI Enterprise. لن تخطئ أيضًا في الصورة. في المقابل، تحصل على توجيه فني كامل، وسلوك حتمي، وشخصيات غير بشرية منمقة، و- مع مسار NVIDIA - الخيار الوحيد الحقيقي للاستضافة الذاتية في النهاية العالية.

إنشاء الصورة الرمزية: الصورة مقابل الفيديو

لقد أصبح هذا بهدوء أكبر تمييز عملي. قبل عامين، كان كل مقدم خدمة يطلب تسجيلًا في الاستوديو مدته دقيقتين. الآن يمكن لـ Anam's Cara-4 وSimli وLemonSlice وHedra وOjin وbitHuman إنشاء صورة رمزية من صورة واحدة، بدون أي خطوة تدريب. لا يزال Tavus وHeyGen ينشئان صورًا رمزية مخصصة عالية الجودة من مقطع فيديو مسجل، والذي يستغرق أيامًا بدلاً من ثوانٍ ولكنه يلتقط بيانات الوجه متعددة الزوايا التي يتعين على نماذج الصورة الواحدة استنتاجها.

المقايضة حقيقية. يتيح لك إنشاء صورة واحدة إنشاء مائة شخصية في فترة ما بعد الظهر. لا تزال النسخ المتماثلة المدربة بالفيديو تميل إلى الصمود بشكل أفضل تحت الفحص، لأن النموذج قد شهد تحول رأس الشخص الفعلي.

الأشياء الستة المختلفة التي تسمى "الكمون"

هذا هو الجدول الذي يجب أن يكون موجودًا في صفحة التسعير الخاصة بكل بائع، وهو غير موجود.

ما يتم قياسه من → إلى النطاق المنشور النموذجي هل يشعر به المستخدم؟
الجيل من جانب الخادم وصول المقطع الصوتي ← إنتاج إطار الفيديو 100-250 مللي ثانية فقط كجزء من المجموع. أصغر مكون.
تدفق الكمون الاستدلال داخل حلقة التقديم فقط أقل من 100 مللي ثانية رقم يستثني الشبكة بالكامل.
الاستدلال TTFB طلب → البايت الأول من الإخراج ~470 مللي ثانية ادعى جزئيا. لا يشمل LLM وTTS التي قبله.
الكمون العالمي للصورة الرمزية يشمل خروج الشبكة إلى العميل ~250 مللي ثانية أقرب. لا يزال يستبعد كومة المنطق.
زمن استجابة المحادثة من النهاية إلى النهاية يتوقف المستخدم عن التحدث ← تبدأ الصورة الرمزية في التحدث 600 مللي ثانية – 1.5 ثانية نعم. هذا هو ما يهم.
التنبؤ بالأرضية / أخذ الأدوار مدى السرعة التي يقرر بها النظام أنك انتهيت 55-300 مللي ثانية نعم، وغالبًا ما يكون الجزء الأكبر القابل للاسترداد.

البائع الذي يقتبس 100 مللي ثانية والبائع الذي يقتبس 1 ثانية قد يصف نفس النظام. الأول هو قياس حلقة العرض الخاصة به؛ والثاني هو قياس دورة المحادثة بأكملها. عند مقارنة مقدمي الخدمة، أصر على الصف الخامس، الذي يتم قياسه من الصوت والفيديو المسجل على ساعة واحدة - واطلب p95، وليس فقط المتوسط.

هناك رقم آخر لا ينشره أحد ويجب على الجميع: الوقت اللازم للإطار الأول عند الانضمام إلى الجلسة. في إعداد الكشك أو الكشك، تعد الفجوة بين شخص يمشي وظهور الوجه هي زمن الاستجابة الأكثر أهمية في النظام بأكمله، وقد لاحظ المراجعون المستقلون أن العديد من مقدمي الخدمة بطيئون في الانضمام حتى عندما يكون زمن الاستجابة أثناء المحادثة جيدًا.

أي زمن الوصول يتنبأ في الواقع بالرضا

التقييم الأعمى الوحيد الذي أجراه طرف ثالث لهذه الفئة، والذي تم نشره حتى الآن، شمل 178 مشاركًا، ووجد أن الاستجابة كانت أقوى مؤشر فردي للتجربة الشاملة - ارتباط سبيرمان يبلغ 0.697 - قبل الجودة البصرية، التي جاءت في المرتبة الثانية. تستحق هذه النتيجة أن تستوعبها قبل أن تقضي أسبوعًا في مقارنة نسيج الجلد. لا يلاحظ المستخدمون بشكل موثوق النموذج الذي يتم عرضه بشكل أفضل. يلاحظون، على الفور، أيهما يجيب بشكل أسرع.

المزودون

الأرقام أدناه كما تم نشرها من قبل كل بائع أو تم الإبلاغ عنها بواسطة مراجعين خارجيين اعتبارًا من أغسطس 2026. لقد تحركت أسعار الصور الرمزية في الوقت الفعلي بسرعة وستستمر في التحرك؛ تعامل مع كل رقم كنقطة بداية للقياس الخاص بك، وليس كمواصفات.

إذا لم تكن قد رأيت أحد هذه العناصر في المحادثة، فهذا هو التنسيق: وجه معروض يتم تشغيله مباشرة بواسطة صوت الوكيل. تم نشر العرض التوضيحي للمورد بواسطة Simli، وهو أحد مقدمي الخدمة مقارنة أدناه.

Anam

Anam هي شركة فرعية في لندن تأسست في عام 2023 على يد موظفين سابقين في Synthesia. يقوم نموذج Cara-4، الذي تم إصداره في يوليو 2026، بإنشاء صورة رمزية للمحادثة من صورة واحدة بمعدل 25 إطارًا في الثانية، ويخرج 1152 × 768 في الوضع الأفقي و768 × 1152 في الوضع الرأسي. ينشر Anam متوسط ​​زمن الوصول للمحادثة أقل من ثانية واحدة مع ما يقرب من 150-180 مللي ثانية من الإنشاء من جانب الخادم، ويدعم أكثر من 70 لغة، ويقدم LLM الخاص بك، ويسرد تغطية SOC 2 Type II وHIPAA وGDPR مع عدم الاحتفاظ بالبيانات. النقل هو WebRTC عبر بيون. لقد احتلت المرتبة الأولى من حيث الجودة البصرية ومزامنة الشفاه والطبيعية والاستجابة في دراسة عمياء شملت 178 مشاركًا.

النقد المستقل المستمر ليس النموذج - يصف المراجعون التعبيرات الدقيقة لـ Cara-4 بأنها الأفضل في فئتها - ولكن السباكة: الانضمام البطيء للجلسة والسلوك السيئ في ظل عرض النطاق الترددي المقيد. لقد تطلب تكامل LiveKit تاريخيًا حلاً بديلاً.

Tavus

مختبر أبحاث سان فرانسيسكو، خريجو YC، تأسس عام 2020. Tavus تبيع كاملا واجهة الفيديو المحادثة بدلاً من طبقة العرض، المبنية من ثلاثة نماذج خاصة: فينيكس-4 للتقديم، الغراب -1 للإدراك (النظرة والتعبير والسياق البيئي) و Sparrow-1 لتدفق المحادثة، والذي يبلغ Tavus عن متوسط زمن الوصول للتنبؤ بالأرضية بمقدار 55 مللي ثانية. تبلغ مطالبات الكمون العام أقل من 600 مللي ثانية. النقل WebRTC يوميًا؛ كانت من بين أوائل الشركات التي قامت بشحن البرنامج الإضافي للصورة الرمزية LiveKit. تأتي النسخ المتماثلة المخصصة من تسجيل مدته دقيقتان وتستغرق من 3 إلى 5 أيام في الخطط القياسية، و24 ساعة في المؤسسة.

Tavus هو الخيار الأكثر تكاملاً رأسيًا هنا - الإدراك، وأخذ الأدوار، والعرض، وLLM، وTTS، وWebRTC، كلها متضمنة في سعر الدقيقة - وهي أيضًا الأكثر تكلفة. أفاد تقييم أحد المشترين أن إنشاء الصورة الرمزية المخصصة قد اكتمل بنسبة 66% تقريبًا قبل حدوث الأخطاء والطلب إعادة المحاولة.

HeyGen الصورة الرمزية الحية

HeyGen يتم التحول من ترجمة الفيديو إلى إنشاء الصورة الرمزية وتعيين الشريط المرئي للفئة. يحل LiveAvatar محل منتج Interactive Avatar الأقدم ويقدم كلاً من Agent API وواجهة برمجة تطبيقات الصوت إلى الفيديو في الإصدار التجريبي، عبر WebSockets أو WebRTC على البنية التحتية LiveKit، مع دعم إطار عمل LiveKit وPipecat وTEN. يشمل عملاء الإنتاج المذكورون Coursera وHP وBosch.

قوتها المميزة في التقييم المستقل هي السلوك الخامل - الحركات الدقيقة الأكثر طبيعية وأنماط الوميض لأي مزود تم اختباره - بالإضافة إلى الرجوع التلقائي إلى الصوت أو النص في حالة عدم توفر الصورة الرمزية، وهي ميزة إنتاج مدروسة حقًا. نقطة ضعفه المميزة هي النطاق العاطفي: الوجه ينطق الكلمات بدقة، لكن السجل مسطح.

تتطلب الصور الرمزية المخصصة تسجيلاً غير مقطوع لمدة دقيقتين بالإضافة إلى أ فيديو الموافقةوخارج خطط Enterprise، يجب التقاط الموافقة مباشرة عبر كاميرا الويب.

Simli

Simli هي شركة تابعة لـ YC لعام 2023 تضع نفسها بشكل واضح كبنية تحتية - طبقة الوجه لعملاء الصوت، لا أكثر. إنه يوفر كلاً من واجهات برمجة تطبيقات Agent وAudio-to-Video، وإنشاء صورة رمزية واحدة، ودعم LiveKit وPipecat، وسعر ليس قريبًا من سعر أي شخص آخر: 0.009 دولار للدقيقة مقابل سوق يتراوح سعره في الغالب بين 8 و35 سنتًا. مطالبات زمن الوصول أقل من 300 مللي ثانية.

وتأتي التكلفة من الهندسة المعمارية، وليس من الدعم، وكذلك سقف الجودة. يشير المراجعون بشكل متكرر إلى حالة الخمول - الصورة الرمزية "لا تشعر بالراحة أبدًا". إذا كانت جلستك قصيرة ومعظمها يتحدث، فقد لا يهم ذلك. إذا وقف شخص ما أمامه في صمت لمدة خمس عشرة ثانية، فسوف يفعل ذلك.

Beyond Presence

Beyond Presence تأسست في ألمانيا عام 2024 وتركز على الوكلاء المُدارين للمبيعات والموارد البشرية والتدريب، باستخدام نموذج Genesis الرمزي. إنه ينشر استدلالًا متدفقًا أقل من 100 مللي ثانية وزمن وصول الصورة الرمزية العالمي أقل من 250 مللي ثانية - وهما قياسان مختلفان، وهو أمر جدير بالملاحظة في ضوء القسم أعلاه. النقل هو WebRTC على LiveKit، مع دعم كل من LiveKit وPipecat وتضمين iframe. يتمتع التسعير بخاصية غير عادية ومرحب بها: الأسعار المشمولة والمعدلات الزائدة متطابقة في كل مستوى، لذلك لا يوجد منحدر.

يقوم المراجعون المستقلون بتقييم جودة الفيديو وتكيف النطاق الترددي من بين الأفضل في هذه الفئة. النقد تمثيلي: نظرًا لأنه يتم تشفيره من صورة ثابتة، وصف أحد التقييمات المخرجات بأنها ذات سقف صلب و"تشبه التميمة" للاستخدام الجاد في B2B.

LemonSlice

LemonSlice - Infinity AI سابقًا - أعيد إطلاقه في 2024/25 كمختبر أبحاث رائد للفيديو التفاعلي. تم بناء الصور الرمزية على محول نشر، وتأتي من صورة واحدة، وهي تتعامل بشكل فريد مع الشخصيات المنمقة وغير الواقعية بشكل جيد، وليس فقط البشر الواقعيين. يشير المراجعون إلى أن الإيماءات وحركة اليد هي الأكثر تعبيرًا المتاحة. النقل هو WebRTC يوميًا؛ هناك عنصر واجهة مستخدم وواجهة برمجة تطبيقات REST، بالإضافة إلى دعم خطوط الأنابيب LiveKit أو Pipecat أو خطوط الأنابيب اليومية المُدارة ذاتيًا.

ينشر LemonSlice وقت استجابة يبلغ 471 مللي ثانية ويصفه بأنه الأسرع بين أي مزود رئيسي. لاحظ أن صفحة المقارنة العامة لمنافس واحد على الأقل تنسب رقمًا متطابقًا يبلغ 471 مللي ثانية إلى HeyGen. لا يمكن أن يصف كلاهما نفس القياس، ولم يتم التحقق من أي منهما بشكل مستقل - وهذه هي المشكلة التي يجب أن تشير إليها هذه المقالة.

Ojin

تم تصميمه بواسطة Journee Technologies، Ojin يدير نموذجين للوجه خلفه واجهة برمجة تطبيقات واحدة: صورة للحجم و وجود للتعبير، وكلاهما مدفوع بنموذج Oris 1.0 لتحويل الكلام إلى الفيديو. يتم إنشاء الشخصيات من صورة مرجعية واحدة بدون أي خطوة تدريبية. ينشر Ojin زمن وصول أقل من 200 مللي ثانية ويتصل عبر WebSocket، مما يجعل من السهل الإفلات في خط أنابيب موجود ولكنه يعني أنك مسؤول عن النقل من جانب العميل. يعتمد التسعير على الائتمان عبر مستويات Creator (8 دولارات شهريًا) والاستوديو (82 دولارًا شهريًا) والنمو (232 دولارًا شهريًا) ومستويات المؤسسات، مع بدلات دقائق منفصلة لنموذج واجهة برمجة التطبيقات (API) ووضعي الوكيل.

bitHuman

bitHuman هي إحدى الشركات المشاركة في مجال حوسبة الحافة، والتي تأسست عام 2023 في سان فرانسيسكو، وهي مبنية على فرضية مفادها أن الصور الرمزية لن تكون موجودة في كل مكان حتى يتم تشغيلها على الجهاز. إنه يشحن نموذجًا "أساسيًا" يمكن استضافته ذاتيًا أو تشغيله في السحابة ونموذجًا "معبّرًا" يعمل على السحابة فقط. الأسعار المُبلغ عنها هي تقريبًا 0.04 دولارًا أمريكيًا/الدقيقة للسحابة و0.01 دولارًا أمريكيًا للدقيقة مستضافة ذاتيًا. النقل هو WebRTC عبر LiveKit، مع قاعدة المعرفة وخطافات الويب والتحليلات وأحداث الإيماءات من جانب العميل.

الجودة تم تصنيفها بأنها مقبولة وليست ممتازة. ولكنها المزود الرئيسي الوحيد الذي يقدم النشر المحلي، والذي يغير حساب التفاضل والتكامل بالكامل للأكشاك غير المتصلة بالإنترنت، والبيئات المعزولة بالهواء، وأي شيء حيث لا يمكن الدفاع عن الفوترة السحابية لكل دقيقة عند التثبيت لمدة ثماني ساعات.

Hedra وD-ID وUneeq

Hedra (2023، سان فرانسيسكو) يبني نماذج أساسية للشخصيات الرقمية مع التركيز على الإبداع بدلاً من التركيز على المنفعة. الصور الرمزية ذات الصورة الواحدة، WebRTC على LiveKit، حوالي 0.07 دولار/الدقيقة. يشير الاختبار المستقل إلى انخفاض الدقة ومعدل البت وزمن الوصول البطيء.

معرف د (إسرائيل، 2017) هو المخضرم، المعروف علنًا بـ Deep Nostalgia، الذي يركز الآن على البث المباشر للمؤسسات. WebRTC عبر Janus، ولا يوجد دعم لإطار العمل، وواجهة برمجة تطبيقات منخفضة المستوى بدون SDK. ما يقرب من 0.35 دولارًا أمريكيًا/الدقيقة، مع تصنيف زمن الاستجابة بطيئًا في الاختبارات المستقلة.

Uneeq يسبق الطفرة التوليدية تمامًا، حيث يقدم البشر الرقميين لـ Unreal Engine عبر تدفق البكسل بموجب ترخيص بدلاً من التسعير بالدقيقة. يتم إنشاء الصور الرمزية يدويًا بواسطة Uneeq. الكمون جيد. مرونة عرض النطاق الترددي ليست كذلك؛ ويمكنك معرفة أنه تم تقديمه ثلاثي الأبعاد.

Synthesia، الفئة السائدة لفيديو الشركات غير المتزامن، أظهرت عرضًا مباشرًا ولكنها لم تجعله متاحًا للعامة اعتبارًا من أحدث استطلاع مستقل.

جدول المقارنة

مزود شكل واجهة برمجة التطبيقات التقديم مصدر الصورة الرمزية النقل الأطر الكمون المنشور
Anam وكيل الانتشار (كارا-4) صورة واحدة WebRTC (بيون) LiveKit (الحل البديل) محادثة فرعية 1; ~150-180 مللي ثانية الخادم
Tavus وكيل الانتشار الغوسي (فينيكس-4) فيديو مدته 2 دقيقة WebRTC (يوميًا) LiveKit، Pipecat أقل من 600 مللي ثانية؛ التنبؤ بالأرضية 55 مللي ثانية
HeyGen الصورة الرمزية الحية وكيل + A2V الملكية فيديو مدته دقيقتين + موافقة WebSocket أو WebRTC (LiveKit) LiveKit، Pipecat، عشرة ~471 مللي ثانية TTFB (متنازع عليها)
Simli وكيل + A2V رش غاوسي صورة واحدة WebRTC (يوميًا) LiveKit، Pipecat أقل من 300 مللي ثانية
Beyond Presence وكيل + A2V الملكية (التكوين) فيديو قصير WebRTC (LiveKit) LiveKit، Pipecat <100 مللي الاستدلال؛ ≥250 مللي ثانية عالمية
LemonSlice وكيل محول الانتشار صورة واحدة WebRTC (يوميًا) تدار ذاتيا 471 مللي ثانية (الإبلاغ الذاتي)
Ojin وكيل + نموذج API أوريس 1.0 تحويل الكلام إلى الفيديو صورة واحدة WebSocket ملحد خط الأنابيب أقل من 200 مللي ثانية
bitHuman وكيل أو محلي الملكية صورة أو فيديو WebRTC (LiveKit) LiveKit لم يتم نشره
Hedra وكيل الملكية صورة واحدة WebRTC (LiveKit) LiveKit (الحل البديل) لم يتم نشره
معرف د وكيل الملكية صورة WebRTC (يانوس) لا شيء "الكمون المنخفض"، لا يوجد رقم
Uneeq وكيل محرك غير واقعي 3D بناه Uneeq WebRTC (تدفق البكسل) لا شيء لم يتم نشره

ما يكلف

يتراوح ثلثا هذه الفئة بين 0.08 دولار و0.35 دولار للدقيقة. القيم المتطرفة تستحق الفهم، لأنها قيم متطرفة لأسباب هيكلية.

مزود فعالة في الدقيقة الواحدة الهيكل احترس من
Simli $0.009 الدفع أولاً بأول، رصيد اشتراك بقيمة 10 دولارات جودة حالة الخمول
bitHuman ~ 0.01 دولار مستضاف ذاتيًا / ~ 0.04 دولار سحابي في الدقيقة أو المحلية الاستضافة الذاتية تعني أنك تمتلك وحدات معالجة الرسومات
Hedra ~$0.07 في الدقيقة القرار ومعدل البت
Beyond Presence 0.087–0.175 يورو (S2V) / 0.175–0.35 يورو (الوكيل) الاعتمادات؛ وشملت = معدل الزائد وضع الوكيل هو بالضبط 2 × S2V
HeyGen الصورة الرمزية الحية 0.095 دولارًا أمريكيًا (لايت، الأعمال) - 0.25 دولارًا أمريكيًا (الكامل، المبتدئ) الاعتمادات، 100 دولار = 1000 وحدات التسعير المختلطة؛ يمكن أن يتجاوز الفائض تكلفة ائتمان الخطة
Anam 0.18-0.24 دولار أمريكي مخلوط اشتراك + دقائق الدقائق تنتهي شهريا؛ الطبقة 999 دولارًا لديها معدل أسوأ للدقيقة من الطبقة 299 دولارًا
LemonSlice ~$0.21 الاشتراك + الشحن المسبق للجلسة نموذج الشحن المسبق المعتمد على الجلسة
Tavus 0.32 دولارًا أمريكيًا مختلطًا (النمو) / 0.59 دولارًا أمريكيًا (المبتدئين) اشتراك + دقائق تقريب 6 ثوانٍ، الحد الأدنى 30 ثانية، أعلى تجاوز في الفئة
معرف د ~$0.35 الاشتراك + الاعتمادات لا يوجد SDK؛ تكلفة التكامل هي التكلفة الحقيقية

هناك نقطتان هيكليتان مهمتان أكثر من المعدل الرئيسي:

التزامن هو القيد الخفي. يشير التسعير لكل دقيقة إلى أنه يمكنك التوسع، لكن الخطط تحدد الجلسات المتزامنة، وتكون الحدود القصوى منخفضة. وجد أحد التقييمات المنشورة أن Tavus يسمح بـ 15 جلسة متزامنة على خطة بقيمة 395 دولارًا شهريًا، وAnam يسمح بـ 5 جلسات على خطة بقيمة 299 دولارًا تقريبًا، وHeyGen يسمح بـ 20 جلسة على مستواه الأساسي. إذا كنت تضع صورة رمزية أمام جمهور مؤتمر أو حملة تسويقية، فإن التزامن - وليس الدقائق - هو ما تشتريه بالفعل. اسأل عنها قبل أن تسأل عن السعر.

المجمعة مقابل إحضار الأشياء الخاصة بك يغير المقارنة بالكامل. يتضمن معدل الدقيقة Tavus الإدراك وأخذ الأدوار والعرض وLLM وTTS وWebRTC. يشمل مبلغ Simli البالغ 0.009 دولارًا أمريكيًا العرض ولا شيء آخر - لا تزال تدفع مقابل STT وLLM وTTS والنقل بشكل منفصل. قارن بين ما أعجبني وما أعجبني وإلا سيبدو الخيار الرخيص أرخص بمقدار 35 مرة مما هو عليه بالفعل.

الموافقة والتشابه والقواعد المطبقة الآن

يتطلب كل مقدم خدمة الحصول على موافقة لإنشاء صورة رمزية لشخص حقيقي، وتختلف الآليات بما يكفي للتأثير على سير عملك. يتطلب HeyGen مقطع فيديو موافقة مسجلاً من الشخص الذي تم تصويره، وخارج خطط Enterprise، يجب التقاط تلك الموافقة مباشرة عبر كاميرا الويب - مما يعني أنه لا يمكنك إنشاء صور رمزية دفعة واحدة من اللقطات المؤرشفة في خطة قياسية.

بشكل منفصل، منذ 2 أغسطس 2026، تنطبق المادة 50 من قانون الاتحاد الأوروبي بشأن الذكاء الاصطناعي. يجب على الأنظمة التي تتفاعل بشكل مباشر مع الأشخاص أن توضح أن التفاعل يتم مع الذكاء الاصطناعي، ويجب الكشف عن المحتوى الاصطناعي أو المُتلاعب به بوضوح عند التعرض لأول مرة. إن الصورة الرمزية الواقعية للإنسان تقع بشكل مباشر ضمن كلا الالتزامين. إن المعنى العملي واضح ومباشر: قم بالكشف في التبادل الأول، وقم بتصميم الكشف في التجربة بدلاً من تثبيته على تذييل الصفحة.

كيفية تقييم هذه نفسك

تم ضبط العروض التوضيحية للموردين. أرقام البائعين لا تضاهى. إليك بروتوكول يستغرق حوالي يوم وينتج أرقامًا يمكنك مقارنتها فعليًا.

1. اختبار الخمول

ابدأ الجلسة ولا تقل شيئًا لمدة خمس عشرة ثانية. مشاهدة الوجه. هذه هي الإشارة الأكثر صدقًا لجودة العرض، لأنه لا يوجد صوت يمكن إخفاءه خلفه - وهذا هو المكان الذي يفشل فيه معظم مقدمي الخدمة أولاً. ابحث عن معدل رمش العين، والتنفس، وحركة الرأس الدقيقة، والانتقال بين الاستماع والتحدث. كرر مع 30 ثانية. في عملية نشر الكشك، تقضي الصورة الرمزية معظم حياتها في هذه الحالة.

ثلاث طبقات شبحية لنفس الوجه المرسوم يتم إزاحتها قليلاً، مع خطوط كفاف سماوية تتبع الحركة الدقيقة حول العينين والفك

ثلاث لحظات عينة من خمسة عشر ثانية من الصمت. معدل الرمش والتنفس والحركة الدقيقة للرأس هي الأماكن التي يصعب فيها تزييف جودة العرض. الصورة التي تم إنشاؤها باستخدام صورة GPT 2.

2. اختبار الساعة

سجل كلا جانبي التفاعل في ساعة واحدة - يتم التقاط مدخلات الميكروفون والمخرجات معًا. لا تستخدم التوقيتات التي أبلغ عنها البائع. قم بالقياس من نهاية خطابك إلى أول كلمة مسموعة من الرد، عبر 30 دورة على الأقل، وقم بالإبلاغ عن الصفحة 50 والصفحة 95 بشكل منفصل. توقع أن يكون p95 أسوأ بكثير من الإصدار التجريبي، وتوقع أن يكون هذا هو الرقم الذي يواجهه المستخدمون لديك.

3. اختبار الانضمام

ابدأ الجلسة على البارد عشرين مرة وقم بقياس وقت ساعة الحائط من البداية إلى أول إطار معروض. لا أحد ينشر هذا وهو يهيمن على الانطباعات الأولى في إعدادات المتابعة.

4. اختبار البارجة

قم بالمقاطعة في بداية ووسط ونهاية جملة الصورة الرمزية. بشكل منفصل، اختبر قناة خلفية ("mm-hm")، وتصحيحًا حقيقيًا ("لا، الجمعة")، وضوضاء خلفية نقية. تحقق من ثلاثة أشياء: هل يتوقف عندما ينبغي، هل يفعل ذلك لا يتوقف عندما لا ينبغي ذلك، وهل يستأنف مع الحفاظ على السياق سليمًا.

5. اختبار عرض النطاق الترددي

قم بالتخفيض إلى 1.5 ميجابت في الثانية، ثم 500 مللي ثانية من الارتعاش الإضافي، ثم 500 كيلوبت في الثانية. هذا هو المكان الذي ينفصل فيه مقدمو الخدمة بشكل كبير، وهو غير مرئي على اتصال المكتب. وجد الاختبار المستقل أن العديد من موفري الخدمة يبدون ممتازين عند تجميد الألياف أو قطع الاتصال في ظل نطاق ترددي مقيد - وهو بالضبط ما تمثله شبكة wifi للمؤتمرات.

6. الاختبار الأعمى

ضع مرشحين أو ثلاثة أمام عشرة أشخاص لا يعرفون أيهم، واطلب منهم ترتيب الخبرة بدلاً من المظهر. وبما أن الاستجابة تتنبأ بالرضا بقوة أكبر من الجودة البصرية، فلا تتفاجأ عندما يخسر أجمل نموذج.

كيفية الاختيار

مضغوط للقرارات التي تتفرع فعلا:

  • لديك بالفعل وكيل صوت عامل. قم بشراء واجهة برمجة تطبيقات الصوت إلى الفيديو، وليس واجهة برمجة تطبيقات الوكيل. Beyond PresenceوSimli وHeyGen تبيع جميعها طبقة العرض وحدها، وتحتفظ بالتحكم في الشيء الذي يحدد ما إذا كانت المحادثة جيدة أم لا.
  • أنت بحاجة إلى أعلى جودة بصرية ومعبرة. يقود Anam's Cara-4 وTavus's Phoenix-4 تقييمات مستقلة، في الجزء العلوي من النطاق السعري. ميزانية التزامن، وليس الدقائق فقط.
  • أنت بحاجة إلى حجم كبير بتكلفة منخفضة. Simli، بترتيب حقيقي من حيث الحجم أسفل الحقل - بشرط أن تكون قد قمت بالتحقق من صحة حالة الخمول مقابل نمط الجلسة الفعلي.
  • أنت بحاجة إلى اقتصاديات التثبيت دون اتصال بالإنترنت أو معزولة بالهواء أو طوال اليوم. نموذج bitHuman المحلي، أو NVIDIA ACE مع Audio2Face-3D إذا كان بإمكانك حمل خط الأنابيب ثلاثي الأبعاد.
  • أنت بحاجة إلى شخصية منمقة أو غير بشرية. LemonSlice للأنماط التي تم إنشاؤها؛ Uneeq أو NVIDIA ACE للتأليف ثلاثي الأبعاد.
  • أنت في حاجة إليها مضمنة في منتج هذا الأسبوع. واجهة برمجة تطبيقات الوكيل مع عنصر واجهة المستخدم. اقبل الحد الأقصى، وخطط للانتقال إلى طبقة العرض عندما تصبح جودة المحادثة قيدًا ملزمًا.

الخط السفلي

تتقارب النماذج في هذه الفئة بشكل أسرع من التسويق من حولها. خلص المراجعون المستقلون الذين قاموا بتقييم عشرة مقدمي خدمات جنبًا إلى جنب إلى أن اختلافات الجودة بينهم حقيقية ولكنها ليست كبيرة، وأن التكنولوجيا جاهزة للتدريب والتوظيف وحالات استخدام المبيعات، وأن التكاليف تمتد إلى نطاق 35× وهو يتغير بسرعة.

ما لا يتقارب هو القياس. وإلى أن ينشر شخص ما معيارًا مشتركًا يستخدمه جميع البائعين - زمن استجابة المحادثة من طرف إلى طرف، p50 وp95، من الصوت المسجل، ضمن نطاق ترددي واقعي - فإن الرقم الوحيد الذي يمكنك الوثوق به هو الرقم الذي قمت بقياسه بنفسك.

قضاء اليوم. قم بإجراء الاختبارات الستة. لن تتطابق النتائج مع أوراق المواصفات، والفجوة هي بيت القصيد.

مساعدك الأول على بعد دقائق

ضع معرفتك التجارية في العمل.

ابدأ بحساب Cody مجاني. أضف المحتوى الخاص بك، وقم بإنشاء مساعد، وشارك أول إجابة مفيدة اليوم.