Comparaison des agents d'appel téléphonique IA : latence, détection de virage et interruptions
Pourquoi tous les benchmarks publiés ne sont pas d'accord, combien vous coûte réellement la détection de virage et comment la mesurer vous-même. Voici deux faits sur les agents téléphoniques IA en 2026, tous deux bien documentés, tous deux vrais et apparemment incompatibles. Premier fait : Vapi cible p50 sous… Lire la suite »

Pourquoi tous les benchmarks publiés ne sont pas d'accord, combien vous coûte réellement la détection de virage et comment la mesurer vous-même
Voici deux faits sur les agents téléphoniques IA en 2026, tous deux bien documentés, vrais et apparemment incompatibles.
Premier fait : Vapi cible p50 sous 500 ms. Retell publie environ 600 ms. La page d'accueil de Bland indique 400 ms. Les tests ConversationRelay internes du Twilio rapportent une médiane de 491 ms.
Deuxième fait : une référence indépendante qui a composé ces plates-formes sur des lignes téléphoniques réelles et mesuré à partir de l'audio enregistré a trouvé des médianes comprises entre 1 296 ms et 1 740 ms – chaque plate-forme est deux à quatre fois plus lente que son propre chiffre publié.
Personne ne ment. Ils mesurent différentes choses, sur différents transports, avec différentes hypothèses sur le point de départ de l'horloge. Et jusqu'à ce que vous compreniez exactement ce que décrit chaque numéro, vous ne pouvez utiliser aucun d'entre eux pour choisir une plate-forme.
Cet article prend le problème de mesure au sérieux, met côte à côte les références publiées avec leurs méthodologies associées, explique pourquoi la détection de virage - et non le modèle de langage - est désormais la variable dominante, et se termine par un protocole pour produire des nombres auxquels vous pouvez réellement faire confiance.
Où passe le temps
Un appel vocal lors d'un appel téléphonique est une course de relais à cinq étapes, et le relais est lancé entre chaque paire de coureurs.

Un tour de voix est une course de relais en cinq étapes. L'un d'eux est toujours beaucoup plus large que les autres. Image générée avec GPT Image 2.
| Scène | Pile colocalisée | Pile cousue typique |
|---|---|---|
| Réseau / SIP | 45 ms | 150 ms |
| Parole en texte | 100 ms | 225 ms |
| Inférence LLM | 225 ms | 650 ms |
| Synthèse vocale | 80 ms | 185 ms |
| Total | 450 ms | 1 210 ms |
Deux observations. Le LLM domine les deux colonnes - c'est pourquoi l'acheminement des virages conversationnels ordinaires vers un petit modèle rapide et l'escalade uniquement lorsque le raisonnement est véritablement nécessaire constituent le changement le plus puissant disponible pour la plupart des équipes. Et l'écart de 760 ms entre les colonnes ne constitue pas une différence dans la qualité du modèle. Il s'agit de la géographie, du nombre de sauts et du nombre de réseaux de fournisseurs distincts traversés par l'audio.
Ce que ce tableau laisse de côté, c'est l'étape qui coûte généralement le plus cher : décider que l'appelant a fini de parler. Cela se produit avant le démarrage du relais, et un seuil de point de terminaison mal configuré peut ajouter plus de retard que l'ensemble du pipeline en dessous.
Les benchmarks, avec leurs méthodologies attachées
Quatre études indépendantes ont publié des chiffres pour ces plateformes en 2026. Elles ne sont pas d’accord, inversant parfois complètement le classement. Les voici avec la méthodologie qui les a produits, car la méthodologie est le résultat.
Étude 1 : Appels téléphoniques réels, mesurés à partir de l'audio enregistré
L'évaluation publique la plus transparente sur le plan méthodologique a appelé l'agent de chaque plate-forme lors d'un appel téléphonique réel avec un robot appelant lisant un script fixe, a enregistré les deux côtés de l'appel sur une seule horloge et a localisé les limites de parole dans l'enregistrement à l'aide de Silero VAD avec un raffinement énergétique. Aucun horodatage signalé par la plateforme n’a été utilisé. 2 078 tours utilisables sur cinq plates-formes ; point final normalisé à 0,1 s lorsque configurable. La métrique est le temps écoulé jusqu'au premier octet audio.
| Plateforme | p50 | p95 | Rapport de queue | Tours utilisables |
|---|---|---|---|---|
| Telnyx | 1 296 ms | 1 856 ms | 1.43× | 419/432 |
| ElevenLabs | 1 424 ms | 1 768 ms | 1.24× | 429/432 |
| Bland AI | 1 520 ms | 2 248 ms | 1.48× | 429/432 |
| Vapi | 1 558 ms | 2 008 ms | 1.29× | 382/432 |
| Retell AI | 1 740 ms | 2 259 ms | 1.30× | 419/430 |
Notez la dernière colonne. Vapi a rejeté 50 tours, soit plus de dix pour cent, contre une poignée pour les autres. Une plate-forme qui ne parvient parfois pas à produire un tour utilisable vous dit quelque chose qu'aucun centile de latence ne capture.
Etude 2 : Appels de production, voix-voix
Une étude de mars 2026 a mené 500 appels de production par plateforme, mesurant la voix à voix.
| Plateforme | Médiane | p95 |
|---|---|---|
| Retell | 680 ms | 920 ms |
| Vapi | 720 ms | 1 050 ms |
| Bland | 850 ms | 1 180 ms |
Retell termine dernier de l'étude 1 et premier de l'étude 2. Même plateforme, même année, conclusion opposée. C’est le point le plus important de cet article : dans l’état actuel de la technique, la méthode de mesure déplace le résultat plus que la plateforme.
Étude 3 : Pile tierce fixe
Une approche différente : maintenez les modèles constants (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) et mesurez le tour complet, en isolant la couche d'orchestration :
| Plateforme | Tour complet, p50 |
|---|---|
| ElevenLabs | 1,73 s |
| Retell | 1,96 s |
| Vapi | 2,34 s |
Chaque chiffre ici est bien supérieur à ce qu'annonce n'importe quel fournisseur, car un tour complet sur une pile tierce fixe inclut les pièces que les fournisseurs excluent lorsqu'ils proposent leur propre chemin optimisé.
Etude 4 : La jambe porteuse seule
Enfin, un test réalisé en juin 2026 sur 120 appels sortants par opérateur en temps aller-retour isolé sur le tronçon téléphonie :
| Transporteur | p50 RTT | p95 RTT |
|---|---|---|
| Telnyx | 71 ms | 118 ms |
| Twilio | 89 ms | 161 ms |
| Vonage | 94 ms | 152 ms |
Contexte utile : le porteur contribue en dessous de 100 ms. Si votre agent se sent lent, le réseau téléphonique n’en est presque jamais la cause.

Un objet, quatre instruments, quatre lectures. Chaque chiffre de latence présenté dans cet article est exact ; ils ne mesurent tout simplement pas la même portée. Image générée avec GPT Image 2.
Comment lire les quatre ensemble
| Type de numéro | Ce qu'il comprend | Ce qu'il cache | Faites-lui confiance pour |
|---|---|---|---|
| Réclamation p50 du fournisseur | Chemin optimisé, souvent WebSocket pas de téléphonie | Attente de point final, jambe porteuse, queue | Qualité architecturale brute |
| Latence des composants (par exemple 75 ms TTS) | Temps de synthèse d'un modèle | Tout le reste | Choisir ce composant |
| TTFAB audio enregistré | Tout ce que l'appelant entend | Rien, mais inclut les frais généraux d'enregistrement | Classement de l'expérience réelle |
| Tour complet à pile fixe | Frais généraux d'orchestration, isolés | Les modèles optimisés pour chaque plateforme | Comparaison des couches d'orchestration |
| Transporteur RTT | Transport téléphonique uniquement | L'agent entièrement | Choisir un transporteur |
Et les seuils qui comptent sur le plan perceptuel : le transfert de conversation humaine se situe à près de 200 ms ; au-delà d'environ 800 ms, l'appelant enregistre le retard ; au-delà d'environ 1 500 ms, le message est considéré comme cassé. Notez que la plupart des chiffres p95 de l’étude 1 se situent du mauvais côté de ce deuxième seuil. La médiane correspond à ce à quoi ressemble votre démo. Le p95 est ce que ressentent vos appelants.
La détection des virages est le véritable différenciateur
Chaque plate-forme ci-dessus peut appeler des modèles de classe GPT et diffuser des voix de classe ElevenLabs. Ce sont des marchandises. Ce qui différencie un agent naturel d'un agent épuisant, c'est la partie qui décide quand parler, et c’est là que résident désormais les véritables différences d’ingénierie.
La taxe de point final
L'approche naïve attend le silence. Définissez le seuil à 800 ms et vous avez ajouté près d'une seconde complète à chaque réponse avant le début de tout traitement. Sur un appel de dix minutes, c'est du véritable air mort, payé par une valeur de configuration. Abaissez le seuil et l'agent commence à interrompre toute personne qui prend une pause pour réfléchir, c'est-à-dire tout le monde, à mi-chemin d'un numéro de compte.
La pile qui le corrige
| Couche | Ce que ça fait | Implémentations représentatives |
|---|---|---|
| VAD | Classifie chaque image audio comme parole ou non | Silero VAD — défaut quasi universel |
| Point de terminaison | Surveille le flux de transcription pour les signaux d'achèvement | Configuration du point de terminaison du fournisseur STT |
| Détection de virage sémantique | Les prédictions détournent l'achèvement du sens, peuvent s'engager avant le silence | LiveKit détecteur de virage (Qwen2.5-0.5B réglage fin, inférence CPU, 14 langues) ; Pipecat Virage intelligent |
| STT conversationnel | Reconnaissance et tour de rôle en un seul modèle | Deepgram Flux; Tavus Sparrow-1 |
Flux de Deepgram, généralement disponible sous forme multilingue depuis le 29 avril 2026 dans dix langues avec changement de langue en conversation, rapporte une détection médiane de fin de tour à 260 ms avec p95 à 1,5 s, expose un paramètre configurable. eot_threshold pour échanger la latence contre la précision et rapporte une latence de réponse de l'agent de réduction de 200 à 600 ms par rapport au STT-plus-VAD conventionnel. Tavus rapporte son modèle de flux Sparrow-1 avec une latence médiane de prévision du plancher de 55 ms.
Concrètement : passer d'un délai d'attente de silence de 800 ms à un détecteur de virage sémantique peut permettre d'économiser plus de latence que toutes les autres optimisations de cette page combinées. Si vous magasinez sur la latence, demandez quelle détection de tour la plate-forme utilise et si vous pouvez la modifier – cette réponse prédit votre expérience mieux que n'importe quel p50 publié.
Gestion des interruptions : une politique, pas une bascule
L'intrusion est généralement exposée sous la forme d'un booléen. Ce n’est pas la bonne forme pour le problème, et c’est la raison la plus courante pour laquelle un agent qui obtient de bons résultats en termes de latence se sent toujours mal à qui parler.
La raison en est que l’audio de l’appelant entrant n’est pas une chose. Une taxonomie utile le divise en six manières, chacune nécessitant un comportement différent :
| Classe d'entrée | Exemple | Comportement correct | Signal de panne |
|---|---|---|---|
| Véritable correction | "Non, vendredi" | Arrêtez-vous, acceptez le tour, préservez le contexte de la tâche | L'appelant répète la même correction |
| Canal arrière | "ouais", "mm-hm" | Continuez à parler ; ne pas considérer comme une intention | L'agent annule sa réponse et réinitialise |
| Bruit de fond | Clavier, trafic, deuxième voix | Continuez ; enregistrer une fausse interruption | La lecture s'arrête sans transcription de l'appelant |
| DTMF | L'appelant appuie sur 2 pendant un menu | Itinéraire par chiffre, pas par transcription | Chiffre ignoré ou traité comme parole |
| Longue pause d'entité | Suspendre le numéro de compte à mi-chemin | Attendez; ne répondez pas tôt | L'agent interrompt avant que l'entité ne termine |
| Escalade | "Je veux une personne" | Arrêtez-vous et transférez immédiatement | L'agent argumente |
L'échec qui tue la confiance le plus rapidement est le faux arrêt : l'appelant dit « ok » alors que l'agent est au milieu d'une phrase, l'agent s'arrête, puis traite « ok » comme une nouvelle question. Lors d'un appel, c'est un problème. Sur des milliers d’appels, il s’agit d’une baisse mesurable du taux d’achèvement, et cela n’apparaît dans aucune mesure de latence.
La bonne structure est une politique par type de message. Salutations interrompues après un délai de grâce ; menus acceptant DTMF et parole ; entité capture le patient ; divulgations juridiques, de consentement et de paiement non-interruptible; remplissages d'attente d'outil annulables instantanément ; l’intention de transfert humain est toujours honorée.
Et instrumentez-le. Les quatre événements qui valent la peine d'être enregistrés à chaque tour sont le candidat à l'interruption, la décision et la version de politique qui l'a produit, la position de récupération et les faux positifs confirmés. Suivez le taux de fausses interruptions et le taux d’interruptions manquées dans des tableaux de bord distincts : ils évoluent dans des directions opposées et leur moyenne masque les deux. Il existe un pack de scénarios ouvert pour les tests d'intervention sur GitHub qui fonctionne sur Vapi, Retell, Bland, Pipecat et LiveKit auto-hébergé.
Les plateformes
Vapi
Vapi est la couche d'orchestration la plus flexible : apportez vos propres STT, LLM, TTS et téléphonie, échangez-les et ajustez le pipeline. Le prix est d'environ 0,05 $/min pour l'orchestration, chaque fournisseur sous-jacent étant facturé séparément. Des tests indépendants placent une pile optimisée à une médiane de 500 à 700 ms et le pipeline par défaut est considérablement plus lent. Choisissez-le lorsque vous souhaitez contrôler chaque composant et êtes prêt à posséder le réglage ; la flexibilité est réelle, tout comme la charge de configuration.
Retell AI
Retell est une pile gérée mettant l'accent sur les flux de dialogue structurés et la conformité de l'entreprise. Environ 0,055 $/min pour l'infrastructure vocale, avec un paiement à l'utilisation à partir d'environ 0,07 $/min. Signalé à environ 600 ms hors des sentiers battus dans une étude et à la dernière place dans une autre – voir la section ci-dessus. Choisissez-le lorsque vous souhaitez un pipeline géré pris en charge avec un contrôle de flux fort plutôt qu'un kit de composants.
Bland AI
Bland utilise une tarification groupée – parole-texte, LLM, synthèse vocale et téléphonie dans un tarif unique de 0,09 à 0,14 $/min – et spécialement conçue pour les volumes sortants élevés. Mesuré entre 700 et 900 ms en fonction de la complexité de la voie. Le bundle est vraiment plus simple à discuter commercialement ; le compromis est moins de contrôle sur chaque couche.
ElevenLabs Agents
Construit à partir de la synthèse vocale la plus appréciée de la catégorie, dont le modèle Flash synthétise en environ 75 ms. Les agents facturent environ 0,08 $/min sur les plans d'affaires annuels et environ 0,10 $/min sur Creator et Pro, avec des jetons LLM transmis séparément et des allocations de minutes regroupées sur chaque niveau. Jonction SIP connecte la téléphonie existante (Twilio, Telnyx, PBX auto-hébergé) avec une authentification Digest ou ACL et un outil de transfert vers un numéro prenant en charge les styles de conférence, aveugle et SIP REFER. Notamment, il a affiché le rapport de queue le plus serré dans la référence audio enregistrée, ce qui compte plus qu'une bonne médiane.
Telnyx
La propriété distinctive est l’intégration verticale : Telnyx possède le réseau de support sur lequel l'audio transite, et son budget d'architecture de 450 ms provient de la colocalisation de la pile plutôt que de modèles plus rapides. Il a affiché la médiane la plus basse dans l’étude sur les enregistrements audio et le RTT de transporteur le plus bas dans l’étude sur les transports. Choisissez-le lorsque le volet téléphonie est une préoccupation majeure.
OpenAI Realtime
Pas une plate-forme mais un modèle, et de plus en plus la chose sur laquelle les plates-formes sont construites. Le API en temps réel prend en charge trois transports : WebRTC pour les navigateurs, WebSocket pour les serveurs et SIP pour acheminer un véritable appel téléphonique directement vers une session. Il s'agit d'une synthèse vocale native : entrée audio, sortie audio, pas de goulot d'étranglement intermédiaire pour le texte et prosodie préservée tout au long du tour. La tarification est basée sur les jetons plutôt que sur la minute, ce qui produit une large plage efficace en fonction de votre discipline en matière de contexte et de mise en cache. Choisissez-le lorsque vous souhaitez la latence de tour la plus faible possible et pouvez créer l'orchestration environnante ; évitez-le lorsque vous devez enregistrer, auditer ou contraindre le raisonnement intermédiaire, car il n'y a aucun texte à inspecter.
Synthflow, Twilio ConversationRelay et le reste
Synthflow se situe autour de 0,09 $/min pour son moteur vocal avec un constructeur sans code destiné aux opérateurs plutôt qu'aux ingénieurs. Twilio ConversationRelay attache un agent IA au parc téléphonique existant du Twilio, avec des rapports internes de 491 ms p50 et 713 ms p95 – ce qui est intéressant si votre infrastructure d'appel y réside déjà.
Construisez-le vous-même : agents Pipecat et LiveKit
Les deux sont open source et tous deux sont véritablement viables en production.
Pipecat, créé par Daily, modélise un agent vocal comme un pipeline de processeurs à travers lequel circulent l'audio et le texte, avec une très grande bibliothèque de plugins et un développement quasi quotidien. Pipecat Cloud a atteint une disponibilité générale en 2026 après une version bêta avec plus d'un millier d'équipes, le chemin géré existe donc si vous le souhaitez.
Agents LiveKit est construit sur le serveur multimédia WebRTC de LiveKit, et sa particularité est le modèle de salle : l'agent rejoint en tant que participant aux côtés des utilisateurs, ce qui rend les scénarios multi-participants natifs plutôt que boulonnés. Une équipe a publiquement signalé avoir reconstruit un agent téléphonique de Pipecat vers des agents LiveKit lorsqu'un client est passé de 20 à 400 appels simultanés.
L’auto-hébergement peut atterrir bien en dessous de 0,05 $/min en volume. Vous échangez des frais de plateforme contre des travaux d'infrastructure, d'astreinte et de réglage de la latence, ce qui est un bon échange à grande échelle et un mauvais avant d'avoir trouvé l'adéquation produit-marché.
Ce que ça coûte réellement
L’erreur de budgétisation la plus courante dans cette catégorie consiste à comparer un tarif de plateforme uniquement à un tarif groupé.
| Plateforme | Tarif global | Ce que cela couvre | Un tout-en-un réaliste |
|---|---|---|---|
| Vapi | 0,05 $/min | Orchestration uniquement | ~ 0,25 à 0,33 $/min une fois STT, LLM, TTS et la téléphonie ajoutés |
| Retell | 0,055 $/min | Infrastructure vocale | À partir de ~0,07 $/min, paiement à l'utilisation |
| Bland | 0,09 à 0,14 $/min | Tout, regroupé | À peu près le taux global |
| Synthflow | 0,09 $/min | Moteur vocal | Plus LLM et téléphonie |
| ElevenLabs Agents | 0,08 à 0,10 $/min | Plateforme + voix | Plus les jetons LLM transmis |
| OpenAI Realtime | Basé sur des jetons | Le modèle uniquement | Très variable ; la mise en cache et la discipline contextuelle dominent |
| Auto-hébergé (Pipecat / LiveKit) | Infrastructures | Rien de groupé | Peut descendre en dessous de 0,05 $/min en volume, plus le temps d'ingénierie |
Points de référence des composants pour construire votre propre estimation : téléphonie autour de 0,014 $/min, diffusion de la parole en texte autour de 0,008 $/min, TTS premium autour de 0,05 $/min et petit LLM rapide autour de 0,01 $/min. Sur l’ensemble du marché, les tarifs complets en 2026 couvrent une fourchette d’environ six fois, d’environ 0,05 $/min sur les forfaits libre-service les plus agressifs à environ 0,31 $/min sur les niveaux entreprise premium.
Une remarque structurelle : la mise en cache des invites n'est pas une erreur d'arrondi sur un agent vocal. Les invites de votre système (personnage, garde-fous, règles métier, connaissances) sont identiques à chaque appel. Les entrées mises en cache sur les modèles en temps réel coûtent une petite fraction de l’entrée standard. L'activation de la mise en cache modifie fréquemment le coût du modèle d'un ordre de grandeur, et c'est la première chose à vérifier avant que quiconque ne propose de passer à un modèle moins bon pour économiser de l'argent.
La conformité n'est pas facultative ici
Les agents téléphoniques sont soumis à une exposition réglementaire que les agents de navigateur n'ont pas.
Aux États-Unis, la FCC Arrêt déclaratoire de février 2024 a confirmé que les voix générées par l'IA sont une « voix artificielle ou préenregistrée » sous le TCPA. Cela inclut les exigences de consentement pour les appels vers des lignes sans fil et résidentielles, les obligations d'identification et de divulgation et la gestion des désinscriptions – avec des dommages-intérêts légaux allant de 500 $ par violation, allant jusqu'à 1 500 $ pour les violations délibérées. Une nouvelle réglementation de la FCC sur les appels générés par l'IA devrait être conclue vers la fin de 2026 ou le début de 2027, et le résultat largement attendu est une exigence explicite d'identification de l'IA au début de l'appel ainsi qu'un langage de consentement qui nomme spécifiquement l'IA.
Dans l’UE, l’article 50 de la loi sur l’IA s’applique depuis le 2 août 2026 et exige que les personnes soient informées qu’elles interagissent avec l’IA. Au niveau des États américains, le Colorado AI Act entre en vigueur en 2026 et pourrait classer une grande partie de cette catégorie comme à haut risque.
La posture pratique est simple et ne vous coûte rien : divulguez dès la première ligne, conservez le registre de consentement, honorez immédiatement les désinscriptions et rendez le transfert humain toujours disponible. Chacun de ces éléments coûte moins cher à construire maintenant qu’à rénover.
Comparez-le vous-même
Étant donné que deux études crédibles ont inversé les mêmes classements, les seuls chiffres sur lesquels vous devriez agir sont les vôtres. Ce protocole prend une journée.
- Créez un script fixe. Vingt à trente tours couvrant votre cas d'utilisation réel, dont au moins un numéro long, une correction et une requête pour un humain.
- Enregistrez les deux jambes sur une seule horloge. N'utilisez pas les horaires indiqués par la plateforme ; ils excluent des parties du parcours vécu par votre appelant. Capturez l'audio de l'appel réel.
- Mesurer le temps jusqu'au premier octet audio à partir de la fin du discours de l'appelant, en utilisant un VAD sur l'enregistrement plutôt que le flux d'événements d'un fournisseur.
- Standardiser les points de terminaison sur chaque plate-forme que vous testez, ou vous évaluez la configuration plutôt que l'architecture.
- Déclarez p50 et p95 séparément, plus le rapport de queue et le nombre de tours que vous avez dû supprimer. Une plateforme qui ne produit parfois rien est pire qu’une plateforme qui est uniformément un peu plus lente.
- Exécutez les six classes d’interruption du tableau ci-dessus en tant que cas de test distincts, et notez indépendamment les faux arrêts et les arrêts manqués.
- Test sous charge. Chaque plateforme semble bonne sur un seul appel. La concurrence est l'endroit où les médianes se dégradent et les queues explosent.
- Test sur une mauvaise connexion et depuis un combiné mobile dans une voiture en mouvement, et non depuis un bureau connecté à la fibre optique.
L'essentiel
Les plates-formes de cette catégorie sont plus proches les unes des autres que ne le suggère leur marketing, et l'écart entre deux d'entre elles est plus petit que l'écart entre un déploiement bien réglé et un déploiement mal réglé de l'une ou l'autre.
Trois choses comptent plus que le fournisseur que vous choisissez. Détection de virage, car il s'agit de la plus grande tranche de latence récupérable et de la différence entre un agent qui se sent présent et un autre qui ressemble à une arborescence téléphonique. Politique d'interruption, car elle détermine si les appelants font confiance à la chose après le premier malentendu. Et la latence de queue, car votre p95 est ce que vos clients vivent réellement et c'est à peu près là qu'ils raccrochent.
Chaque vendeur vous montrera une médiane. Demandez le p95, demandez comment il a été mesuré, puis allez le mesurer vous-même.
