Comparación de agentes de llamadas telefónicas con IA: latencia, detección de giros e interrupciones
Por qué todos los puntos de referencia publicados no están de acuerdo, cuánto le cuesta realmente la detección de turnos y cómo medirla usted mismo. Aquí hay dos datos sobre los agentes telefónicos con IA en 2026, ambos bien fundamentados, ambos verdaderos y aparentemente incompatibles. Hecho uno: Vapi apunta a p50 en... Leer más »

Por qué todos los puntos de referencia publicados no están de acuerdo, cuánto le cuesta realmente la detección de giros y cómo medirlo usted mismo
Aquí hay dos datos sobre los agentes telefónicos con IA en 2026, ambos bien fundamentados, ambos verdaderos y aparentemente incompatibles.
Hecho uno: Vapi apunta a p50 por debajo de 500 ms. Retell publica aproximadamente 600 ms. La página de inicio de Bland dice 400 ms. Las pruebas internas ConversationRelay de Twilio informan una mediana de 491 ms.
Hecho dos: un punto de referencia independiente que marcó estas plataformas a través de líneas telefónicas reales y midió a partir del audio grabado encontró medianas entre 1296 ms y 1740 ms: cada plataforma de dos a cuatro veces más lenta que su propia cifra publicada.
Nadie miente. Están midiendo cosas diferentes, en diferentes transportes, con diferentes suposiciones sobre dónde comienza el reloj. Y hasta que comprenda exactamente qué describe cada número, no podrá utilizar ninguno de ellos para elegir una plataforma.
Este artículo toma en serio el problema de la medición, compara los puntos de referencia publicados con sus metodologías adjuntas, explica por qué la detección de turnos (no el modelo de lenguaje) es ahora la variable dominante y termina con un protocolo para producir números en los que realmente se puede confiar.
Adónde va el tiempo
Un giro de voz en una llamada telefónica es una carrera de relevos con cinco patas, y el testigo se deja caer entre cada par de corredores.

Un giro de voz es una carrera de relevos en cinco etapas. Uno de ellos siempre es mucho más ancho que los demás. Imagen generada con GPT Imagen 2.
| etapa | Pila coubicada | Pila cosida típica |
|---|---|---|
| Red/SIP | 45 ms | 150 ms |
| Voz a texto | 100 ms | 225 ms |
| inferencia LLM | 225 ms | 650 ms |
| Texto a voz | 80 ms | 185 ms |
| totales | 450 ms | 1.210 ms |
Dos observaciones. El LLM domina ambas columnas, razón por la cual enrutar los giros conversacionales ordinarios a un modelo pequeño y rápido y escalar solo cuando se requiere realmente razonamiento es el cambio de mayor influencia disponible para la mayoría de los equipos. Y la brecha de 760 ms entre las columnas no es una diferencia en la calidad del modelo. Es la geografía, el número de saltos y cuántas redes de proveedores separados cruza el audio.
Lo que deja fuera esta tabla es la etapa que suele costar más: decidir que quien llama ha terminado de hablar. Esto sucede antes de que comience la retransmisión, y un umbral de punto final mal configurado puede agregar más retraso que todo el proceso por debajo de él.
Los puntos de referencia, con sus metodologías adjuntas
Cuatro estudios independientes han publicado cifras para estas plataformas en 2026. No están de acuerdo y, a veces, invierten las clasificaciones por completo. Aquí están con la metodología que los produjo, porque la metodología es el resultado.
Estudio 1: llamadas telefónicas reales, medidas a partir de audio grabado
El punto de referencia público más metodológicamente transparente marcó al agente de cada plataforma a través de una llamada telefónica real con un robot llamador que leía un guión fijo, grabó ambos lados de la llamada en un solo reloj y ubicó los límites del habla en la grabación usando Silero VAD con un refinamiento de energía. No se utilizaron marcas de tiempo informadas por la plataforma. 2.078 giros utilizables en cinco plataformas; Punto final estandarizado a 0,1 s cuando sea configurable. La métrica es el tiempo hasta el primer byte de audio.
| Plataforma | p50 | p95 | Relación de cola | Giros utilizables |
|---|---|---|---|---|
| Telnyx | 1.296 ms | 1.856 ms | 1.43× | 419/432 |
| ElevenLabs | 1.424 ms | 1.768 ms | 1.24× | 429/432 |
| Bland AI | 1.520 ms | 2.248 ms | 1.48× | 429/432 |
| Vapi | 1.558 ms | 2.008 ms | 1.29× | 382/432 |
| Retell AI | 1.740 ms | 2.259 ms | 1.30× | 419/430 |
Tenga en cuenta la última columna. Vapi descartó 50 turnos (más del diez por ciento) frente a un puñado de los demás. Una plataforma que ocasionalmente no logra producir ningún giro utilizable le está diciendo algo que ningún percentil de latencia captura.
Estudio 2: Llamadas de producción, voz a voz
Un estudio de marzo de 2026 realizó 500 llamadas de producción por plataforma, midiendo voz a voz.
| Plataforma | mediana | p95 |
|---|---|---|
| Retell | 680 ms | 920 ms |
| Vapi | 720 ms | 1.050 ms |
| Bland | 850 ms | 1.180 ms |
Retell termina último en el Estudio 1 y primero en el Estudio 2. Misma plataforma, mismo año, conclusión opuesta. Esto es lo más importante de este artículo: en el estado actual de la técnica, el método de medición mueve el resultado más que la plataforma.
Estudio 3: pila de terceros fija
Un enfoque diferente: mantenga los modelos constantes (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) y mida el giro completo, aislando la capa de orquestación:
| Plataforma | Giro completo, p50 |
|---|---|
| ElevenLabs | 1,73 segundos |
| Retell | 1,96 segundos |
| Vapi | 2,34 segundos |
Cada número aquí está muy por encima de lo que anuncia cualquier proveedor, porque un giro completo en una pila fija de terceros incluye las piezas que los proveedores excluyen cuando citan su propia ruta optimizada.
Estudio 4: La pierna portadora sola
Finalmente, una prueba realizada en junio de 2026 con 120 llamadas salientes por operador aisló el tiempo de ida y vuelta en el tramo de telefonía:
| Transportista | p50 RTT | p95 RTT |
|---|---|---|
| Telnyx | 71 ms | 118 ms |
| Twilio | 89 ms | 161 ms |
| Vonage | 94 ms | 152 ms |
Contexto útil: la portadora contribuye por debajo de 100 ms. Si su agente se siente lento, la red telefónica casi nunca es el motivo.

Un objeto, cuatro instrumentos, cuatro lecturas. Todas las cifras de latencia de este artículo son precisas; simplemente no miden el mismo lapso. Imagen generada con GPT Imagen 2.
Cómo leer los cuatro juntos
| Tipo de número | Que incluye | lo que esconde | Confía en ello |
|---|---|---|---|
| Reclamación del proveedor p50 | Ruta optimizada, a menudo WebSocket no es telefonía | Espera de punto final, pierna portadora, cola | Calidad de arquitectura rugosa |
| Latencia del componente (por ejemplo, 75 ms TTS) | El tiempo de síntesis de un modelo. | Todo lo demás | Elegir ese componente |
| TTFAB de audio grabado | Todo lo que escucha la persona que llama | Nada, pero incluye grabación general | Clasificación de experiencia real |
| Turno completo de pila fija | Gastos generales de orquestación, aislados | Los modelos tuneados propios de cada plataforma. | Comparación de capas de orquestación |
| RTT del operador | Sólo transporte de telefonía | El agente por completo | Elegir un transportista |
Y los umbrales que importan desde el punto de vista de la percepción: la transferencia conversacional humana se sitúa cerca de los 200 ms; después de aproximadamente 800 ms, la persona que llama registra el retraso; Después de aproximadamente 1500 ms, se lee como roto. Tenga en cuenta que la mayoría de las cifras de p95 en el Estudio 1 se encuentran en el lado equivocado de ese segundo umbral. La mediana es cómo se siente tu demostración. El p95 es lo que sienten quienes llaman.
La detección de giros es el verdadero diferenciador
Todas las plataformas anteriores pueden llamar a modelos de clase GPT y transmitir voces de clase ElevenLabs. Esas son mercancías. Lo que separa a un agente natural de uno agotador es la parte que decide cuando hablar, y aquí es donde ahora residen las verdaderas diferencias de ingeniería.
El impuesto final
El enfoque ingenuo espera el silencio. Establezca el umbral en 800 ms y habrá agregado casi un segundo completo a cada respuesta antes de que comience cualquier procesamiento. Más de diez minutos de llamada que son una verdadera farsa, pagada con un valor de configuración. Si se baja el umbral, el agente comenzará a interrumpir a cualquiera que se detenga a pensar, es decir, a todos, a mitad de camino de un número de cuenta.
La pila que lo arregla
| capa | que hace | Implementaciones representativas |
|---|---|---|
| VAD | Clasifica cada cuadro de audio como voz o no. | Silero VAD – incumplimiento casi universal |
| Punto final | Observa el flujo de transcripción en busca de señales de finalización. | Configuración de punto final del proveedor STT |
| Detección de giro semántico | Las predicciones convierten la compleción del significado, pueden cometerse antes que el silencio. | LiveKit detector de giro (Ajuste Qwen2.5-0.5B, inferencia de CPU, 14 idiomas); Pipecat Giro inteligente |
| STT conversacional | Reconocimiento y toma de turnos en un solo modelo | Deepgram Flux; Tavus Sparrow-1 |
Flux de Deepgram, generalmente disponible en formato multilingüe desde el 29 de abril de 2026 en diez idiomas con cambio de idioma en la conversación, informa una detección media de fin de turno a 260 ms con p95 a 1,5 s, expone un valor configurable eot_threshold para intercambiar latencia con precisión e informa que reduce la latencia de respuesta del agente entre 200 y 600 ms en comparación con STT-plus-VAD convencional. Tavus informa su modelo de flujo Sparrow-1 con una latencia media de predicción mínima de 55 ms.
Dicho de manera concreta: cambiar de un tiempo de espera de silencio de 800 ms a un detector de giro semántico puede ahorrar más latencia que cualquier otra optimización en esta página combinada. Si está comprando en función de la latencia, pregunte qué detección de giro utiliza la plataforma y si puede cambiarla; esa respuesta predice su experiencia mejor que cualquier p50 publicado.
Manejo de interrupciones: una política, no una palanca
La irrupción generalmente se expone como un valor booleano. Esa es la forma incorrecta del problema y es la razón más común por la que un agente con una buena puntuación en latencia todavía se siente mal al hablar con él.
La razón es que el audio de la llamada entrante no es una sola cosa. Una taxonomía útil la divide en seis formas, cada una de las cuales requiere un comportamiento diferente:
| Clase de entrada | Ejemplo | Comportamiento correcto | señal de falla |
|---|---|---|---|
| Corrección verdadera | "No, viernes" | Detener, aceptar el turno, preservar el contexto de la tarea | La persona que llama repite la misma corrección. |
| Canal trasero | "Sí", "mm-hm" | Sigue hablando; no lo trates como intención | El agente cancela su respuesta y se reinicia |
| Ruido de fondo | Teclado, tráfico, segunda voz. | Continuar; registrar una interrupción falsa | La reproducción se detiene sin transcripción de la persona que llama |
| DTMF | La persona que llama presiona 2 durante un menú | Ruta por dígito, no por transcripción | Dígito ignorado o tratado como voz |
| Pausa larga de entidad | Pausa a mitad del número de cuenta | Esperar; no respondas temprano | El agente interrumpe antes de que la entidad complete |
| Escalada | "Quiero una persona" | Detener y transferir inmediatamente | El agente argumenta |
El fallo que acaba más rápidamente con la confianza es la parada en falso: la persona que llama dice "está bien" mientras el agente está a mitad de una frase, el agente se detiene y luego trata "está bien" como una nueva pregunta. En una llamada es un problema técnico. En miles de llamadas, se trata de una caída mensurable en la tasa de finalización y no aparece en ninguna métrica de latencia.
La estructura correcta es la política por tipo de mensaje. Saludos interrumpibles después de un período de gracia; menús que aceptan DTMF y voz; paciente de captura de entidad; divulgaciones legales, de consentimiento y de pago no interrumpible; rellenos de espera de herramientas cancelables instantáneamente; Siempre se respeta la intención de transferencia humana.
Y instrumentarlo. Los cuatro eventos que vale la pena registrar en cada turno son el candidato a la interrupción, la decisión y la versión de política que la produjo, la posición de recuperación y los falsos positivos confirmados. Realice un seguimiento de la tasa de interrupciones falsas y de las interrupciones perdidas como paneles de control separados: se mueven en direcciones opuestas y al promediarlos se ocultan ambas. Hay un paquete de escenarios abierto para pruebas de irrupción en GitHub que funciona en Vapi, Retell, Bland, Pipecat y LiveKit autohospedado.
Las plataformas
Vapi
Vapi es la capa de orquestación más flexible: traiga su propio STT, LLM, TTS y telefonía, intercambie cualquiera de ellos y ajuste la canalización. Con un precio de aproximadamente $0,05/min para la orquestación, y cada proveedor subyacente se factura por separado. Las pruebas independientes sitúan una pila optimizada en una mediana de 500 a 700 ms y la canalización predeterminada es significativamente más lenta. Elígelo cuando quieras controlar cada componente y estés preparado para ser dueño del ajuste; la flexibilidad es real y también lo es la carga de configuración.
Retell AI
Retell es una pila administrada con énfasis en flujos de diálogo estructurados y cumplimiento empresarial. Aproximadamente $0,055/min para infraestructura de voz, con pago por uso desde aproximadamente $0,07/min. Se informó alrededor de 600 ms de forma inmediata en un estudio y en último lugar en otro; consulte la sección anterior. Elíjalo cuando desee una canalización administrada compatible con un fuerte control de flujo en lugar de un kit de componentes.
Bland AI
Bland utiliza precios combinados (voz a texto, LLM, texto a voz y telefonía con una tarifa de $0,09 a $0,14/min) y está diseñado específicamente para salidas de gran volumen. Medido alrededor de 700 a 900 ms según la complejidad de la ruta. Es realmente más sencillo razonar comercialmente sobre el paquete; la compensación es un menor control sobre cada capa.
ElevenLabs Agents
Construido a partir de la síntesis de voz mejor considerada en la categoría, cuyo modelo Flash sintetiza en aproximadamente 75 ms. Los agentes facturan desde aproximadamente $0,08/min en planes comerciales anuales y alrededor de $0,10/min en Creator y Pro, con tokens LLM transferidos por separado y asignaciones de minutos agrupadas en cada nivel. Enlace troncal SIP conecta la telefonía existente (Twilio, Telnyx, PBX autohospedado) con autenticación implícita o ACL y una herramienta de transferencia a número que admite estilos de conferencia, ciego y SIP REFER. En particular, registró el ratio de cola más ajustado en el punto de referencia de audio grabado, lo que importa más que una buena mediana.
Telnyx
La propiedad distintiva es la integración vertical: Telnyx es propietario de la red portadora por la que viaja el audio y su presupuesto de arquitectura de 450 ms proviene de la ubicación conjunta de la pila en lugar de modelos más rápidos. Publicó la mediana más baja en el estudio de audio grabado y el RTT de operador más bajo en el estudio de transporte. Elíjalo cuando el segmento de telefonía sea una preocupación de primera clase.
OpenAI Realtime
No es una plataforma, sino un modelo, y cada vez más, aquello sobre lo que se construyen las plataformas. el API en tiempo real admite tres transportes: WebRTC para navegadores, WebSocket para servidores y SIP para enrutar una llamada telefónica real directamente a una sesión. Es habla a voz nativa: entrada y salida de audio, sin cuellos de botella de texto intermedio y prosodia preservada durante todo el turno. El precio se basa en tokens en lugar de por minuto, lo que produce un amplio rango efectivo dependiendo de qué tan disciplinado sea con el contexto y el almacenamiento en caché. Elíjalo cuando desee la latencia de giro más baja posible y pueda crear la orquestación circundante; evítelo cuando necesite registrar, auditar o restringir el razonamiento intermedio, porque no hay ningún texto para inspeccionar.
Synthflow, Twilio ConversationRelay y el resto
Synthflow cuesta alrededor de $0.09/min por su motor de voz con un constructor sin código dirigido a operadores en lugar de ingenieros. Twilio ConversationRelay conecta un agente de IA al conjunto de telefonía existente de Twilio, con 491 ms p50 y 713 ms p95 informados internamente, lo que resulta atractivo si su infraestructura de llamadas ya se encuentra allí.
Construyéndolo usted mismo: Agentes Pipecat y LiveKit
Ambos son de código abierto y ambos son realmente viables en producción.
Pipecat, originado por Daily, modela un agente de voz como una tubería de procesadores a través de los cuales fluyen el audio y el texto, con una biblioteca de complementos muy grande y un desarrollo casi diario. Pipecat Cloud alcanzó disponibilidad general en 2026 después de una versión beta con más de mil equipos, por lo que la ruta administrada existe si la deseas.
LiveKit Agentes está construido sobre el servidor de medios WebRTC de LiveKit, y su característica distintiva es el modelo de sala: el agente se une como participante junto con los usuarios, lo que hace que los escenarios de múltiples participantes sean nativos en lugar de agregados. Un equipo informó públicamente que había reconstruido un agente telefónico de Pipecat en agentes LiveKit cuando un cliente aumentó de 20 a 400 llamadas simultáneas.
El autohospedaje puede costar muy por debajo de $0,05/min en volumen. Está negociando tarifas de plataforma por infraestructura, guardia y trabajo de ajuste de latencia, lo cual es una buena operación a escala y una mala antes de encontrar el producto adecuado para el mercado.
Lo que realmente cuesta
El error de presupuestación más común en esta categoría es comparar una tarifa solo de plataforma con una tarifa combinada.
| Plataforma | Tasa de título | lo que eso cubre | Todo incluido realista |
|---|---|---|---|
| Vapi | $0.05/min | Solo orquestación | ~$0,25–0,33/min una vez que se agregan STT, LLM, TTS y telefonía |
| Retell | 0,055 $/minuto | Infraestructura de voz | Desde ~$0,07/min pago por uso |
| Bland | $0,09–0,14/minuto | Todo, empaquetado | Aproximadamente la tasa principal |
| Synthflow | $0.09/min | motor de voz | Más LLM y telefonía |
| ElevenLabs Agents | $0,08–0,10/minuto | Plataforma + voz | Más tokens LLM pasados |
| OpenAI Realtime | Basado en tokens | el modelo solo | Altamente variable; el almacenamiento en caché y la disciplina de contexto dominan |
| Autohospedado (Pipecat / LiveKit) | Infraestructura | Nada incluido | Puede costar menos de $0,05/min en volumen, más tiempo de ingeniería |
Puntos de referencia de los componentes para crear su propia estimación: telefonía alrededor de $0,014/min, transmisión de voz a texto alrededor de $0,008/min, TTS premium alrededor de $0,05/min y un LLM pequeño y rápido alrededor de $0,01/min. En todo el mercado, las tarifas completamente cargadas en 2026 abarcan aproximadamente un rango de seis veces, desde alrededor de $0,05/min en los planes de autoservicio más agresivos hasta alrededor de $0,31/min en los niveles empresariales premium.
Una nota estructural: el almacenamiento en caché de mensajes no es un error de redondeo en un agente de voz. Los mensajes de su sistema (personalidad, barreras de seguridad, reglas comerciales, conocimiento) son idénticos en cada llamada. La entrada almacenada en caché en modelos en tiempo real tiene un precio de una pequeña fracción de la entrada estándar. Activar el almacenamiento en caché cambia con frecuencia el costo del modelo en un orden de magnitud, y es lo primero que se debe verificar antes de que alguien proponga cambiar a un modelo peor para ahorrar dinero.
El cumplimiento no es opcional aquí
Los agentes telefónicos están expuestos a regulaciones que los agentes de navegador no tienen.
En los Estados Unidos, la FCC Sentencia declarativa de febrero de 2024 confirmó que las voces generadas por IA son una "voz artificial o pregrabada" según el TCPA. Esto incluye requisitos de consentimiento para llamadas a líneas inalámbricas y residenciales, obligaciones de identificación y divulgación, y manejo de exclusión voluntaria, con daños legales que van desde $500 por violación, hasta $1,500 por violaciones intencionales. Se espera que a finales de 2026 o principios de 2027 concluya una nueva reglamentación de la FCC sobre las llamadas generadas por IA, y el resultado ampliamente esperado es un requisito explícito de identificación de IA al inicio de la llamada más un lenguaje de consentimiento que nombra específicamente a la IA.
En la UE, el artículo 50 de la Ley de IA se aplica desde el 2 de agosto de 2026 y exige que se informe a las personas que están interactuando con IA. A nivel estatal en EE. UU., la Ley de IA de Colorado entrará en vigor en 2026 y puede clasificar gran parte de esta categoría como de alto riesgo.
La postura práctica es simple y no le cuesta nada: revelar en la línea inicial, mantener el registro de consentimiento, respetar las opciones de exclusión inmediatamente y hacer que la transferencia humana esté siempre disponible. Cada uno de estos es más barato de construir ahora que de modernizar.
Compárelo usted mismo
Dado que dos estudios creíbles invirtieron las mismas clasificaciones, los únicos números sobre los que debes actuar son los tuyos propios. Este protocolo dura un día.
- Construya un guión fijo. De veinte a treinta turnos que cubren su caso de uso real, incluido al menos un número largo, una corrección y una solicitud para un humano.
- Registre ambas piernas en un reloj. No utilice horarios informados por la plataforma; excluyen partes del camino que experimenta la persona que llama. Capture el audio de la llamada real.
- Medir el tiempo hasta el primer byte de audio desde el final del discurso de la persona que llama, utilizando un VAD en la grabación en lugar del flujo de eventos de cualquier proveedor.
- Estandarizar los puntos finales en cada plataforma que prueba, o está comparando la configuración en lugar de la arquitectura.
- Informe p50 y p95 por separado, más el ratio de cola y el conteo de vueltas que tuviste que descartar. Una plataforma que ocasionalmente no produce nada es peor que una plataforma que es uniformemente un poco más lenta.
- Ejecute las seis clases de interrupción. de la tabla anterior como casos de prueba separados y puntuar paradas falsas y paradas perdidas de forma independiente.
- Prueba bajo carga. Cada plataforma se ve bien en una sola llamada. La concurrencia es donde las medianas se degradan y las colas explotan.
- Prueba en una mala conexión y desde un teléfono móvil en un coche en marcha, no desde un escritorio con fibra.
La conclusión
Las plataformas en esta categoría están más juntas de lo que sugiere su marketing, y la brecha entre dos de ellas es menor que la brecha entre una implementación bien y mal sintonizada de cualquiera de ellas.
Tres cosas importan más que el proveedor que elijas. Detección de turnos, porque es la mayor porción recuperable de latencia y la diferencia entre un agente que se siente presente y uno que se siente como un árbol telefónico. Política de interrupción, porque determina si las personas que llaman confían en la cosa después del primer malentendido. Y latencia de cola, porque su p95 es lo que sus clientes realmente experimentan y es más o menos donde cuelgan.
Cada proveedor le mostrará una mediana. Pregunte por el p95, pregunte cómo se midió y luego mídalo usted mismo.
