Todos los artículos
IA en tiempo real

Comparación de agentes de llamadas telefónicas con IA: latencia, detección de giros e interrupciones

Por qué todos los puntos de referencia publicados no están de acuerdo, cuánto le cuesta realmente la detección de turnos y cómo medirla usted mismo. Aquí hay dos datos sobre los agentes telefónicos con IA en 2026, ambos bien fundamentados, ambos verdaderos y aparentemente incompatibles. Hecho uno: Vapi apunta a p50 en... Leer más »

Por Om Kamathtiempo de lectura: 18 minutos
Dos formas de onda de audio enfrentadas a través de un campo oscuro con un espacio brillante que se turna entre ellas

Por qué todos los puntos de referencia publicados no están de acuerdo, cuánto le cuesta realmente la detección de giros y cómo medirlo usted mismo

Aquí hay dos datos sobre los agentes telefónicos con IA en 2026, ambos bien fundamentados, ambos verdaderos y aparentemente incompatibles.

Hecho uno: Vapi apunta a p50 por debajo de 500 ms. Retell publica aproximadamente 600 ms. La página de inicio de Bland dice 400 ms. Las pruebas internas ConversationRelay de Twilio informan una mediana de 491 ms.

Hecho dos: un punto de referencia independiente que marcó estas plataformas a través de líneas telefónicas reales y midió a partir del audio grabado encontró medianas entre 1296 ms y 1740 ms: cada plataforma de dos a cuatro veces más lenta que su propia cifra publicada.

Nadie miente. Están midiendo cosas diferentes, en diferentes transportes, con diferentes suposiciones sobre dónde comienza el reloj. Y hasta que comprenda exactamente qué describe cada número, no podrá utilizar ninguno de ellos para elegir una plataforma.

Este artículo toma en serio el problema de la medición, compara los puntos de referencia publicados con sus metodologías adjuntas, explica por qué la detección de turnos (no el modelo de lenguaje) es ahora la variable dominante y termina con un protocolo para producir números en los que realmente se puede confiar.

Adónde va el tiempo

Un giro de voz en una llamada telefónica es una carrera de relevos con cinco patas, y el testigo se deja caer entre cada par de corredores.

Barra de línea de tiempo apilada abstracta que muestra cinco segmentos de latencia desiguales que cruzan una línea de umbral

Un giro de voz es una carrera de relevos en cinco etapas. Uno de ellos siempre es mucho más ancho que los demás. Imagen generada con GPT Imagen 2.

etapa Pila coubicada Pila cosida típica
Red/SIP 45 ms 150 ms
Voz a texto 100 ms 225 ms
inferencia LLM 225 ms 650 ms
Texto a voz 80 ms 185 ms
totales 450 ms 1.210 ms

Dos observaciones. El LLM domina ambas columnas, razón por la cual enrutar los giros conversacionales ordinarios a un modelo pequeño y rápido y escalar solo cuando se requiere realmente razonamiento es el cambio de mayor influencia disponible para la mayoría de los equipos. Y la brecha de 760 ms entre las columnas no es una diferencia en la calidad del modelo. Es la geografía, el número de saltos y cuántas redes de proveedores separados cruza el audio.

Lo que deja fuera esta tabla es la etapa que suele costar más: decidir que quien llama ha terminado de hablar. Esto sucede antes de que comience la retransmisión, y un umbral de punto final mal configurado puede agregar más retraso que todo el proceso por debajo de él.

Los puntos de referencia, con sus metodologías adjuntas

Cuatro estudios independientes han publicado cifras para estas plataformas en 2026. No están de acuerdo y, a veces, invierten las clasificaciones por completo. Aquí están con la metodología que los produjo, porque la metodología es el resultado.

Estudio 1: llamadas telefónicas reales, medidas a partir de audio grabado

El punto de referencia público más metodológicamente transparente marcó al agente de cada plataforma a través de una llamada telefónica real con un robot llamador que leía un guión fijo, grabó ambos lados de la llamada en un solo reloj y ubicó los límites del habla en la grabación usando Silero VAD con un refinamiento de energía. No se utilizaron marcas de tiempo informadas por la plataforma. 2.078 giros utilizables en cinco plataformas; Punto final estandarizado a 0,1 s cuando sea configurable. La métrica es el tiempo hasta el primer byte de audio.

Plataforma p50 p95 Relación de cola Giros utilizables
Telnyx 1.296 ms 1.856 ms 1.43× 419/432
ElevenLabs 1.424 ms 1.768 ms 1.24× 429/432
Bland AI 1.520 ms 2.248 ms 1.48× 429/432
Vapi 1.558 ms 2.008 ms 1.29× 382/432
Retell AI 1.740 ms 2.259 ms 1.30× 419/430

Tenga en cuenta la última columna. Vapi descartó 50 turnos (más del diez por ciento) frente a un puñado de los demás. Una plataforma que ocasionalmente no logra producir ningún giro utilizable le está diciendo algo que ningún percentil de latencia captura.

Estudio 2: Llamadas de producción, voz a voz

Un estudio de marzo de 2026 realizó 500 llamadas de producción por plataforma, midiendo voz a voz.

Plataforma mediana p95
Retell 680 ms 920 ms
Vapi 720 ms 1.050 ms
Bland 850 ms 1.180 ms

Retell termina último en el Estudio 1 y primero en el Estudio 2. Misma plataforma, mismo año, conclusión opuesta. Esto es lo más importante de este artículo: en el estado actual de la técnica, el método de medición mueve el resultado más que la plataforma.

Estudio 3: pila de terceros fija

Un enfoque diferente: mantenga los modelos constantes (GPT-4.1, Deepgram Nova-3, ElevenLabs Flash) y mida el giro completo, aislando la capa de orquestación:

Plataforma Giro completo, p50
ElevenLabs 1,73 segundos
Retell 1,96 segundos
Vapi 2,34 segundos

Cada número aquí está muy por encima de lo que anuncia cualquier proveedor, porque un giro completo en una pila fija de terceros incluye las piezas que los proveedores excluyen cuando citan su propia ruta optimizada.

Estudio 4: La pierna portadora sola

Finalmente, una prueba realizada en junio de 2026 con 120 llamadas salientes por operador aisló el tiempo de ida y vuelta en el tramo de telefonía:

Transportista p50 RTT p95 RTT
Telnyx 71 ms 118 ms
Twilio 89 ms 161 ms
Vonage 94 ms 152 ms

Contexto útil: la portadora contribuye por debajo de 100 ms. Si su agente se siente lento, la red telefónica casi nunca es el motivo.

Cuatro instrumentos de medición diferentes que abarcan diferentes tramos de la misma barra brillante

Un objeto, cuatro instrumentos, cuatro lecturas. Todas las cifras de latencia de este artículo son precisas; simplemente no miden el mismo lapso. Imagen generada con GPT Imagen 2.

Cómo leer los cuatro juntos

Tipo de número Que incluye lo que esconde Confía en ello
Reclamación del proveedor p50 Ruta optimizada, a menudo WebSocket no es telefonía Espera de punto final, pierna portadora, cola Calidad de arquitectura rugosa
Latencia del componente (por ejemplo, 75 ms TTS) El tiempo de síntesis de un modelo. Todo lo demás Elegir ese componente
TTFAB de audio grabado Todo lo que escucha la persona que llama Nada, pero incluye grabación general Clasificación de experiencia real
Turno completo de pila fija Gastos generales de orquestación, aislados Los modelos tuneados propios de cada plataforma. Comparación de capas de orquestación
RTT del operador Sólo transporte de telefonía El agente por completo Elegir un transportista

Y los umbrales que importan desde el punto de vista de la percepción: la transferencia conversacional humana se sitúa cerca de los 200 ms; después de aproximadamente 800 ms, la persona que llama registra el retraso; Después de aproximadamente 1500 ms, se lee como roto. Tenga en cuenta que la mayoría de las cifras de p95 en el Estudio 1 se encuentran en el lado equivocado de ese segundo umbral. La mediana es cómo se siente tu demostración. El p95 es lo que sienten quienes llaman.

La detección de giros es el verdadero diferenciador

Todas las plataformas anteriores pueden llamar a modelos de clase GPT y transmitir voces de clase ElevenLabs. Esas son mercancías. Lo que separa a un agente natural de uno agotador es la parte que decide cuando hablar, y aquí es donde ahora residen las verdaderas diferencias de ingeniería.

El impuesto final

El enfoque ingenuo espera el silencio. Establezca el umbral en 800 ms y habrá agregado casi un segundo completo a cada respuesta antes de que comience cualquier procesamiento. Más de diez minutos de llamada que son una verdadera farsa, pagada con un valor de configuración. Si se baja el umbral, el agente comenzará a interrumpir a cualquiera que se detenga a pensar, es decir, a todos, a mitad de camino de un número de cuenta.

La pila que lo arregla

La detección de turnos es la parte menos glamorosa y más importante de un agente de voz. El propio recorrido de LiveKit sobre su modelo semántico de fin de expresión es la explicación breve más clara de por qué un tiempo de espera de silencio no es suficiente.
capa que hace Implementaciones representativas
VAD Clasifica cada cuadro de audio como voz o no. Silero VAD – incumplimiento casi universal
Punto final Observa el flujo de transcripción en busca de señales de finalización. Configuración de punto final del proveedor STT
Detección de giro semántico Las predicciones convierten la compleción del significado, pueden cometerse antes que el silencio. LiveKit detector de giro (Ajuste Qwen2.5-0.5B, inferencia de CPU, 14 idiomas); Pipecat Giro inteligente
STT conversacional Reconocimiento y toma de turnos en un solo modelo Deepgram Flux; Tavus Sparrow-1

Flux de Deepgram, generalmente disponible en formato multilingüe desde el 29 de abril de 2026 en diez idiomas con cambio de idioma en la conversación, informa una detección media de fin de turno a 260 ms con p95 a 1,5 s, expone un valor configurable eot_threshold para intercambiar latencia con precisión e informa que reduce la latencia de respuesta del agente entre 200 y 600 ms en comparación con STT-plus-VAD convencional. Tavus informa su modelo de flujo Sparrow-1 con una latencia media de predicción mínima de 55 ms.

Dicho de manera concreta: cambiar de un tiempo de espera de silencio de 800 ms a un detector de giro semántico puede ahorrar más latencia que cualquier otra optimización en esta página combinada. Si está comprando en función de la latencia, pregunte qué detección de giro utiliza la plataforma y si puede cambiarla; esa respuesta predice su experiencia mejor que cualquier p50 publicado.

Manejo de interrupciones: una política, no una palanca

La irrupción generalmente se expone como un valor booleano. Esa es la forma incorrecta del problema y es la razón más común por la que un agente con una buena puntuación en latencia todavía se siente mal al hablar con él.

La razón es que el audio de la llamada entrante no es una sola cosa. Una taxonomía útil la divide en seis formas, cada una de las cuales requiere un comportamiento diferente:

Clase de entrada Ejemplo Comportamiento correcto señal de falla
Corrección verdadera "No, viernes" Detener, aceptar el turno, preservar el contexto de la tarea La persona que llama repite la misma corrección.
Canal trasero "Sí", "mm-hm" Sigue hablando; no lo trates como intención El agente cancela su respuesta y se reinicia
Ruido de fondo Teclado, tráfico, segunda voz. Continuar; registrar una interrupción falsa La reproducción se detiene sin transcripción de la persona que llama
DTMF La persona que llama presiona 2 durante un menú Ruta por dígito, no por transcripción Dígito ignorado o tratado como voz
Pausa larga de entidad Pausa a mitad del número de cuenta Esperar; no respondas temprano El agente interrumpe antes de que la entidad complete
Escalada "Quiero una persona" Detener y transferir inmediatamente El agente argumenta

El fallo que acaba más rápidamente con la confianza es la parada en falso: la persona que llama dice "está bien" mientras el agente está a mitad de una frase, el agente se detiene y luego trata "está bien" como una nueva pregunta. En una llamada es un problema técnico. En miles de llamadas, se trata de una caída mensurable en la tasa de finalización y no aparece en ninguna métrica de latencia.

La estructura correcta es la política por tipo de mensaje. Saludos interrumpibles después de un período de gracia; menús que aceptan DTMF y voz; paciente de captura de entidad; divulgaciones legales, de consentimiento y de pago no interrumpible; rellenos de espera de herramientas cancelables instantáneamente; Siempre se respeta la intención de transferencia humana.

Y instrumentarlo. Los cuatro eventos que vale la pena registrar en cada turno son el candidato a la interrupción, la decisión y la versión de política que la produjo, la posición de recuperación y los falsos positivos confirmados. Realice un seguimiento de la tasa de interrupciones falsas y de las interrupciones perdidas como paneles de control separados: se mueven en direcciones opuestas y al promediarlos se ocultan ambas. Hay un paquete de escenarios abierto para pruebas de irrupción en GitHub que funciona en Vapi, Retell, Bland, Pipecat y LiveKit autohospedado.

Las plataformas

Vapi

Vapi es la capa de orquestación más flexible: traiga su propio STT, LLM, TTS y telefonía, intercambie cualquiera de ellos y ajuste la canalización. Con un precio de aproximadamente $0,05/min para la orquestación, y cada proveedor subyacente se factura por separado. Las pruebas independientes sitúan una pila optimizada en una mediana de 500 a 700 ms y la canalización predeterminada es significativamente más lenta. Elígelo cuando quieras controlar cada componente y estés preparado para ser dueño del ajuste; la flexibilidad es real y también lo es la carga de configuración.

Retell AI

Retell es una pila administrada con énfasis en flujos de diálogo estructurados y cumplimiento empresarial. Aproximadamente $0,055/min para infraestructura de voz, con pago por uso desde aproximadamente $0,07/min. Se informó alrededor de 600 ms de forma inmediata en un estudio y en último lugar en otro; consulte la sección anterior. Elíjalo cuando desee una canalización administrada compatible con un fuerte control de flujo en lugar de un kit de componentes.

Bland AI

Bland utiliza precios combinados (voz a texto, LLM, texto a voz y telefonía con una tarifa de $0,09 a $0,14/min) y está diseñado específicamente para salidas de gran volumen. Medido alrededor de 700 a 900 ms según la complejidad de la ruta. Es realmente más sencillo razonar comercialmente sobre el paquete; la compensación es un menor control sobre cada capa.

ElevenLabs Agents

Construido a partir de la síntesis de voz mejor considerada en la categoría, cuyo modelo Flash sintetiza en aproximadamente 75 ms. Los agentes facturan desde aproximadamente $0,08/min en planes comerciales anuales y alrededor de $0,10/min en Creator y Pro, con tokens LLM transferidos por separado y asignaciones de minutos agrupadas en cada nivel. Enlace troncal SIP conecta la telefonía existente (Twilio, Telnyx, PBX autohospedado) con autenticación implícita o ACL y una herramienta de transferencia a número que admite estilos de conferencia, ciego y SIP REFER. En particular, registró el ratio de cola más ajustado en el punto de referencia de audio grabado, lo que importa más que una buena mediana.

Telnyx

La propiedad distintiva es la integración vertical: Telnyx es propietario de la red portadora por la que viaja el audio y su presupuesto de arquitectura de 450 ms proviene de la ubicación conjunta de la pila en lugar de modelos más rápidos. Publicó la mediana más baja en el estudio de audio grabado y el RTT de operador más bajo en el estudio de transporte. Elíjalo cuando el segmento de telefonía sea una preocupación de primera clase.

OpenAI Realtime

No es una plataforma, sino un modelo, y cada vez más, aquello sobre lo que se construyen las plataformas. el API en tiempo real admite tres transportes: WebRTC para navegadores, WebSocket para servidores y SIP para enrutar una llamada telefónica real directamente a una sesión. Es habla a voz nativa: entrada y salida de audio, sin cuellos de botella de texto intermedio y prosodia preservada durante todo el turno. El precio se basa en tokens en lugar de por minuto, lo que produce un amplio rango efectivo dependiendo de qué tan disciplinado sea con el contexto y el almacenamiento en caché. Elíjalo cuando desee la latencia de giro más baja posible y pueda crear la orquestación circundante; evítelo cuando necesite registrar, auditar o restringir el razonamiento intermedio, porque no hay ningún texto para inspeccionar.

Synthflow, Twilio ConversationRelay y el resto

Synthflow cuesta alrededor de $0.09/min por su motor de voz con un constructor sin código dirigido a operadores en lugar de ingenieros. Twilio ConversationRelay conecta un agente de IA al conjunto de telefonía existente de Twilio, con 491 ms p50 y 713 ms p95 informados internamente, lo que resulta atractivo si su infraestructura de llamadas ya se encuentra allí.

Construyéndolo usted mismo: Agentes Pipecat y LiveKit

Ambos son de código abierto y ambos son realmente viables en producción.

Pipecat, originado por Daily, modela un agente de voz como una tubería de procesadores a través de los cuales fluyen el audio y el texto, con una biblioteca de complementos muy grande y un desarrollo casi diario. Pipecat Cloud alcanzó disponibilidad general en 2026 después de una versión beta con más de mil equipos, por lo que la ruta administrada existe si la deseas.

LiveKit Agentes está construido sobre el servidor de medios WebRTC de LiveKit, y su característica distintiva es el modelo de sala: el agente se une como participante junto con los usuarios, lo que hace que los escenarios de múltiples participantes sean nativos en lugar de agregados. Un equipo informó públicamente que había reconstruido un agente telefónico de Pipecat en agentes LiveKit cuando un cliente aumentó de 20 a 400 llamadas simultáneas.

El autohospedaje puede costar muy por debajo de $0,05/min en volumen. Está negociando tarifas de plataforma por infraestructura, guardia y trabajo de ajuste de latencia, lo cual es una buena operación a escala y una mala antes de encontrar el producto adecuado para el mercado.

Lo que realmente cuesta

El error de presupuestación más común en esta categoría es comparar una tarifa solo de plataforma con una tarifa combinada.

Plataforma Tasa de título lo que eso cubre Todo incluido realista
Vapi $0.05/min Solo orquestación ~$0,25–0,33/min una vez que se agregan STT, LLM, TTS y telefonía
Retell 0,055 $/minuto Infraestructura de voz Desde ~$0,07/min pago por uso
Bland $0,09–0,14/minuto Todo, empaquetado Aproximadamente la tasa principal
Synthflow $0.09/min motor de voz Más LLM y telefonía
ElevenLabs Agents $0,08–0,10/minuto Plataforma + voz Más tokens LLM pasados
OpenAI Realtime Basado en tokens el modelo solo Altamente variable; el almacenamiento en caché y la disciplina de contexto dominan
Autohospedado (Pipecat / LiveKit) Infraestructura Nada incluido Puede costar menos de $0,05/min en volumen, más tiempo de ingeniería

Puntos de referencia de los componentes para crear su propia estimación: telefonía alrededor de $0,014/min, transmisión de voz a texto alrededor de $0,008/min, TTS premium alrededor de $0,05/min y un LLM pequeño y rápido alrededor de $0,01/min. En todo el mercado, las tarifas completamente cargadas en 2026 abarcan aproximadamente un rango de seis veces, desde alrededor de $0,05/min en los planes de autoservicio más agresivos hasta alrededor de $0,31/min en los niveles empresariales premium.

Una nota estructural: el almacenamiento en caché de mensajes no es un error de redondeo en un agente de voz. Los mensajes de su sistema (personalidad, barreras de seguridad, reglas comerciales, conocimiento) son idénticos en cada llamada. La entrada almacenada en caché en modelos en tiempo real tiene un precio de una pequeña fracción de la entrada estándar. Activar el almacenamiento en caché cambia con frecuencia el costo del modelo en un orden de magnitud, y es lo primero que se debe verificar antes de que alguien proponga cambiar a un modelo peor para ahorrar dinero.

El cumplimiento no es opcional aquí

Los agentes telefónicos están expuestos a regulaciones que los agentes de navegador no tienen.

En los Estados Unidos, la FCC Sentencia declarativa de febrero de 2024 confirmó que las voces generadas por IA son una "voz artificial o pregrabada" según el TCPA. Esto incluye requisitos de consentimiento para llamadas a líneas inalámbricas y residenciales, obligaciones de identificación y divulgación, y manejo de exclusión voluntaria, con daños legales que van desde $500 por violación, hasta $1,500 por violaciones intencionales. Se espera que a finales de 2026 o principios de 2027 concluya una nueva reglamentación de la FCC sobre las llamadas generadas por IA, y el resultado ampliamente esperado es un requisito explícito de identificación de IA al inicio de la llamada más un lenguaje de consentimiento que nombra específicamente a la IA.

En la UE, el artículo 50 de la Ley de IA se aplica desde el 2 de agosto de 2026 y exige que se informe a las personas que están interactuando con IA. A nivel estatal en EE. UU., la Ley de IA de Colorado entrará en vigor en 2026 y puede clasificar gran parte de esta categoría como de alto riesgo.

La postura práctica es simple y no le cuesta nada: revelar en la línea inicial, mantener el registro de consentimiento, respetar las opciones de exclusión inmediatamente y hacer que la transferencia humana esté siempre disponible. Cada uno de estos es más barato de construir ahora que de modernizar.

Compárelo usted mismo

Dado que dos estudios creíbles invirtieron las mismas clasificaciones, los únicos números sobre los que debes actuar son los tuyos propios. Este protocolo dura un día.

  1. Construya un guión fijo. De veinte a treinta turnos que cubren su caso de uso real, incluido al menos un número largo, una corrección y una solicitud para un humano.
  2. Registre ambas piernas en un reloj. No utilice horarios informados por la plataforma; excluyen partes del camino que experimenta la persona que llama. Capture el audio de la llamada real.
  3. Medir el tiempo hasta el primer byte de audio desde el final del discurso de la persona que llama, utilizando un VAD en la grabación en lugar del flujo de eventos de cualquier proveedor.
  4. Estandarizar los puntos finales en cada plataforma que prueba, o está comparando la configuración en lugar de la arquitectura.
  5. Informe p50 y p95 por separado, más el ratio de cola y el conteo de vueltas que tuviste que descartar. Una plataforma que ocasionalmente no produce nada es peor que una plataforma que es uniformemente un poco más lenta.
  6. Ejecute las seis clases de interrupción. de la tabla anterior como casos de prueba separados y puntuar paradas falsas y paradas perdidas de forma independiente.
  7. Prueba bajo carga. Cada plataforma se ve bien en una sola llamada. La concurrencia es donde las medianas se degradan y las colas explotan.
  8. Prueba en una mala conexión y desde un teléfono móvil en un coche en marcha, no desde un escritorio con fibra.

La conclusión

Las plataformas en esta categoría están más juntas de lo que sugiere su marketing, y la brecha entre dos de ellas es menor que la brecha entre una implementación bien y mal sintonizada de cualquiera de ellas.

Tres cosas importan más que el proveedor que elijas. Detección de turnos, porque es la mayor porción recuperable de latencia y la diferencia entre un agente que se siente presente y uno que se siente como un árbol telefónico. Política de interrupción, porque determina si las personas que llaman confían en la cosa después del primer malentendido. Y latencia de cola, porque su p95 es lo que sus clientes realmente experimentan y es más o menos donde cuelgan.

Cada proveedor le mostrará una mediana. Pregunte por el p95, pregunte cómo se midió y luego mídalo usted mismo.

Tu primer asistente está a minutos de distancia.

Ponga a trabajar sus conocimientos empresariales.

Comience con una cuenta Cody gratuita. Agregue su contenido, cree un asistente y comparta la primera respuesta útil hoy.