Glosario
Voice Agent (agente IA por voz)
Un voice agent es un agente IA que atiende llamadas telefónicas conversando en tiempo real. Combina speech-to-text, modelo de lenguaje y text-to-speech para sostener una conversación natural por voz.
Un voice agent (también voice AI o conversational voice agent) es un sistema que contesta el teléfono, escucha al cliente, entiende la consulta, responde con voz sintetizada y ejecuta acciones. Es la evolución natural de los IVR de los 2000s, donde el cliente tenía que apretar números para navegar opciones rígidas.
Esta es la definición corta. Si buscas la explicación extendida, con la arquitectura por dentro y cuándo aplica en una PYME, lee qué es Voice AI y cómo funciona un agente de voz con IA.
La pila técnica
Un voice agent moderno combina cuatro componentes en tiempo real:
- Speech-to-Text (STT): convierte la voz del cliente a texto. Modelos como Whisper, Deepgram, Google STT.
- LLM con tools: procesa el texto, decide la respuesta y/o ejecuta acciones. Mismo motor que un chatbot LLM, pero con latencia más exigente.
- Text-to-Speech (TTS): convierte la respuesta a voz natural. ElevenLabs, OpenAI TTS, Azure Neural Voices.
- Telefonía: Twilio, Vonage, Telnyx o telefonía propia. Maneja entrante/saliente, transferencias, grabación si aplica.
Casos de uso típicos
- Atención de primer contacto en clínicas, talleres, restaurantes
- Confirmación de citas con re-agendamiento si el cliente no puede
- Calificación inicial de leads (preguntar nombre, motivo, urgencia)
- Soporte nivel 1 con escalación al humano si el caso es complejo
- Recordatorios de pago con opción de pagar en la llamada
- Encuestas de satisfacción post-servicio
Lo bueno y lo que cuesta
Bien hecho, un voice agent atiende a las 11 PM cuando nadie del equipo puede, no se cansa, no varía el tono, no se olvida de preguntar lo importante. Mal hecho, suena robótico, interrumpe al cliente, no entiende acentos regionales y deja peor sensación que no contestar.
Lo que no cubre
- Latencia: la conversación natural requiere respuesta en < 1 segundo. Cada componente (STT, LLM, TTS) suma latencia. Hay límite físico.
- Acentos y ruido: STT degrada con audio sucio. Ambientes ruidosos, voz baja o acentos muy regionales bajan la precisión.
- Interrupciones: el voice agent debe saber cuándo callarse si el cliente lo interrumpe. Mal manejado, se siente como un robot enojado.
- Costo por minuto: llamadas + STT + LLM + TTS suma. Tiene que justificarse contra el costo del humano.
- Casos sensibles: quejas serias, emergencias médicas, cobranza compleja. Mejor escalar rápido al humano.
- Marco regulatorio: algunas jurisdicciones exigen avisar al cliente que está hablando con IA.
Cuándo no usar voice agent
- Negocio con < 50 llamadas mensuales (el setup no rinde)
- Casos donde el toque humano es parte del valor (servicios premium personales)
- Productos donde la complejidad de la consulta es alta y previsible (no es atención de primer contacto)
En Kharyo, el módulo Voice opera agentes por voz con la misma base de conocimiento (Cortex) que usan los agentes de WhatsApp e Instagram. La consistencia cross-canal es nativa: lo que el cliente preguntó por teléfono queda en el mismo historial que sus mensajes de chat.






