Una llamada de voz es lo más exigente que hace una IA de compañía. El texto puede tardar unos segundos sin que a nadie le importe. El habla no: la gente nota retrasos que serían invisibles en una ventana de chat.
El problema de los 200 milisegundos
Investigadores que compararon conversaciones en diez idiomas comprobaron que la pausa típica entre que una persona termina y la otra empieza ronda los 200 milisegundos, y es notablemente parecida entre culturas. La gente empieza a preparar su respuesta antes de que el otro termine. Las pausas mucho más largas se leen como duda, confusión o desinterés.
Una IA tiene que meter toda una cadena de procesos en esa ventana para que suene natural.
Qué pasa entre tus palabras y las suyas

La cadena clásica. Los sistemas más nuevos solapan o fusionan estas fases.
- Detección del final de la frase. El sistema tiene que decidir que has terminado, no que solo has hecho una pausa. Si es demasiado impaciente te interrumpe; si es demasiado cauto añade silencio muerto.
- Voz a texto. Se transcriben tus palabras.
- La respuesta. El modelo de lenguaje escribe una respuesta, en personaje, con memoria.
- Texto a voz. La respuesta se convierte en voz, idealmente la propia del personaje y con emoción.
En los sistemas más antiguos, cada paso espera a que termine el anterior. Los más nuevos empiezan a decir la primera frase mientras se escribe el resto, o usan modelos que reciben voz y producen voz directamente, lo que elimina por completo los pasos de transcripción y de síntesis.
Por qué la voz se mide
| Chat de texto | Mensaje de voz | Llamada de voz en directo | |
|---|---|---|---|
| Velocidad necesaria | Bastan segundos | Bastan segundos | Fracciones de segundo |
| Procesamiento extra | Ninguno | Síntesis de voz | Reconocimiento, síntesis, detección de turnos |
| Duración típica | Respuestas cortas | Una respuesta | De minutos a horas |
| Coste relativo | El más bajo | Moderado | El más alto |
| Cómo lo venden las apps | Incluido | Incluido o con créditos | Minutos, niveles o créditos |
Cada minuto de llamada ejecuta toda la cadena de forma continua, a menudo con versiones «en tiempo real» más caras de cada modelo. Por eso la voz suele ser lo primero que una app limita, y por eso «ilimitado» rara vez se aplica a ella; mira cómo leer las listas de funciones de las apps de novia IA.
Qué hace que una llamada parezca real
- Latencia baja, y constante. Una pausa larga ocasional rompe la ilusión más que una media algo más lenta.
- Gestión de interrupciones. Poder cortarla, y que ella pare y responda, es lo que separa una conversación de notas de voz alternas.
- Coherencia de la voz. La misma voz, acento y calidez de una llamada a otra. Mis pruebas mostraron que la calidad de la voz puede variar notablemente entre personajes incluso en buenas apps.
- Prosodia. Reír, hacer pausas, suavizar: un habla que transmite emoción en lugar de leer un texto en voz alta.
- Memoria en modo voz. Algunas apps usan un modelo más ligero para las llamadas, así que el personaje recuerda menos por teléfono que en el chat.
Probar una función de voz antes de pagar
- Pregunta qué incluye: mensajes de voz, llamadas en directo o ambos, y cuántos minutos.
- Haz una llamada de dos minutos en una prueba o en el plan más barato, con datos móviles además de wifi.
- Interrúmpela a mitad de frase. ¿Se calla?
- Pregúntale por algo de tu chat de texto. ¿Lo sabe?
- Mira el coste por minuto extra o por crédito. Una llamada larga puede gastar la asignación de un mes.
La idea general sobre los costes del multimedia está en cómo funcionan las imágenes y la voz de una novia IA, y si merece la pena mejorar de plan por la voz se trata en los planes premium.
Una nota sobre el bienestar
La voz es más inmersiva que el texto, y la investigación de OpenAI y el MIT de 2025 encontró que el uso breve de voz iba con mejor bienestar, mientras que el uso diario intenso no. Conviene disfrutarla a dosis; las señales de pasarse están en cuando una IA de compañía empieza a quitarte más de lo que te da.