Los agentes de voz presentan un problema de latencia que se vuelve evidente cuando deben ejecutar tareas complejas. En apenas cinco días, Google y OpenAI han presentado dos soluciones muy diferentes para enfrentarlo.
El martes pasado, Google puso en marcha Gemini 3.8 Live y Gemini 3.8 Live Extended Thinking a través de la API Gemini y Google AI Studio, apenas cinco días después del lanzamiento de GPT-Live-1 por parte de OpenAI. Ambos sistemas permiten que un agente de voz mantenga la conversación mientras realiza procesos en segundo plano, pero lo hacen siguiendo arquitecturas completamente distintas.
Por un lado, Gemini 3.8 Live Extended Thinking mantiene todo el razonamiento dentro del modelo de voz, de modo que el asistente sigue hablando mientras ejecuta llamadas a herramientas de manera asíncrona. Por otro lado, OpenAI separa estas funciones: utiliza GPT-Live-1 para gestionar la conversación en tiempo real, mientras que un modelo de backend se encarga de tareas complejas y la ejecución de herramientas. Esto implica que OpenAI traslada gran parte de la coordinación a la capa de aplicación.
Desde Google advierten que no es fácil comparar directamente Gemini con productos como ChatGPT o Claude Voice, puesto que estos últimos son productos completos, mientras que Gemini 3.8 se posiciona más como una herramienta para desarrolladores y empresas.
Razonamiento integrado en una única sesión
La versión Extended Thinking de Gemini 3.8 permite mantener la conversación, el razonamiento y la ejecución de funciones de manera simultánea dentro de una misma sesión con estado, incluso cuando hay llamadas externas en curso.
Cuando una función está marcada como NON_BLOCKING, Gemini puede seguir hablando mientras espera la respuesta de la herramienta, realizando preguntas adicionales o proporcionando actualizaciones. Al recibir el resultado, retoma la conversación en el punto adecuado.
Los desarrolladores pueden ajustar el nivel de esfuerzo en el razonamiento —bajo, medio o alto— para cada solicitud. La versión estándar de Gemini 3.8 Live omite el paso de razonamiento extendido para reducir la latencia y el coste de tokens.
El mismo motor subyace en la aplicación Gemini para consumidores, que Google considera su oferta más comparable a ChatGPT y Claude, a diferencia de los modelos dedicados a desarrolladores.
Además, la multimodalidad se extiende a los nuevos modelos de audio. Según Google, «la comprensión visual es excelente», lo que permite a los usuarios dialogar con el modelo sobre cualquier contenido visual que se le muestre.
Coordinación en dos capas separadas
En contraste, GPT-Live-1 de OpenAI maneja la conversación dúplex completa, mientras que un modelo de backend —como GPT-6 Astra, un modelo ligero como Luna o incluso opciones de terceros— se encarga de la lógica y la ejecución de herramientas de forma independiente.
Esta separación permite que la capa de voz permanezca altamente receptiva, con una latencia estimada en la toma de turnos de alrededor de 800 milisegundos, según OpenAI.
Sin embargo, este diseño implica que los desarrolladores deben gestionar la coordinación entre las capas, transmitiendo contexto entre el modelo de voz y el razonador mediante canales secundarios, y determinando qué acciones realizar mientras se ejecutan procesos en segundo plano. Esta responsabilidad recae en la capa de aplicación.
Trabajo en segundo plano obsoleto ante interrupciones
Ambos enfoques afrontan una dificultad común: cuando el usuario interrumpe o cambia de opinión a mitad de una petición, el trabajo en segundo plano puede continuar sin ser necesario.
En Gemini, este proceso permanece dentro de la misma sesión, aunque los desarrolladores tienen una visibilidad limitada sobre cuándo se detienen las llamadas a las herramientas. OpenAI, por su parte, deja más carga en los desarrolladores para cancelar trabajos pendientes y evitar que respuestas obsoletas afecten la conversación.
Google asegura que Gemini supera a sus competidores en condiciones reales, donde el ruido ambiental, los acentos marcados y las interrupciones inesperadas son comunes.
Diferencias significativas en costes por minuto
El coste estándar de Gemini 3.8 Live es de 0,005 dólares por minuto de audio de entrada y 0,018 dólares por minuto de salida, según las tarifas de la API Gemini Live. El modo Extended Thinking añade cargos por los tokens usados en razonamiento y ofrece costes adicionales por entradas como vídeo en directo o documentos.
En cambio, GPT-Live-1 tiene un coste de 0,05 dólares por minuto de voz solo para la capa frontal, con un gasto separado por el modelo de backend, llamadas a funciones y ejecución de agentes externos. Como ocurre con las configuraciones de razonamiento ajustable de GPT-6 Astra, los desarrolladores pueden controlar estos costes, pero un agente de voz que utilice un modelo de razonamiento potente frecuentemente verá aumentar rápidamente su factura.
OpenAI también incorpora la marca de agua SynthID de DeepMind en el audio generado.
Resultados de benchmarks con matices
Gemini 3.8 Live Extended Thinking alcanzó una puntuación de 82,6 en el Índice de Calidad Habla a Habla de Artificial Analysis, con tasas de finalización de tareas del 68,6% en el benchmark τ-Voice y del 35,1% en τ-Voice-banking de Sierra.
Google destaca que Extended Thinking mantiene el primer puesto en el Índice de Calidad Habla a Habla y lidera en benchmarks de tareas complejas.
Por su lado, GPT-Live-1, combinado con GPT-6 Astra a un nivel medio de razonamiento, obtuvo un 86,2% de Pass@1 en la evaluación Tau3 de atención al cliente por voz, que abarca sectores como aerolíneas, comercio minorista y telecomunicaciones. En la prueba Full Duplex Bench, superó a GPT-Realtime-2.1 por un margen de 30 puntos porcentuales.
Pruebas y tecnologías distintas, comparaciones limitadas
No obstante, estos resultados no reflejan una comparación directa. Google y OpenAI emplearon pruebas y configuraciones diferentes, y Google subraya que algunas comparaciones enfrentan modelos de desarrollo contra productos terminados para consumidores.
Claude Voice, de Anthropic, no forma parte de este análisis de desarrolladores. Aunque Anthropic ofrece voz en sus aplicaciones para consumidores, aún no dispone de una API de habla a habla en tiempo real comparable a Gemini Live o GPT-Live-1. Los desarrolladores interesados en construir agentes de voz con Claude deben integrar ellos mismos más partes de la pila tecnológica.
En resumen, Google mantiene un enfoque integrado que incluye habla, razonamiento y ejecución de herramientas en una sola sesión, lo que reduce la necesidad de middleware pero vincula a los desarrolladores más directamente a su entorno de ejecución. OpenAI, en cambio, opta por una arquitectura que exige mayor orquestación pero ofrece a los desarrolladores un control más granular sobre los modelos y herramientas que operan detrás de la capa de voz.