Crear un agente de voz con inteligencia artificial ha sido tradicionalmente un proceso complejo y torpe. La mayoría de los asistentes de voz funcionan como una cadena de sistemas donde lo que dice el usuario se transcribe a texto para que un modelo determine la respuesta, y luego esa respuesta se convierte nuevamente en voz. Esto puede generar experiencias robóticas y poco naturales. Sin embargo, OpenAI ha dado un paso decisivo para simplificar esta arquitectura.
El miércoles, la compañía lanzó GPT-Live-1 en su API, una arquitectura completa de voz de doble vía nativa que impulsa el modo de voz de ChatGPT, ahora disponible para desarrolladores externos por primera vez. Con este sistema, en lugar de que los desarrolladores tengan que gestionar toda la cadena de procesos por separado, un solo modelo se encarga de la conversación mientras que el procesamiento más complejo se realiza en segundo plano.
Una conversación fluida y en tiempo real
GPT-Live-1 opera como la primera línea en el diálogo. Al ser un modelo de voz full dúplex, puede seguir una conversación en tiempo real incluso si alguien interrumpe a mitad de frase, sin que los desarrolladores tengan que coordinar múltiples sistemas aislados. Pero este modelo no realiza todo el trabajo en solitario.
Cuando una solicitud requiere mayor tiempo o procesamiento, GPT-Live-1 la delega a otro modelo que trabaja en paralelo en segundo plano, como el potente GPT-6 Astra, otro modelo más pequeño como Luna, o incluso tecnologías de terceros. Esta inteligente distribución evita las pausas incómodas habituales en asistentes de voz que deben esperar respuestas prolongadas. GPT-Live-1 puede mantener la interacción activa con respuestas temporales, confirmaciones o indicaciones mientras el backend produce la respuesta definitiva.
OpenAI asegura que GPT-Live-1 supera en rendimiento en 30 puntos porcentuales a GPT-Realtime-2.1 en la prueba Full Duplex Bench, y en colaboración con GPT-6 Astra lidera el prestigioso τ³-benchmark, lo que reafirma su avanzada capacidad para el diálogo natural y eficiente.
Delegación y control simplificados para desarrolladores
El sistema de delegación se implementa mediante una interfaz basada en eventos. Cada sesión de voz genera un identificador único (delegation_id), que envía contexto al sistema backend encargado del procesamiento más pesado y recibe los resultados a través de eventos específicos (session.commentary.append). El modelo vocal integra esas respuestas en la conversación en curso, evitando interrupciones abruptas o textos leídos en bloque.
Los desarrolladores mantienen visibilidad completa del contenido que el modelo escucha y produce, controlando cuándo el sistema toma la palabra, sin tener que construir y orquestar manualmente toda la conversación a partir de sistemas independientes. La documentación oficial de OpenAI ofrece una guía completa y ejemplos prácticos para implementar este flujo con el SDK de Codex.
Impacto real en clientes iniciales
Un caso destacable es el de EliseAI, una empresa de salud que probó la API y redujo su base de código en un 80%, eliminando hasta 23.000 líneas gracias a GPT-Live-1, según su cofundador y CTO Tony Stoyanov. Este ahorro ha permitido a su equipo concentrarse en mejorar directamente la experiencia del paciente, facilitando la reserva de citas y la navegación del sistema sanitario.
En el sector educativo, la plataforma Speak, dedicada al aprendizaje de idiomas, notó que GPT-Live-1 disminuyó en casi un 80% las interrupciones durante sus Lecciones de Tutoría en vivo. Esto es crucial para estudiantes que necesitan tiempo para pensar y hablar sin que la IA los corte, mejorando la fluidez y comodidad en el aprendizaje.
Yelp ya emplea GPT-Live-1 en productos como Yelp Host y Hatch. Su CTO, Alex Levy, señala que la IA gestiona un mayor volumen de llamadas con éxito, y los usuarios practican con frases más naturales y completas, lo que evidencia que la experiencia en la llamada telefónica resulta mucho más humana. Una demostración mostró cómo la IA mantuvo activa una reserva de restaurante incluso con ruido de fondo y cuando los interlocutores hablaban simultáneamente.
Costes y flexibilidad en la nueva voz IA
El precio por usar GPT-Live-1 es de 0,05 dólares por minuto, aproximadamente 3 dólares por hora, a lo que se suma el coste del modelo que se utilice para el procesamiento más profundo. Por ejemplo, si se delega una solicitud a GPT-6 Astra, ese gasto se añade al total. Cuanto más se recurra a modelos avanzados, mayor será el coste.
La competencia con empresas como Anthropic, Google y distintas firmas chinas ha mantenido presiones a la baja en los precios de las API, pero las tareas de razonamiento avanzado aún implican un coste a considerar.
El beneficio es la posibilidad de elegir cuidadosamente dónde invertir esos recursos. Por ejemplo, tareas sencillas como agendar una cita pueden ser gestionadas por modelos ligeros como Luna, mientras que preguntas que requieran razonamiento complejo o uso de herramientas pueden derivarse a Astra. OpenAI ya ha demostrado cómo estas configuraciones ajustables permiten equilibrar coste y calidad en las respuestas, y GPT-Live-1 traslada esta lógica al ámbito de la voz interactiva.
El balance entre control y simplicidad
Antes, el modelo de arquitectura en cascada permitía a los desarrolladores seleccionar diferentes proveedores para cada pieza del sistema de voz y modificarlas a voluntad. GPT-Live-1 centraliza una mayor parte de la conversación, confiando más en OpenAI para controlar el flujo y la gestión.
OpenAI apuesta a que los desarrolladores estarán dispuestos a ceder parte de ese control si esto significa que los agentes de voz finalmente puedan seguir el ritmo natural de las conversaciones humanas, proporcionando una experiencia mucho más fluida y natural.