Google revoluciona la síntesis de voz con Gemini 3.8: personalización y autogestión para desarrolladores

Google lanza Gemini 3.8 Flash TTS, una API de texto a voz que permite a los desarrolladores crear voces personalizadas a partir de descripciones o grabaciones propias, ofreciendo mayor libertad y simplicidad frente a los servicios actuales, incluido OpenAI.

Google ha presentado hoy Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS, dos servicios de síntesis de voz accesibles a través de la API Gemini y Google AI Studio. Históricamente, las APIs de texto a voz limitaban a los desarrolladores a utilizar únicamente las voces preexistentes. Con esta nueva versión, Google cambia las reglas del juego al permitir la creación de voces personalizadas basadas en una descripción textual o una breve grabación.

Este avance significa que los usuarios pueden diseñar o replicar una voz inédita y guardarla para usarla repetidamente en diferentes partes de una aplicación, sin necesidad de añadir cada vez la grabación original o la descripción inicial. Google administra el perfil vocal, simplificando el proceso y ofreciendo mayor eficiencia.

De grabaciones a IDs de voz

El procedimiento de replicación se ejecuta mediante un nuevo endpoint denominado Voices (POST /v1beta/voices), que requiere un par de grabaciones limpias entre 10 y 30 segundos realizadas por el mismo hablante, además de un clip adicional donde este otorga su consentimiento explícito para que Google cree una versión sintética de su voz. Tras verificar la identidad y el consentimiento, Google genera un ID de voz que se almacena durante un año dentro del proyecto del desarrollador.

Patrocinado

Un proyecto puede contener hasta 200 voces, que se pueden listar, recuperar o eliminar fácilmente mediante la API, igual que otros recursos almacenados. Para quienes prefieran no guardar permanentemente los perfiles vocales, existe la opción de no almacenarlos, generando una voicekey_ cifrada con una vigencia de siete días, ideal para tareas temporales.

Es relevante destacar que todo audio sintetizado con Gemini incluye una marca llamada SynthID, y las voces replicadas llevan credenciales C2PA que permiten rastrear su origen. Actualmente, este servicio no está disponible en Illinois, Texas, la Unión Europea, Reino Unido, Suiza o India.

Diseñar una voz desde cero

La función de diseño vocal permite crear voces personalizadas a partir de descripciones en lenguaje natural que definan el papel, acento y carácter, soportando más de 100 idiomas y dialectos. Según la documentación, Flash TTS es compatible con 130 lenguajes, mientras Flash-Lite con más de 100. En su biblioteca, Google ofrece más de 2.000 voces listas para producción.

Además, existen 30 voces prefabricadas y cientos más que pueden filtrarse en la API según idioma, acento, tono o caso de uso. Próximamente se añadirá una función para modificar timbre, tono, ritmo y acento mediante indicaciones textuales.

Google aconseja crear una voz personalizada una sola vez y reutilizar su ID para evitar el fenómeno conocido como «deriva vocal», que ocurre cuando se envían descripciones largas repetidamente. Después de crear la voz, solo se requiere en nuevas solicitudes una breve instrucción de estilo, si es necesario.

Gemini 3.8 interpreta estrictamente el texto de entrada como una transcripción literal, eliminando la posibilidad de incluir indicaciones dramatúrgicas dentro del texto. Cualquier instrucción prolongada, como hablar en susurros o con sarcasmo, debe indicarse en una anotación especial llamada speech_metadata. Sonidos momentáneos, como suspiros o toses, se colocan dentro de corchetes. En diálogos con dos interlocutores, reacciones del oyente como «|mhm|» generan interrupciones y solapamientos naturales sin necesidad de dividir el texto en múltiples turnos.

Límites en diálogos con dos voces

La generación nativa de conversaciones con dos interlocutores solo admite en una petición hasta dos voces preexistentes. Para diálogos entre voces diseñadas o replicadas, cada turno debe generarse por separado y combinarse posteriormente a partir del audio en PCM de 24 kHz.

Las peticiones estándar devuelven audio en formato WAV; las de streaming, en PCM crudo de 16 bits. También están disponibles codificaciones mu-law y A-law orientadas a aplicaciones telemáticas. Google afirma que Flash TTS preserva la calidad vocal durante horas, adecuado para audiolibros o podcasts.

Flash vs Flash-Lite: rendimiento y volumen

Ambos modelos comparten estructura API, facilitando cambiar entre ellos modificando un solo parámetro. Flash TTS está recomendado para producciones exigentes con diálogos complejos y pronunciaciones regionales, mientras Flash-Lite prioriza rapidez y bajo coste para grandes volúmenes, como lectura automática o sistemas de voz en cascada que separan texto y síntesis.

Para agentes conversacionales, Google recomienda hacer una llamada TTS por turno conforme llegan las respuestas del modelo de lenguaje, manteniendo la identidad vocal con los IDs almacenados.

Integración con frameworks de agentes de voz

La síntesis es solo una capa en sistemas reales de voz: es necesario transporte, reconocimiento de voz, detección de turno, manejo de interrupciones y estado de la sesión. Google señala que frameworks como Agora, LiveKit, Pipecat y Vercel AI Gateway ya implementan Gemini, permitiendo usar la síntesis sin reconstruir la infraestructura de audio.

Sin embargo, los desarrolladores deben asegurar que sus plataformas soportan IDs personalizados antes de comprometerse con voces replicadas. El acceso a la API Enterprise de Gemini estará disponible próximamente.

Diferencias con el enfoque de OpenAI

OpenAI también ofrece voces personalizadas, pero su acceso es más restringido. Sus clientes deben contactar con ventas, están limitados a 20 voces por organización y requieren grabaciones con consentimiento, con una duración máxima de 30 segundos. Los IDs generados pueden usarse en varias APIs de OpenAI.

No obstante, OpenAI carece del diseño vocal basado en indicaciones textuales de Google, que crea voces a partir de descripciones. Dispone de 13 voces integradas que se pueden ajustar en tono y velocidad, y exige informar que el audio es generado por IA.

En definitiva, Google otorga a los desarrolladores mayor flexibilidad para moldear la voz deseada incluso antes de que llegue la primera línea de texto.

Add a Comment

Deja una respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

Patrocinado