Gemini texto a voz es la herramienta de voz con IA de Google que convierte un guion escrito en audio hablado. Desde el 23 de septiembre de 2026 también puede diseñar una voz nueva a partir de una descripción en palabras sencillas. Las herramientas de texto a voz de antes te daban una voz fija y plana. El nuevo modelo Gemini 3.8 Flash TTS, en cambio, acepta indicaciones como un actor. Susurra esta frase, haz una pausa aquí, suena emocionado allá.
Puedes probarlo en el navegador con Google AI Studio, y Google también lo está llevando a Google Vids para el público general. Eso lo vuelve una opción realista si trabajas en una oficina o tienes un pequeño negocio. Piensa en locuciones, un pódcast sencillo o una voz amable para atender clientes. Todo sin estudio de grabación.
Qué hace ahora Gemini texto a voz
Texto a voz (TTS, por sus siglas en inglés) significa que un programa lee un texto en voz alta. La versión de Gemini va más allá en tres cosas, según el anuncio oficial de Google:
- Puedes diseñar una voz. Describes el papel, el acento y la personalidad que buscas, y el modelo crea una voz a la medida.
- Puedes dirigir cada frase. Le indicas qué líneas susurrar, decir con prisa o acompañar con un suspiro.
- Puedes montar una conversación. Un mismo guion admite dos voces que se turnan con naturalidad, algo muy útil para pódcasts.
Google lanzó dos modelos, y los dos hacen el mismo trabajo básico:
| Modelo | Pensado para | Elígelo cuando |
|---|---|---|
| Gemini 3.8 Flash TTS | Trabajo creativo y voces de personajes | Te importa sobre todo un audio expresivo y bien dirigido |
| Gemini 3.8 Flash-Lite TTS | Mucho volumen a menor costo | Necesitas mucho audio cotidiano, doblaje o un agente de voz |
Si estás empezando, Flash TTS es el más fácil para aprender, porque es el que mejor sigue indicaciones detalladas. Después de hacer unos cuantos audios sabrás cuál te conviene.
Dónde puedes usarlo
No necesitas ser programador para escuchar lo que hace. Estos son los lugares que Google menciona a finales de septiembre de 2026:
- Google AI Studio. Un espacio de trabajo en el navegador donde diseñas voces y escribes un guion de dos voces, línea por línea.
- Google Vids. La herramienta de video de Google, que está llegando a todos los usuarios, para añadir locuciones a tus videos.
- API de Gemini. El camino para desarrolladores, si quieres poner voces de Gemini dentro de tu propia app o sitio web.
- Gemini Enterprise. Acceso por API para empresas, que según Google llegará pronto.
Así, alguien de marketing puede grabar una locución en Vids mientras un desarrollador del mismo equipo conecta la API a la app de la empresa. Empieza por la herramienta que se parezca a tu forma de trabajar.
Cómo crear tu primera voz personalizada
Un buen primer proyecto: la intro de 30 segundos para un pódcast o un video de capacitación. Los nombres de los menús de AI Studio pueden cambiar, así que quédate con la idea más que con los botones exactos.
- Abre Google AI Studio e inicia sesión con tu cuenta de Google. Busca la sección de voz o audio.
- Describe tu voz en una o dos frases. Por ejemplo: "Una narradora cálida y segura, de unos 40 años, con un ligero acento mexicano." Google dice que el diseño de voces funciona en más de 100 idiomas y dialectos.
- Pega tu guion. Escríbelo como habla la gente de verdad. Las frases cortas suenan más naturales que las largas.
- Genera el audio y escúchalo. La mayoría de los guiones suenan bien al primer intento, sin ninguna indicación extra.
- Añade indicaciones solo donde una frase no convenza. Que sean breves, como "tranquila y reconfortante".
- Guarda la voz para que cada episodio suene como la misma persona. Luego descarga el audio.
Si prefieres elegir en lugar de diseñar, también hay una biblioteca. Según Google, tiene más de 2,000 voces listas, incluidas voces regionales como el español de México y el francés de Quebec.
Cómo dirigir la interpretación
Esta es la parte que más se parece a trabajar con un actor de doblaje. La guía para desarrolladores de Google distingue dos tipos de indicaciones:
- Indicaciones para toda una línea. El ánimo, la velocidad y el tono que duran todo el turno, como "susurrando" o "hablando despacio".
- Momentos dentro de una línea. Sonidos cortos colocados justo donde ocurren. Escribes el nombre del sonido, como suspiro, risa o pausa corta, entre corchetes angulares en ese punto del guion.
Las mayúsculas ponen énfasis en una palabra, como en "Fue un día MUY largo". Las comas y los puntos suspensivos bajan el ritmo.
Hay un consejo de la guía que vale la pena copiar. No llenes cada línea de instrucciones largas, porque el texto de más puede hacer que la voz se desvíe. Construye el personaje una sola vez con el diseño de voz y luego mantén cortas las indicaciones de cada línea.
¿Te preguntas dónde encaja esto en tu trabajo? Las herramientas de voz son solo una parte de un cambio más grande: gente que usa asistentes de IA para quitarse de encima el trabajo repetitivo. Si quieres explorarlo con clases en vivo, un mentor y sin programar, mira cómo funciona AI Fluency.
Qué puedes crear con esta herramienta
Estos son los usos para los que Google creó los modelos. Elige uno que se parezca a una tarea que ya haces.
Pódcasts y versiones en audio de tu contenido. Convierte un artículo del blog o tu newsletter en una conversación entre dos presentadores. Google dice que el modelo mantiene las voces estables durante horas de audio, algo clave en episodios largos.
Doblaje y videos traducidos. Toma un video de capacitación y dóblalo a varios idiomas. Flash-Lite TTS es el modelo que Google recomienda para doblaje en gran volumen.
Agentes de voz. Un agente de voz es un asistente de IA que te responde hablando, como un bot que contesta el teléfono de tu negocio. Ojo con un detalle: el texto a voz es solo la voz. Otro modelo de IA escribe cada respuesta y Gemini la dice en voz alta. Montar un agente telefónico completo todavía requiere código o una plataforma para desarrolladores. Google menciona como socios a Agora, LiveKit, Pipecat y Vercel.
Videos explicativos y de capacitación. Añade una narración constante en Google Vids sin contratar a un locutor para cada pequeño cambio.
Clonar una voz: consentimiento y reglas de seguridad
Replicar una voz significa copiar la voz de una persona real. Google dice que basta una muestra de 30 segundos, pero hay reglas que conviene conocer antes de intentarlo.
- Hace falta consentimiento. La persona dueña de la voz tiene que grabar un consentimiento hablado que coincida con la muestra antes de crear la voz.
- Cada audio lleva marca de agua. Google añade SynthID, una marca de agua invisible, a todo el audio de sus modelos de audio de Gemini. Así el habla generada por IA se puede detectar.
- No está disponible en todas partes. La réplica de voz en AI Studio no se ofrece en Illinois, Texas, el Espacio Económico Europeo (EEE, que incluye España), el Reino Unido, Suiza ni la India.
La regla práctica es sencilla. Clona solo tu propia voz o una que tengas derecho claro a usar.
Para qué no está pensado
Gemini texto a voz lee tus palabras exactas. No es la herramienta adecuada para una conversación libre y en vivo. Para eso, Google dirige a los desarrolladores a otro producto, la Live API, que maneja audio de ida y vuelta en tiempo real.
Algunos límites más, según la guía para desarrolladores de Google:
- Una sola solicitud admite hasta dos voces usando las voces ya hechas.
- Los efectos de sonido, como aplausos, no funcionan bien. Quédate con sonidos humanos como risas, suspiros y respiraciones.
- Recibe texto y entrega audio. No edita una grabación que ya tengas.
Si buscas narración, pódcasts, doblaje o la voz de un asistente, te sirve. Si necesitas editar un audio existente, busca otra opción.
Sigue aprendiendo sobre IA en el trabajo
- Cómo hacer un prompt para ChatGPT: la misma habilidad de dar indicaciones claras, aplicada a la escritura.
- AI Fluency: un programa de 4 semanas para profesionales que quieren la IA trabajando dentro de su empleo real, sin programar.
