Gorila Press

Inteligência Artificial: notícias, análises e o futuro da tecnologia

Google 7 de Julho de 2026

Google apresenta Gemini 3.1 Flash TTS com tags de áudio para fala expressiva

Google apresenta Gemini 3.1 Flash TTS com tags de áudio para fala expressiva

A Google anunciou recentemente o Gemini 3.1 Flash TTS, um novo modelo de inteligência artificial focado em síntese de fala. A grande novidade é a introdução de 'tags de áudio granulares', que permitem um controle fino sobre a expressividade da voz gerada.

Ao contrário de modelos anteriores que geravam fala baseada apenas em texto, o Gemini 3.1 Flash TTS aceita marcadores específicos que indicam emoção, ritmo, tom e outros nuances. Por exemplo, o usuário pode inserir uma tag para 'entusiasmo' ou 'tristeza', e a IA ajusta a saída de acordo.

Isso representa um avanço significativo na flexibilidade da síntese de voz. Em vez de obter uma fala robótica ou genérica, o desenvolvedor pode adaptar a voz para diferentes contextos — desde uma narração calma até um assistente virtual enérgico.

As possibilidades são amplas: assistentes pessoais mais empáticos, audiolivros com variação emocional, sistemas de atendimento ao cliente que transmitem empatia, entre outros. A Google já aplicou tecnologia similar em produtos como o Google Assistant, mas agora com um modelo dedicado e mais refinado.

Modelos TTS tradicionais, como o WaveNet, já ofereciam vozes naturais, mas sem controle granular. O Gemini 3.1 Flash TTS vai além, permitindo que o criador do conteúdo dirija a performance emocional.

No entanto, essa capacidade levanta questões importantes. Até que ponto queremos que máquinas imitem emoções humanas? E será que esse controle granular pode ser usado para manipular usuários, tornando a voz artificial mais persuasiva? São perguntas que merecem debate à medida que a tecnologia avança.

O modelo é baseado na arquitetura Gemini, já conhecida por sua eficiência. O 'Flash' no nome indica otimização para velocidade, tornando-o adequado para aplicações em tempo real.

A Google ainda não divulgou uma data de lançamento ampla, mas já está disponível para desenvolvedores através de APIs específicas. A expectativa é que recursos semelhantes cheguem a produtos comerciais em breve.

Essa movimentação da Google faz parte de uma corrida das big techs por vozes sintéticas mais humanas. OpenAI, Microsoft e ElevenLabs também têm investido pesado em TTS expressivo.

O Gemini 3.1 Flash TTS representa um passo importante na evolução da fala por IA. Com o controle granular, a linha entre voz humana e sintética se torna ainda mais tênue. Cabe a nós, como sociedade, definir os limites éticos desse uso.


Produtos recomendados: Fone Bluetooth JBL Tune | Notebook Gamer Acer Nitro 5

Google Gemini 3.1 Flash TTS IA de fala síntese de voz tags de áudio expressividade

Ofertas Recomendadas