O Google anunciou em 15 de setembro de 2026 dois novos modelos de inteligência artificial voltados para conversas por voz: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking. A proposta é tornar o diálogo com a IA mais fluido, inteligente e capaz de lidar com tarefas complexas sem interromper a conversa.
O que o Gemini 3.8 Live traz de diferente
Até pouco tempo atrás, conversar com assistentes de voz significava esperar respostas genéricas e lidar com pausas constrangedoras enquanto o sistema processava informações. O Gemini 3.8 Live muda essa dinâmica de forma significativa. O modelo consegue processar o que a câmera do dispositivo está captando em tempo quase real, ou seja, ele literalmente enxerga o que você está vendo e pode comentar sobre isso durante a conversa.
Além disso, o sistema detecta automaticamente o idioma que você está falando e consegue alternar entre línguas no meio do diálogo. São 97 idiomas suportados. Imagine começar uma conversa em português, receber uma mensagem em inglês e perguntar sobre ela sem precisar configurar nada. O modelo entende a troca e responde no idioma adequado. Por isso, esse recurso é particularmente útil para quem trabalha com equipes internacionais ou consome conteúdo em várias línguas.
- Processamento visual em tempo quase real permite que o modelo reaja ao que a câmera captura durante a conversa
- Detecção automática de idioma funciona em 97 línguas, com troca natural no meio do diálogo
- Execução de ferramentas e chamadas de API em segundo plano, sem interromper a conversa com o usuário
- Segunda posição no ranking Speech Agent Arena, indicando alta preferência entre usuários testados
Extended Thinking: raciocínio e fala ao mesmo tempo
O Gemini 3.8 Live Extended Thinking é a versão para tarefas mais complexas. A principal diferença está na capacidade de raciocinar e falar simultaneamente. Modelos anteriores costumavam fazer uma pausa perceptível enquanto processavam perguntas difíceis, o que quebrava o ritmo natural de uma conversa. Esse novo modelo elimina esse problema.
Em vez de ficar em silêncio, o Extended Thinking usa pistas verbais naturais enquanto processa. Frases como “deixa eu verificar isso” aparecem de forma orgânica, mantendo o usuário engajado enquanto a tarefa acontece nos bastidores. O modelo alcançou a primeira posição geral no Speech to Speech Quality Index da Artificial Analysis, com nota 82,6. No benchmark τ-Voice, que avalia tarefas de agente por voz, pontuou 68,6%. Já no τ-Voice-banking, voltado para o setor bancário, marcou 35,1%.
Diante disso, a aplicação prática fica clara: um atendente virtual de banco poderia guiar um cliente por operações complexas sem aquelas pausas artificiais que denunciam que você está falando com uma máquina. O modelo também atingiu 97,7% no Big Bench Audio, um teste que avalia capacidade de raciocínio em tarefas de áudio.
Quem pode usar o Gemini 3.8 Live agora
O lançamento está acontecendo de forma gradual a partir de 15 de setembro de 2026. Para desenvolvedores, ambos os modelos já estão disponíveis via Gemini API e Google AI Studio. Empresas têm acesso antecipado em versão de prévia privada no Gemini Enterprise, com chegada prevista para o Gemini Enterprise for Customer Experience.
Usuários finais também não ficam de fora. O Gemini 3.8 Live chega ao Search Live, integrando a busca do Google com conversas por voz mais inteligentes. O Extended Thinking aparece no Gemini Live e em aplicativos do Workspace para assinantes dos planos Pro e Ultra. Clientes empresariais do Google Workspace também receberão acesso ao modelo mais avançado.
O Google também anunciou parcerias com plataformas de infraestrutura de voz como Agora, Fishjam, LangChain, LiveKit, Pipecat, Vercel e Vision Agents. Essas integrações facilitam o trabalho de desenvolvedores que querem criar interfaces de voz sem precisar gerenciar toda a complexidade de streaming de mídia em tempo real.
Um detalhe importante de segurança: todo áudio gerado pelos dois modelos recebe marca d’água SynthID. Essa tecnologia identifica que o conteúdo foi criado por inteligência artificial, ajudando a combater desinformação. A marca é imperceptível para o ouvido humano, mas detectável por sistemas de verificação.
Perguntas frequentes
O Gemini 3.8 Live funciona em português brasileiro?
Sim, o Gemini 3.8 Live suporta 97 idiomas com detecção automática, o que inclui o português. Além disso, o modelo consegue identificar qual língua você está usando e responder adequadamente, inclusive alternando entre idiomas durante a mesma conversa sem necessidade de configuração manual.
Qual a diferença entre o Gemini 3.8 Live e o Extended Thinking?
O Gemini 3.8 Live é otimizado para conversas rápidas e eficientes em termos de custo, com visão em tempo real e suporte multilíngue. O Extended Thinking é voltado para tarefas complexas que exigem raciocínio mais profundo, conseguindo pensar e falar ao mesmo tempo sem pausas artificiais. A escolha depende se você precisa de agilidade ou de capacidade analítica avançada.
Fonte: Google Blog
Análise Crítica
O Google está claramente tentando recuperar terreno no mercado de assistentes de voz inteligentes depois de ver OpenAI e Anthropic dominarem a narrativa com interfaces de chat. O movimento de lançar dois modelos simultâneos, um para escala e outro para complexidade, revela a estratégia de capturar tanto o desenvolvedor que precisa de custo baixo quanto a empresa que paga premium por qualidade. A menção explícita a benchmarks do setor bancário não é coincidência: é uma declaração de intenções para o mercado de contact centers, onde a Salesforce e a ServiceNow já posicionam suas soluções. O GPT-4o Voice da OpenAI perde vantagem competitiva direta com essa capacidade de raciocínio simultâneo à fala, algo que a concorrente ainda não demonstrou em escala.
Para um dono de e-commerce de pequeno porte que usa chatbot no atendimento, a decisão agora é pragmática: migrar para o Gemini 3.8 Live pode significar um atendente que finalmente consegue olhar a tela do cliente em tempo real e ajudar com problemas visuais, como configuração de produto ou conferência de pedido. O padrão histórico se repete: Google oferece acesso generoso via API para criar dependência antes de ajustar preços. A pergunta que o Google preferiria não responder: quanto tempo até o Gemini Live virar obrigatório no Workspace e o preço da assinatura subir junto?
A visão do canal Invente com IA
Se você usa qualquer tipo de atendimento automatizado no seu negócio, esse lançamento é pra prestar atenção agora. O Gemini 3.8 Live com visão em tempo real abre uma porta que não existia: o cliente pode apontar a câmera pro problema e o bot entende o que tá vendo. Pra quem vende produto físico ou dá suporte técnico, isso muda o jogo. Vale muito testar via Google AI Studio nas próximas semanas, porque o acesso pra desenvolvedor já tá disponível. Se o atendimento por voz do seu concorrente conseguir ver o produto do cliente e o seu não, você perde a venda ali na hora.




