Seu Hub de Inteligência Artificial

Seu Hub de IA

Banner Completo Noticias
Gemini 3.8 Live - imagem oficial

Gemini 3.8 Live Avatar é oficial e fala 97 idiomas com você

O Gemini 3.8 Live Avatar sai do preview e vira produto no Gemini Enterprise. Entenda os recursos, os clientes que já adotaram e o impacto no atendimento.

O Google Cloud anunciou que o Gemini 3.8 Live Avatar entrou em disponibilidade geral dentro do Gemini Enterprise. O recurso cria avatares em vídeo que conversam por voz, com sincronia labial, e já está liberado para clientes corporativos nos endpoints dos Estados Unidos e da União Europeia.

De preview fechado para o atendimento real

Segundo o post oficial do Google Cloud Blog, publicado em 24 de setembro de 2026, o recurso está pronto para produção, ou seja, para rodar em sistemas que atendem clientes de verdade, não apenas em testes controlados.

O movimento tem lógica. Por muito tempo, a corrida das assistentes de voz corporativas girou em torno de dois números: quanto custa e quão rápido responde. O Google afirma que a prioridade mudou para a qualidade de cada interação. Em outras palavras, não basta responder rápido: a conversa precisa parecer conversa.

Tecnicamente, o Gemini 3.8 Live Avatar combina duas coisas que costumavam viver separadas. De um lado, a fala nativa de voz para voz, sem aquela etapa intermediária de transcrever o áudio em texto para depois gerar a resposta. De outro, a geração de vídeo em tempo real, que move a boca do avatar em sincronia com o que está sendo dito. É como trocar uma ligação telefônica por uma chamada de vídeo, com a diferença de que do outro lado está um sistema.

  • Fala e entende 97 idiomas, com detecção e troca automática de língua durante a conversa.
  • Recuperação natural de interrupções: se o usuário cortar a fala do avatar, o contexto e as transações em andamento não se perdem.
  • Chamadas de ferramentas em segundo plano, o que permite consultar uma API, um CRM ou um ERP enquanto o diálogo continua.
  • Compreensão visual ao vivo, processando câmera e compartilhamento de tela junto com o áudio, ao mesmo tempo.

Quem já usa o Gemini 3.8 Live Avatar e o que isso significa para o mercado

O Google citou nomes concretos. A Cox Automotive construiu um assistente de compras para o Autotrader que destaca elementos na tela ao vivo enquanto orienta o cliente em busca, comparação e financiamento de veículos. A Equal AI diz atender mais de um milhão de chamadas ao vivo por dia em nove idiomas indianos. A Salesforce integrou o recurso ao Agentforce, sua plataforma de agentes. Já a Specs destacou melhorias na detecção de atividade de voz e na latência. Nesse sentido, o anúncio não é só demonstração técnica: é uma lista de casos em escala.

Há também o lado da confiança. Avatares customizados só saem via allowlist, uma lista de permissão com verificação para clientes enterprise selecionados. Todos os demais usam uma biblioteca de avatares prontos. Além disso, todo áudio e vídeo gerado carrega a marca d’água imperceptível SynthID, do Google DeepMind, criada para identificar conteúdo produzido por IA.

Para o profissional brasileiro, o acesso não é imediato nem trivial. O Gemini 3.8 Live Avatar é vendido por provisioned throughput, um modelo de capacidade reservada em que a empresa contrata uma fatia de processamento garantida e negocia direto com o time de vendas do Google Cloud. Não existe tabela pública de preços para esse recurso específico, apesar de haver uma página de preços da plataforma. Portanto, quem quiser testar precisa falar com um representante comercial.

Ainda assim, o efeito prático chega antes do contrato. Se plataformas como o Agentforce passam a embutir esse tipo de agente, empresas brasileiras que já usam essas ferramentas herdam o recurso sem montar nada do zero. Por outro lado, vale separar as coisas: o Gemini 3.8 Live Extended Thinking, recurso parente anunciado na mesma leva, continua em preview privado e não está disponível. Confundir os dois é fácil, e a diferença é justamente o que está no ar hoje.

A implantação prevista cobre web, aplicativos mobile e quiosques físicos interativos. Em outras palavras, o mesmo agente pode aparecer no site, no app e naquele totem de autoatendimento do shopping ou do aeroporto.

Perguntas frequentes

O que é o Gemini 3.8 Live Avatar e como ele funciona?

É um modelo conversacional do Google Cloud que gera vídeo em tempo real junto com a fala, criando um avatar que sincroniza os lábios e dialoga naturalmente. Nesse sentido, o Gemini 3.8 Live Avatar entende 97 idiomas, detecta a língua automaticamente. Lida com interrupções sem perder o fio da conversa e ainda processa imagens da câmera ou da tela compartilhada enquanto conversa.

Qualquer empresa pode criar um avatar personalizado?

Não. A criação de avatares customizados passa por um processo de allowlist, uma lista restrita com verificação para clientes enterprise selecionados. Todos os demais clientes do Gemini Enterprise têm acesso a uma biblioteca de avatares pré-construídos. Além disso, qualquer áudio ou vídeo gerado sai com a marca d’água invisível SynthID, para identificar que aquele conteúdo foi produzido por inteligência artificial.

Fonte: Google Cloud Blog

Análise Crítica

O Google está fazendo aqui um movimento clássico de plataforma: em vez de disputar atenção com uma demo viral de consumidor, empacota voz, vídeo e chamada de ferramentas dentro do Gemini Enterprise e vende capacidade reservada com contrato negociado. Isso não é acaso. Contrato de provisioned throughput amarra receita previsível e cria dependência de infraestrutura, algo muito mais difícil de cancelar do que uma assinatura por token. Quem sente o golpe primeiro são as camadas intermediárias de voz, como as plataformas que montam pipeline de transcrição, modelo de texto e síntese de fala em sequência: se a fala nativa de voz para voz já resolve interrupção e latência, essa costura vira custo sem diferencial.

A OpenAI também perde terreno no flanco corporativo, porque o Google entrega compliance regional com endpoints nos Estados Unidos e União Europeia, e isso pesa mais em comitê de compras do que benchmark. Para uma startup brasileira de SaaS que vende atendimento, a decisão prática é dolorosa: continuar mantendo stack próprio de voz ou virar revenda de um recurso que o Salesforce já embutiu no Agentforce. Manter tem custo de engenharia crescente; adotar entrega margem e roadmap para o fornecedor. O padrão que se repete é conhecido: liberar avatar pronto para todos, prender o customizado atrás de allowlist e transformar escassez em qualificação comercial.

A pergunta incômoda: quanto custa, de verdade, um milhão de chamadas diárias nesse modelo?

A visão do canal Invente com IA

Olha, o alerta aqui é sobre dependência. Se você vende ou opera atendimento com voz e montou sua solução juntando transcrição, modelo de texto e síntese de fala em três serviços diferentes, esse anúncio mexe direto com o seu custo. Um concorrente que adota fala nativa de voz para voz corta latência e resolve interrupção sem gambiarra, e o cliente percebe isso na primeira ligação. Não precisa migrar amanhã, mas vale medir agora quanto da sua margem tá indo pra manter isso de pé.

Compartilhe este artigo

Foto de Mariana Machado de Almeida

Mariana Machado de Almeida

Compartilhe:
0 0 votos
Classificação do artigo
Inscrever-se
Notificar de
0 Comentários
mais antigos
mais recentes Mais votado

Entre para o Grupo VIP

Esteja um passo à frente. Receba o resumo diário de IA antes de todo mundo.

TV INVENTE

Banner Laterial Noticias

Bem-vindo ao Invente com IA

ou

Ao se cadastrar, você concorda com os [Termos de Serviço] e a [Política de Privacidade].