Em 15 de setembro, o Google Gemini teria gerado quatro parágrafos de falas inventadas ao receber um link de um Reel do Instagram com um atleta famoso. Depois de ser questionado, o assistente disse que não conseguia abrir, processar ou ouvir diretamente aquele tipo de link — mas a admissão veio depois da resposta apresentada como transcrição.

Gemini entregou uma transcrição inventada de um Reel do Instagram

O texto gerado não correspondia às falas do atleta, segundo a descrição do caso. Além dos quatro parágrafos, a resposta incluía uma seção formatada, o que dava ao conteúdo uma aparência de transcrição pronta para uso.

O problema não foi apenas errar uma palavra ou perder um trecho. O Gemini produziu falas completas para um vídeo que, depois, disse não conseguir acessar diretamente. Para quem precisa citar uma entrevista ou publicar declarações, essa diferença é enorme: uma resposta bem formatada não prova que o sistema ouviu o áudio.

A admissão veio depois da resposta falsa

Quando foi confrontado, o Gemini reconheceu que o texto anterior era um “placeholder genérico”, e não o conteúdo real do vídeo. O assistente também afirmou que não podia gerar uma transcrição literal daquele Reel a partir do link externo.

Na mesma resposta, o Gemini sugeriu que o usuário fornecesse as legendas automáticas ou uma transcrição preliminar. A partir desse material, o sistema poderia limpar palavras de preenchimento e organizar o texto em seções.

Vídeo tutorial: Gemini recebe um arquivo local e gera uma transcrição com marcações de tempo

O Gemini pode gerar texto a partir de um vídeo enviado como arquivo em um fluxo diferente. Um tutorial mostra o usuário fazendo upload de um vídeo local, pedindo a transcrição e recebendo um resultado com marcações de tempo.

Esse fluxo envolve um arquivo fornecido diretamente ao serviço. Um link externo do Instagram é outra forma de entrada e não deve ser tratado automaticamente como se o vídeo tivesse sido carregado e processado pelo Gemini.

O que o Google documenta sobre transcrição

O Google descreve o Gemini 3.5 Transcribe com dois caminhos próprios: a Live API, voltada para transcrição em tempo real, e a Interactions API, destinada ao processamento de áudio pré-gravado. A documentação também menciona identificação de falantes e marcações de tempo por palavra.

Esses recursos mostram que o ecossistema Gemini inclui ferramentas de transcrição para fluxos específicos. Eles não transformam qualquer URL de Reel em um arquivo de áudio ou vídeo processado pelo assistente de conversação.

O que fornecer quando o vídeo está fora do alcance do Gemini

Para organizar o conteúdo de um Reel, o material indicado pelo próprio Gemini é uma legenda automática ou uma transcrição preliminar. Com esse texto em mãos, o assistente pode reestruturar as falas e remover repetições, em vez de preencher o conteúdo ausente com frases plausíveis.

A diferença é simples, mas decisiva: transcrever um arquivo recebido não é o mesmo que afirmar o conteúdo de um vídeo externo a que o sistema não teve acesso.