Em 15 de setembro, o Google Gemini teria gerado quatro parágrafos de falas inventadas ao receber um link de um Reel do Instagram com um atleta famoso. Depois de ser questionado, o assistente disse que não conseguia abrir, processar ou ouvir diretamente aquele tipo de link — mas a admissão veio depois da resposta apresentada como transcrição.
Gemini entregou uma transcrição inventada de um Reel do Instagram
O texto gerado não correspondia às falas do atleta, segundo a descrição do caso. Além dos quatro parágrafos, a resposta incluía uma seção formatada, o que dava ao conteúdo uma aparência de transcrição pronta para uso.
O problema não foi apenas errar uma palavra ou perder um trecho. O Gemini produziu falas completas para um vídeo que, depois, disse não conseguir acessar diretamente. Para quem precisa citar uma entrevista ou publicar declarações, essa diferença é enorme: uma resposta bem formatada não prova que o sistema ouviu o áudio.
A admissão veio depois da resposta falsa
Quando foi confrontado, o Gemini reconheceu que o texto anterior era um “placeholder genérico”, e não o conteúdo real do vídeo. O assistente também afirmou que não podia gerar uma transcrição literal daquele Reel a partir do link externo.
Na mesma resposta, o Gemini sugeriu que o usuário fornecesse as legendas automáticas ou uma transcrição preliminar. A partir desse material, o sistema poderia limpar palavras de preenchimento e organizar o texto em seções.
Link externo e arquivo enviado são caminhos diferentes
O Gemini pode gerar texto a partir de um vídeo enviado como arquivo em um fluxo diferente. Um tutorial mostra o usuário fazendo upload de um vídeo local, pedindo a transcrição e recebendo um resultado com marcações de tempo.
Esse fluxo envolve um arquivo fornecido diretamente ao serviço. Um link externo do Instagram é outra forma de entrada e não deve ser tratado automaticamente como se o vídeo tivesse sido carregado e processado pelo Gemini.
O que o Google documenta sobre transcrição
O Google descreve o Gemini 3.5 Transcribe com dois caminhos próprios: a Live API, voltada para transcrição em tempo real, e a Interactions API, destinada ao processamento de áudio pré-gravado. A documentação também menciona identificação de falantes e marcações de tempo por palavra.
Esses recursos mostram que o ecossistema Gemini inclui ferramentas de transcrição para fluxos específicos. Eles não transformam qualquer URL de Reel em um arquivo de áudio ou vídeo processado pelo assistente de conversação.
O que fornecer quando o vídeo está fora do alcance do Gemini
Para organizar o conteúdo de um Reel, o material indicado pelo próprio Gemini é uma legenda automática ou uma transcrição preliminar. Com esse texto em mãos, o assistente pode reestruturar as falas e remover repetições, em vez de preencher o conteúdo ausente com frases plausíveis.
A diferença é simples, mas decisiva: transcrever um arquivo recebido não é o mesmo que afirmar o conteúdo de um vídeo externo a que o sistema não teve acesso.