Michael Sherman afirmó que Google Gemini generó cuatro párrafos de citas inventadas cuando le pidió transcribir un Reel de Instagram protagonizado por un deportista famoso. Sherman ya había visto el vídeo y dijo que el texto no coincidía con lo que realmente había dicho. El episodio muestra el riesgo de tratar una respuesta convincente como una transcripción cuando el asistente no ha procesado el vídeo.

Gemini respondió primero con un texto que parecía una transcripción

El 15 de septiembre de 2026, Sherman dijo que probó Gemini con un enlace externo a un Reel de Instagram. El asistente devolvió cuatro párrafos completos de supuestas declaraciones, presentados como si fueran el contenido hablado del vídeo.

Según Sherman, las citas eran completamente inexactas. Además, la respuesta inicial no avisó de que Gemini no había accedido al Reel.

Después de que Sherman cuestionara el resultado, Gemini indicó que no podía abrir, procesar ni escuchar directamente enlaces externos de audio o vídeo procedentes de Instagram Reels. También describió el texto anterior como un marcador de posición genérico y señaló que podía trabajar con subtítulos automáticos o con una transcripción preliminar proporcionada por el usuario.

Un enlace de Instagram no equivale a un archivo de vídeo

Una demostración muestra cómo Gemini recibe un vídeo cargado como archivo local y genera una transcripción con marcas de tiempo.

La diferencia clave está en la entrada que recibe el sistema. Una demostración muestra un flujo en el que el usuario carga un vídeo almacenado localmente, solicita una transcripción y obtiene texto con marcas de tiempo:

Ese flujo parte de un archivo entregado al asistente. El caso relatado por Sherman parte de una URL externa de Instagram. Que Gemini pueda trabajar con un archivo cargado no convierte automáticamente cualquier enlace de vídeo en una fuente que el asistente haya escuchado.

Qué documenta Google sobre la transcripción

Google anunció Gemini 3.5 Transcribe el 26 de agosto de 2026 y describió dos vías específicas: la Live API para transcripción en tiempo real y la Interactions API para procesar audio pregrabado. La documentación también menciona atribución de hablantes y marcas de tiempo a nivel de palabra para el audio pregrabado.

Google afirma que Gemini 3.5 Transcribe admite más de 85 idiomas. Para hasta tres hablantes, presenta la atribución como precisa; con más de tres, la describe como experimental. Esas capacidades pertenecen a los flujos de transcripción documentados para el modelo y sus API, y no demuestran por sí solas que el asistente de consumo pueda escuchar un Reel a partir de su URL de Instagram.

Qué puede aportar el usuario si el enlace no se procesa

La respuesta de Gemini indicó que el usuario podía pegar los subtítulos automáticos del vídeo o una transcripción aproximada. A partir de ese texto, el asistente podía eliminar palabras de relleno y reorganizar el contenido en secciones preparadas para una historia.

Ese procedimiento cambia la tarea: Gemini puede editar y estructurar el material que recibe, pero el texto aportado por el usuario es el que contiene la transcripción de partida. En el caso de Sherman, el problema apareció cuando el sistema presentó como contenido del Reel unas citas que no correspondían con el vídeo.