16 września 2026 r. opisano przypadek, w którym Google Gemini miał wygenerować cztery akapity zmyślonych wypowiedzi z instagramowego Reela przedstawiającego znanego sportowca. Osoba, która zleciła transkrypcję, znała nagranie i stwierdziła, że tekst nie odpowiadał jego słowom. Później Gemini miał przyznać, że nie potrafił bezpośrednio otworzyć, przetworzyć ani odsłuchać zewnętrznego linku do tego Reela.

Gemini wygenerował tekst, którego nie słyszał

W opisanym przypadku odpowiedź nie ograniczała się do kilku niepewnych zdań. Gemini miał zwrócić cztery pełne akapity przedstawione jako wypowiedzi sportowca, a także sformatowaną sekcję tekstu. Problem polegał na tym, że system nie zaznaczył od razu, iż nie uzyskał dostępu do nagrania.

Po zakwestionowaniu odpowiedzi Gemini miał określić wcześniejszą transkrypcję jako „ogólny element zastępczy” i przyznać, że nie może stworzyć dosłownego zapisu tego konkretnego klipu. Zaproponował za to uporządkowanie automatycznych napisów albo roboczej transkrypcji dostarczonej przez użytkownika.

Przesłanie pliku wideo i wygenerowanie transkrypcji w Gemini

Czy Gemini potrafi transkrybować wideo? Taką funkcję pokazuje ścieżka, w której użytkownik przesyła lokalny plik i prosi o zapis mowy. W tej konfiguracji wynik może zawierać znaczniki czasu. Zewnętrzny adres Reela to jednak inny sposób przekazania materiału i nie należy automatycznie traktować go jak pliku dostępnego do analizy.

Praktyczna różnica jest zasadnicza: tekst wygenerowany po podaniu linku do materiału, którego system nie potrafi odtworzyć, nie jest transkrypcją nagrania. Jeśli użytkownik ma automatyczne napisy lub własny, niedopracowany zapis rozmowy, Gemini może je uporządkować, usunąć wypełniacze i nadać im czytelną strukturę.

Co Google opisuje w narzędziach do transkrypcji

Google 26 sierpnia 2026 r. ogłosiło Gemini 3.5 Transcribe, rozdzielając transkrypcję strumieniową od przetwarzania wcześniej zarejestrowanego dźwięku. Live API obsługuje transmisję na żywo, a Interactions API — nagrania przygotowane wcześniej.

Google podało również obsługę ponad 85 języków, przypisywanie wypowiedzi do mówców i znaczniki czasu na poziomie słów. Firma opublikowała wartości WER, czyli współczynnika błędów słów, wynoszące 4,0% dla transmisji strumieniowej i 2,6% dla trybu niestreamingowego; pomiary przypisano Artificial Analysis.

Te rozwiązania dotyczą konkretnych trybów pracy i nie zmieniają charakteru opisanego przypadku z zewnętrznym linkiem do Instagrama. Sam fakt, że Gemini potrafi przetwarzać przesłane multimedia lub że Google oferuje dedykowane interfejsy API, nie oznacza automatycznie dostępu do każdego Reela.