Google ogłosił 15 września 2026 roku dwa modele dialogu na żywo: Gemini 3.8 Live oraz Gemini 3.8 Live Extended Thinking. Pierwszy ma obsługiwać szybkie i masowe wdrożenia agentów głosowych, drugi — bardziej złożone zadania wymagające wieloetapowego rozumowania podczas rozmowy.

To nie są wyłącznie systemy zamieniające mowę na tekst. Modele przyjmują tekst, obraz, wideo, dźwięk i pliki PDF, a odpowiadają tekstem oraz dźwiękiem. Google deklaruje też wykonywanie narzędzi i wywołań API w tle, bez przerywania dialogu.

Gemini 3.8 Live i Extended Thinking: najważniejsza różnica

Gemini 3.8 Live jest przeznaczony do płynnej rozmowy i wdrożeń na dużą skalę. Gemini 3.8 Live Extended Thinking ma natomiast poświęcać więcej pracy na zadania wieloetapowe, jednocześnie informując rozmówcę o postępie. Google podaje jako przykład komunikat „Let me check that...”, wypowiadany podczas pracy w tle.

ObszarGemini 3.8 LiveGemini 3.8 Live Extended Thinking
Główne zastosowanieSzybcy agenci głosowi i wdrożenia na dużą skalęZłożone przepływy pracy wymagające wieloetapowego rozumowania
Zachowanie podczas rozmowyPłynny dialog i wykonywanie narzędzi w tleRozumowanie i mówienie jednocześnie, z głosowym sygnalizowaniem postępu
Obsługiwane wejściaTekst, obraz, wideo, dźwięk i PDFTekst, obraz, wideo, dźwięk i PDF
Obsługiwane wyjściaTekst i dźwiękTekst i dźwięk
Limit wejścia128 000 tokenów128 000 tokenów
Limit wyjścia64 000 tokenów64 000 tokenów

Co modele potrafią podczas rozmowy

Google ogłosił Gemini 3.8 Live: dwa modele głosowych agentów

Gemini 3.8 Live może analizować kontekst wizualny niemal w czasie rzeczywistym i automatycznie przełączać się między 97 obsługiwanymi językami w trakcie jednej rozmowy. Oba modele mogą wykonywać narzędzia oraz wywołania API w tle, podczas gdy użytkownik nadal mówi i słucha odpowiedzi.

Techniczna podstawa tej interakcji to stanowe połączenie WebSocket w Gemini Live API. Dźwięk płynie w obu kierunkach przez utrzymywane połączenie, zamiast przechodzić przez całkowicie sekwencyjny schemat: nagranie, transkrypcja, odpowiedź i dopiero kolejna tura. Dla twórców agentów oznacza to architekturę bliższą rozmowie telefonicznej niż krótkim komunikatom wysyłanym naprzemiennie.

Gemini 3.8 Live Extended Thinking ma wykorzystywać tę ciągłość także przy trudniejszych zadaniach. Model może kontynuować rozumowanie w tle i informować głosem, że sprawdza kolejny etap, zamiast pozostawać całkowicie cicho. Wygenerowany dźwięk Google oznacza technologią SynthID.

Gdzie można korzystać z Gemini 3.8 Live

Google wymienia jako miejsca dostępu między innymi Google AI Studio, Gemini API i Google Enterprise Agent Platform. Gemini 3.8 Live jest także wskazywany w kontekście Google Search Live oraz wybranych funkcji Google Workspace. Extended Thinking ma być dostępny również w aplikacji Gemini i wybranych funkcjach Workspace.

W Polsce dostęp deweloperski przez Gemini Live API i Google AI Studio był opisywany jako natychmiastowy. Dostęp konsumencki nie jest jedną, wspólną kategorią: zależy od konkretnej usługi, konta i uprawnień. W przypadku Google Workspace funkcje Gmail Live, Docs Live i Keep Live obejmują wdrożenie konsumenckie dla uprawnionych subskrybentów Google AI, natomiast dostęp biznesowy opisano jako nadchodzący, bez konkretnej daty.

Co naprawdę mówią wyniki testów

Google podaje dla Gemini 3.8 Live Extended Thinking wynik 82,6 w Speech to Speech Quality Index firmy Artificial Analysis, 68,6% w τ-Voice, 35,1% w benchmarku Sierra τ-Voice-banking oraz 97,7% w Big Bench Audio. Standardowy Gemini 3.8 Live miał zająć drugie miejsce w Speech Agent Arena.

To osobne ewaluacje, więc ich wyników nie można sumować w jeden ogólny wskaźnik jakości. Liczby opisują rezultaty przedstawione przez Google, a nie jeden niezależny test obejmujący wszystkie zastosowania. W praktyce rozdzielają dwa obszary: płynność rozmowy i obsługę dużej liczby sesji po jednej stronie oraz dłuższe, bardziej wymagające rozumowanie po drugiej.

Dla twórców aplikacji najważniejsza decyzja jest więc dość konkretna: Gemini 3.8 Live pasuje do scenariuszy, w których liczą się szybkość i skala, a Gemini 3.8 Live Extended Thinking do agentów, które mają wykonywać złożone zadania krok po kroku, nie zrywając kontaktu głosowego z użytkownikiem.