Google ogłosiło 15 września 2026 roku modele Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking. Oba są projektowane dla agentów głosowych, które mogą prowadzić rozmowę, analizować obraz i uruchamiać narzędzia, gdy dialog nadal trwa. Drugi model dodaje do tego wieloetapowe rozumowanie oraz komunikowanie postępu pracy.
Dwa modele, dwa różne zadania
Gemini 3.8 Live ma służyć do płynnych rozmów o niskim opóźnieniu, obsługiwanych na dużą skalę. Google pozycjonuje go jako wariant nastawiony na szybkość, efektywność kosztową i rozmowę z wizualnym kontekstem.
Gemini 3.8 Live Extended Thinking jest przeznaczony do bardziej złożonych zadań. Ma rozumować i mówić jednocześnie, a podczas dłuższej pracy przekazywać krótkie komunikaty o postępie. W praktyce oznacza to model dla wieloetapowych przepływów, w których sama szybka odpowiedź nie wystarcza.
| Obszar | Gemini 3.8 Live | Gemini 3.8 Live Extended Thinking |
| Główne zastosowanie | Szybka, skalowalna rozmowa głosowa | Złożone zadania wymagające głębszego rozumowania |
| Rozmowa podczas pracy narzędzi | Narzędzia i wywołania API mogą działać w tle | Narzędzia i rozumowanie mogą działać w tle podczas mówienia |
| Przetwarzanie obrazu | Obsługa obrazu w czasie zbliżonym do rzeczywistego | Obsługa obrazu w ramach interakcji multimodalnej na żywo |
| Styl pracy | Priorytetem jest płynność i szybkość | Priorytetem jest rozumowanie wieloetapowe i sygnalizowanie postępu |
| Dostęp dla deweloperów | Gemini Live API i Google AI Studio | Gemini Live API i Google AI Studio |
Najważniejsza zmiana zachodzi w trakcie rozmowy
W klasycznym modelu głosowym agent często musi zakończyć jedną czynność, zanim przejdzie do kolejnej odpowiedzi. Gemini 3.8 Live ma pozwalać na uruchamianie narzędzi i wywołań API w tle, bez przerywania rozmowy. Dzięki temu agent może pobierać dane, wykonywać operację albo przetwarzać kontekst, jednocześnie pozostając w dialogu.
Oficjalna demonstracja Gemini Live API pokazuje asynchroniczne wywoływanie funkcji, dźwięk proaktywny, wstrzykiwanie kontekstu przez send_client_content oraz widoczne w czasie rzeczywistym logi wywołań narzędzi. W jednym z przykładów system pobiera dane zamówienia z bazy, a w innym Gemini 3.8 Live Extended Thinking tworzy grafikę SVG, kontynuując rozmowę.
Ta architektura ma znaczenie szczególnie dla agentów głosowych, które nie tylko odpowiadają, lecz także wykonują zadania. Użytkownik może przekazać dodatkowy kontekst bez rozpoczynania nowej tury rozmowy, a system może pokazać, kiedy narzędzie zostało wywołane i jaki zwróciło wynik.
97 języków i wyniki podawane przez Google
Google twierdzi, że modele Live potrafią automatycznie wykrywać język i przełączać się między 97 obsługiwanymi językami w środku rozmowy. To funkcja przydatna w wielojęzycznych dialogach, ale sama liczba języków nie opisuje wszystkich elementów jakości agenta głosowego, takich jak przerywanie rozmowy, obsługa hałasu czy odzyskiwanie kontekstu po błędzie.
Google podało także wyniki Gemini 3.8 Live Extended Thinking w kilku testach: 82,6 punktu w Speech to Speech Quality Index firmy Artificial Analysis, 68,6% w τ-Voice, 35,1% w bankowym teście τ-Voice firmy Sierra oraz 97,7% w Big Bench Audio. Są to wyniki przedstawione przez Google dla konkretnych testów, a nie uniwersalna gwarancja działania w każdej aplikacji.
Google deklaruje również, że wygenerowany dźwięk jest znakowany wodnym znakiem SynthID.
Dostęp dla deweloperów w Polsce
Polscy deweloperzy mogą korzystać z Gemini 3.8 Live i Gemini 3.8 Live Extended Thinking przez Gemini Live API oraz Google AI Studio od momentu premiery. Google wymienia też kanały konsumenckie i firmowe, między innymi Search Live, wybrane funkcje Gemini, Docs, Gmail i Keep oraz prywatny podgląd w Gemini Enterprise. Dostęp zależy od konkretnego modelu, produktu, planu i rynku.
To rozdzielenie ma znaczenie: dostęp w Google AI Studio lub przez API nie oznacza automatycznie, że ten sam model zasila każdą sesję w aplikacji Gemini. W przypadku twórców agentów najważniejszym punktem wejścia pozostaje więc Gemini Live API, a nie sama etykieta widoczna w aplikacji.