6 października 2026 r. Tibo Sottiaux ogłosił, że Auto-review w Codexie jest bezpłatne dla osób zalogowanych na konto ChatGPT i nie zużywa limitu ich planu. To zmiana dotycząca korzystania z funkcji: OpenAI opisało jej wprowadzenie już pod koniec kwietnia 2026 r.
Co Auto-review zmienia na granicy sandboxa?
Sandbox to odizolowane środowisko, które ogranicza działania agenta, na przykład dostęp do plików i sieci. W Auto-review prośbę wymagającą zatwierdzenia przy przekroczeniu takiej granicy ocenia osobny agent. Główny agent Codexu nadal podlega dotychczasowym ograniczeniom — Auto-review nie rozszerza jego uprawnień.
Recenzent rozpatruje między innymi eskalowane wywołania powłoki lub polecenia exec, zablokowane przez reguły żądania sieciowe, edycje poza dozwolonymi katalogami oraz wywołania narzędzi MCP lub aplikacji wymagające zgody. Zwykłe działania już dozwolone w sandboxie nie trafiają do osobnej oceny. Z kolei zgody na poziomie aplikacji w Computer Use nadal trafiają bezpośrednio do użytkownika.
Co pokazała ewaluacja OpenAI z kwietnia 2026 r.?
W poście z 30 kwietnia 2026 r. OpenAI podało wyniki wewnętrznej ewaluacji: odsetek zatwierdzeń wyniósł 99,1% wśród eskalowanych działań, a efektywny odsetek zatwierdzeń — 99,93% dla wszystkich działań. Są to dwie miary odnoszące się do różnych grup działań w tej ewaluacji.
OpenAI zaznacza, że Auto-review nie daje deterministycznej gwarancji bezpieczeństwa. Recenzent może się pomylić, szczególnie w nietypowym lub adversarialnym kontekście, a jego ocena nie obejmuje działań, które pozostają wewnątrz sandboxa. Firma zaleca traktować tę funkcję jako element szerszej ochrony, obok konfiguracji sandboxa i monitorowania.
Jak włączyć Auto-review?
W ogłoszeniu Sottiaux wskazał ścieżkę ustawień Settings > Permissions > Auto-review i nazwę trybu desktopowego „Approve for me”. Funkcja wymaga interaktywnego zatwierdzania, na przykład konfiguracji approval_policy = "on-request"; przy approval_policy = "never" nie ma prośby o zgodę, którą Auto-review mogłoby ocenić.
Dokumentacja OpenAI podaje konfigurację approvals_reviewer = "auto_review" dla automatycznego recenzenta. Gdy recenzent odrzuci prośbę, Codex otrzymuje uzasadnienie i ma poszukać istotnie bezpieczniejszego rozwiązania albo przerwać działanie i poprosić użytkownika o decyzję. Opisana implementacja przerywa też turę po trzech kolejnych odmowach lub po dziesięciu odmowach wśród ostatnich 50 ocen w tej turze.