Em entrevista publicada em 12 de setembro de 2026, Dario Amodei defendeu avaliadores independentes dentro de empresas de IA. Jacob Coxon, ex-pesquisador da Anthropic e da OpenAI, também falou sobre sua saída da Anthropic e reiterou o alerta sobre a corrida por sistemas mais capazes. No centro do debate estão os limites do alinhamento e do monitoramento à medida que os modelos se tornam mais complexos.

Os alertas apontam para um problema de controle

O segmento exibe a publicação de despedida de Jacob Coxon e a resposta de Evan Hubinger, com a estimativa pessoal de Hubinger.

Em 9 de setembro, Jacob Coxon anunciou que estava deixando a Anthropic. Ele disse ter passado três anos trabalhando com pesquisa de pré-treinamento na OpenAI e na Anthropic e acusou as duas empresas de correr em direção à superinteligência capaz de se aperfeiçoar. É uma avaliação de Coxon sobre o rumo da indústria.

Evan Hubinger, líder de ciência de alinhamento na Anthropic, apoiou a preocupação e disse estimar pessoalmente em mais de 10% a chance de a IA matar todos os humanos na próxima década. A cifra é uma avaliação individual, não um consenso científico.

O que Jakub Pachocki diz sobre os limites da OpenAI

Em 6 de setembro, Jakub Pachocki, cientista-chefe da OpenAI, publicou o ensaio “An Alien Mind” e pediu cautela diante do avanço da inteligência artificial. Ele afirmou que nenhum laboratório resolveu os problemas de alinhamento e monitoramento a ponto de continuar escalando sistemas no ritmo máximo por muito mais tempo com responsabilidade.

Pachocki também propôs que a expansão dos sistemas acompanhe a confiança em sua segurança. Entre as medidas que defendeu estão barreiras de segurança aplicadas por auditores externos ou órgãos governamentais, desacelerações voluntárias e coordenação internacional.

Autoaperfeiçoamento recursivo continua teórico

Autoaperfeiçoamento recursivo é um ciclo de feedback no qual sistemas de IA contribuem cada vez mais para desenvolver seus sucessores. A OpenAI espera que o progresso possa seguir nessa direção; um ciclo de aperfeiçoamento totalmente autônomo continua teórico.

A diferença importa: falar de um possível rumo futuro não equivale a descrever uma capacidade já alcançada. O debate é sobre como manter a supervisão humana caso os sistemas passem a participar mais intensamente do desenvolvimento de outras IAs.

Alinhamento vai além de obedecer a uma instrução

A OpenAI distingue alinhamento de objetivos e alinhamento de valores. O primeiro trata de cumprir a meta atribuída ao sistema; o segundo, de agir de modo coerente com valores humanos em situações novas, ambíguas ou adversariais.

Um modelo pode cumprir bem uma instrução conhecida e ainda falhar quando enfrenta circunstâncias diferentes das cobertas pela supervisão. A OpenAI afirma que sua capacidade de confiar no monitoramento da cadeia de pensamento — as etapas de raciocínio que o modelo expressa em texto — está diminuindo progressivamente. Os modelos atuam em ambientes mais complexos, interagem com pessoas, ferramentas e outras IAs e podem manipular melhor os próprios processos de raciocínio. Além disso, nem todo comportamento passa por uma explicação verbalizada.

Em julho de 2026, a OpenAI relatou um incidente envolvendo agentes experimentais e a plataforma Hugging Face durante testes de cibersegurança. A empresa disse que o episódio revelou uma fragilidade na forma como as salvaguardas se generalizaram para além do escopo pretendido.

Monitores independentes e outros freios propostos

Na entrevista, Dario Amodei explica a proposta de avaliadores independentes; Jacob Coxon também fala sobre sua saída da Anthropic e os riscos que vê na corrida por sistemas mais capazes.

Em sua entrevista, Amodei defendeu avaliadores independentes trabalhando dentro de empresas de IA, com acesso às práticas e aos incidentes de segurança. A proposta é uma forma de acompanhar riscos por dentro; Pachocki, por sua vez, apontou também para limites de segurança, auditorias externas e coordenação entre países.

PropostaQuem atuariaPapel previsto
Avaliadores dentro das empresasMonitores independentesAcompanhar práticas e incidentes de segurança
Barreiras de segurançaAuditores externos ou órgãos governamentaisAplicar limites de segurança ao desenvolvimento
Desaceleração voluntáriaEmpresas de IAReduzir voluntariamente o ritmo de desenvolvimento
Coordenação internacionalGovernos e organismos internacionaisCoordenar respostas e supervisão entre países