Passaram 24 horas. Muitos departamentos técnicos e de segurança cancelaram suas férias, e o mundo inteiro busca se recuperar do que provavelmente foi o maior «apagão» de TI da história. Também detectamos confusão nos relatos, alguns acusando a Microsoft, outros à CrowdStrike, e outros distribuindo críticas para ambas. Vamos ver...

CrowdStrike: Entendendo o caos
CrowdStrike: Entendendo o caos

O que aconteceu?

No dia 19 de julho, a equipe da CrowdStrike, uma empresa de cibersegurança em Austin (capital do estado do Texas), emitiu uma atualização para sua plataforma Falcon. O papel da Falcon é instalar e manter sensores em terminais «mission-critical» com Microsoft Windows para «detectar e prevenir» ameaças.

Ok, isso parece bom, mas...

O update tinha um erro. A onda de telas azuis começou na Austrália e «se moveu para o oeste» conforme o dia avançava.

Quem foi afetado?

Bancos, hospitais, aeroportos, hotéis, transporte terrestre, alimentação, dezenas de agências governamentais, canais de televisão, portais de e-commerce e muitos mais, incluindo funcionários em trabalho remoto com laptops corporativos. Mais de 5.000 voos programados precisaram ser cancelados. Consultas médicas, atendimentos e muitas cirurgias entraram em pausa. Até o 911 e a organização das Olimpíadas foram afetados.

CrowdStrike: Entendendo o caos
Nem o Starbucks escapou... (https://x.com/itsataries)

Foi um ciberataque?

Não, e é preciso insistir nisso: foi um erro na atualização do Falcon distribuída pela CrowdStrike.

Mac e Linux? Android? iOS?

Imunes. O erro afeta computadores com Windows que usam o CrowdStrike Falcon.

Muito bem, como reparar?

É aqui que as coisas complicam. Corrigir o erro em um terminal isolado não é tão difícil, mas estamos falando de organizações com milhares de sistemas. A primeira recomendação é, por incrível que pareça, reiniciar o equipamento dezenas de vezes (detalhes abaixo). A segunda é mais técnica e envolve apagar manualmente os arquivos do update defeituoso, com o nome C-00000291*.sys (atenção ao asterisco), no caminho «Windows\System32\Drivers\CrowdStrike».

Reiniciar dezenas de vezes? É uma piada?

Na verdade, não. Os sistemas ficam presos em um bootloop, mas ao mesmo tempo há uma espécie de «corrida» entre a pilha de rede e o update defeituoso. Se em uma das reinicializações a pilha de rede vencer, a CrowdStrike pode instalar a atualização correta e permitir que o sistema escape do loop. Se o update com erros vencer, BSOD.

E se o terminal usar BitLocker?

Dor e sofrimento. Se as chaves de recuperação para ler as unidades afetadas não estiverem disponíveis, o processo é, essencialmente, um ataque de ransomware autoinfligido.

Alternativas?

Outra recomendação da Microsoft e da CrowdStrike é restaurar um backup anterior a 19 de julho, 04:09 UTC, momento em que a CrowdStrike iniciou a distribuição de sua atualização defeituosa.

Alguns dizem que 'foi' a Microsoft. Por quê?

Porque na noite de quinta-feira, vários serviços associados ao Azure também sofreram uma queda em toda a região central dos Estados Unidos. A falha se estendeu de 18 de julho (21:56 UTC) até 19 de julho (12:15 UTC). «Deus não joga dados…»

Afinal, qual foi a magnitude?

Troy Hunt, do Have I Been Pwned?, disse que foi «a maior falha de TI da história», e acrescentou que isso era basicamente «o que nos preocupava no Y2K», com a diferença de que aconteceu agora.

Então... vai acontecer de novo?

Se continuarmos fazendo besteiras com atualizações defeituosas no Ring 0, definitivamente.

Fontes: CrowdStrike, Ars Technica, The Verge, TechRadar, Microsoft.