Każdy błąd dotyczący elementu sprzętu automatycznie zasługuje na miejsce w wiadomościach, nie tylko ze względu na swoją rzadkość, ale także na potencjał szkód. W wielu przypadkach awarie można naprawić lub ograniczyć poprzez aktualizację BIOS-u i/lub firmware, jednak tym razem to nie wystarczy. Mikroserwery, routery, firewalle, magazyny NAS i inne podobne urządzenia padają jak muchy w ostatnich miesiącach, a wszystkie strzały wskazują na problem z serią procesorów Atom C2000, którą Intel wypuścił w 2013 roku.
Historia zaczęła się od raportu o zyskach Intela za ostatni kwartał 2016 roku. Gigant z Santa Clara miał całkiem solidny rok finansowo, ale tzw. Grupa Centrów Danych odnotowała spadek o 14 procent z powodu pewnego „problemu z jakością” w jednym z produktów. Dodatkowe informacje ujawniły, że problem objawił się w postaci awarii wykrytych w konkretnej serii procesorów, a chociaż raport sugeruje „drobne poprawki” w projekcie, ta konkretna grupa została zmuszona do utworzenia dodatkowej rezerwy (czytaj „funduszu awaryjnego”), aby poradzić sobie z sytuacją.
Dotknięta seria to Intel Atom C2000, która ma warianty z dwoma, czterema i ośmioma rdzeniami. Te SoC są używane w platformach o wysokiej integracji, od mikroserwerów i magazynów NAS po firewalle, routery i inne urządzenia sieciowe. Na początku awarie nie sugerowały problemu z krzemem, a poszkodowane firmy zachowały dziwne milczenie w kwestii potwierdzenia lub zaprzeczenia związku między błędem a procesorami (być może z powodu umowy o poufności wymuszonej przez Intela), ale był jeden stały fakt: urządzenia przestawały działać po około 18 miesiącach. W tym momencie inżynierowie zaczęli podejrzewać możliwą degradację, co doprowadziło do wyjść na magistrali zegara LPC (Low Pin Count). Gdy sygnały zegara LPC_CLKOUT0 i/lub LPC_CLKOUT1 (nie muszą oba ulec awarii) przestaną działać, system nie jest w stanie poprawnie uruchomić się ponownie.
Innymi słowy, Atom C2000 to bomba z opóźnionym zapłonem. Czy można to naprawić? Teraz, gdy problem został zidentyfikowany, odpowiedź brzmi oczywiście tak, ale proces nie jest prosty. Układy Atom C2000 są wykonane w technologii BGA, co oznacza, że każda naprawa będzie wymagać bezpośredniej pracy na płycie głównej lub jej całkowitej wymiany. Aaeon, ASRock, Cisco, Dell, HP, Infortrend, iXsystems, Lanner, NEC, Newisys, Netgate, Netgear, Quanta, Seagate, Sophos, Supermicro, Synology i ZNYX Networks to niektóre z firm, które używają C2000 w swoich produktach. Dotychczasowa „kontrola szkód” była rozczarowująca. Mamy nadzieję, że wdrożą długoterminowe programy wymiany. Dotknięty sprzęt nie jest bynajmniej tani...