Czym jest centrum danych AI?

Czym jest centrum danych AI? [Wideo i quiz]

Krótka odpowiedź: Centrum danych AI to o wysokiej gęstości , w którym zasilanie, chłodzenie, infrastruktura i pamięć masowa są ukierunkowane na modele szkoleniowe i serwisowe, a nie serwerownia z dodatkowymi procesorami graficznymi. Chipy zyskują sławę; to budynek decyduje, czy działają. Jeśli obrazy nie mogą zostać przeniesione, należy zmodernizować małą komórkę; większość zespołów powinna wynająć.

Najważniejsze wnioski:

Chipy kontra budynki: Czy akceleratory działają, zależy od zasilania, chłodzenia, tkaniny i pamięci masowej.

Miejsca, nie pałace: zmodernizuj dwie szafy, jeśli nie możesz wysłać danych; nie kupuj kampusu.

Średnia a mediana: W ośmiu przebiegach mediana ukryła restarty; należy użyć średniej 18-godzinnej.

Odporność na niewłaściwe użytkowanie: Nie podawaj PUE dla dwóch regałów w hali mieszanej.

Przykładowe wyniki: Osiem przebiegów to mała mapa, a nie 50% oszczędności produkcji.

Artykuły, które mogą Ci się spodobać po przeczytaniu tego:

🔗 Czy sztuczna inteligencja jest niezawodna? Film i quiz.
Poznaj niezawodność sztucznej inteligencji dzięki angażującemu filmowi i interaktywnemu quizowi.

🔗 Jak wykorzystać sztuczną inteligencję w życiu codziennym
Odkryj praktyczne sposoby, w jakie sztuczna inteligencja może uprościć codzienne zadania i rutyny.

🔗 Jak wykorzystać sztuczną inteligencję w pracy
Poznaj praktyczne sposoby wykorzystania sztucznej inteligencji w celu zwiększenia produktywności w miejscu pracy.

🔗 Czy sztuczna inteligencja potrafi myśleć samodzielnie?
Dowiedz się, czy sztuczna inteligencja naprawdę potrafi myśleć samodzielnie lub rozumować.

Czym różni się od „normalnego” centrum danych

Tradycyjne hale optymalizują mieszane obciążenia i zapewniają bezawaryjny czas pracy wielu małych usług. Oczywiście, zależy Ci na redundancji, a także na koncepcji PUE – dodatkowej energii, którą budynek zużywa, aby dostarczyć wat mocy obliczeniowej. Zazwyczaj nie projektuje się każdego korytarza wokół szafy, która zachowuje się jak przenośna farma grzejników.

Strony AI odwracają proporcje. Gęstość rośnie. Sieć staje się materiałem, bez którego szkolenie nie może się obejść. Pamięć masowa musi utrzymywać punkty kontrolne w ruchu, a akceleratory stoją bezczynnie jak konie wyścigowe w korku.

Istnieje również różnica kulturowa. Dział operacyjny przedsiębiorstwa (Enterprise Ops) myśli w kategoriach zgłoszeń i okienek zmian. Dział operacyjny AI (AI Ops) myśli w kategoriach kolejek zadań i uczucia niepokoju, gdy węzeł umiera późno w dłuższej perspektywie. Myślę, że nadal można nazwać oba „centrami danych”, bo nimi są. Ta etykieta po prostu ukrywa hydraulikę.

Typ Do czego jest zbudowany Wyróżniający się sprzęt Charakterystyka mocy/chłodzenia Komu to pasuje Dlaczego istnieje
Tradycyjne centrum danych przedsiębiorstwa Mieszane IT: bazy danych, maszyny wirtualne, poczta e-mail, pliki Procesory, zwykłe serwery, znane pamięci masowe Oparte na powietrzu; umiarkowana gęstość; PUE jako temat do rozmów Firmy obsługujące codzienne systemy Utrzymuj aplikacje biznesowe na bieżąco
Klaster szkoleniowy AI Długie, ściśle powiązane zadania szkoleniowe Gęste stelaże akceleratorów; połączenia GPU Wysoka gęstość; chłodzenie cieczą lub [wymienniki ciepła na tylnych drzwiach](https://datacenters.lbl.gov/sites/default/files/rdhx-doe-femp.pdf) Laboratoria i modelarze czekają w kolejkach po pracę Zakończ bieg, nie głodząc chipsów
Funkcja wnioskowania AI Obsługa modeli; odpowiedzi w czasie rzeczywistym i w partiach Akceleratory; ważne moduły równoważenia obciążenia Nadal gorące, tylko... mniej teatralne; opóźnienie ponad brutalną gęstością Produkty, które muszą teraz odpowiedzieć Umieść model blisko użytkownika
Hybrydowa hala AI Szkolenie i służba pod jednym dachem; no cóż – w pewnym sensie Mieszane stojaki, ogrodzone baseny, wspólna tkanina Dwie chłodzące osobowości w jednym pomieszczeniu technicznym; robi się niezręcznie Zespoły, których nie stać na dwa kampusy Kapitał jest skończony, życie jest nieuporządkowane

To nie jest ranking moralny. Różne maszyny, to samo nazwisko.

Procesory graficzne, akceleratory i stojaki pochłaniające energię

Przechodząc przez tradycyjną podłogę podniesioną, regały wyglądają niemal uprzejmie. Przechodząc przez rząd AI, regały wyglądają, jakby chciały połknąć budynek.

Wyróżniającym się sprzętem nie jest sprytny procesor. To tacka akceleratora: procesory graficzne (GPU) lub inne układy sztucznej inteligencji (AI), umieszczone w serwerach, następnie w szafach rack, a następnie w rzędach, które współdzielą sieć o wysokiej przepustowości. Układy GPU łączą ze sobą układy scalone w coś, co może udawać jeden gigantyczny akcelerator; sieć klastrów działa tak samo w skali rzędów. Trening równoległy działa tylko wtedy, gdy te połączenia pozostają szerokie i przewidywalne. Pozbądź się ich, a Twój „klaster” stanie się stertą drogich stacji roboczych z tym samym kodem pocztowym.

Moc idzie za chipami. Nie za masywną biurową listwą zasilającą. Megawaty obciążenia IT, gdy tylko hala się zapełni – nie będę zmyślał liczby. Gęstość na szafę to zwrot akcji. Mniej szaf. Każda to mały piec. Czynnikiem ograniczającym jest często stacja elektroenergetyczna, a nie lista życzeń dotyczących procesorów graficznych. Wiecie, jak to jest: dział zaopatrzenia chce więcej akceleratorów; zakład energetyczny chce długiej rozmowy i bardzo dużego czeku.

Jedna lekko niedorzeczna metafora, której nie mogę się pozbyć: poroże to głodne zwierzę. Można wyhodować szybsze. Nadal trzeba je karmić i nadal trzeba usuwać kurz. Pomiń jedno i drugie, a stanie się bardzo kosztownym przyciskiem do papieru.

Problem z zasilaniem, ciepłem i chłodzeniem

Prąd wchodzi. Ciepło wychodzi. Oto cała religia.

Szafy o wysokiej gęstości odprowadzają ciepło w sposób, w jaki powietrze nigdy nie było do tego zobowiązane. Można mocniej wtłoczyć powietrze – wymienniki ciepła na tylnych drzwiach, cieplejsze alejki, sprytne rozwiązania – i to działa do pewnego stopnia. Potem pojawia się ciecz:

  • Chłodzenie bezpośrednio do układu scalonego

  • Pętle chłodzące, które sprawiają, że pomieszczenie techniczne wygląda jak zakład chemiczny

  • Zanurzenie w kilku projektach, które wciąż zadziwiają ludzi, którzy uważają, że woda i serwery nie powinny dzielić zdania

Nic z tego nie jest efektowne. Wszystko to jest produktem, ponieważ akcelerator, który ogranicza przepustowość, to taki, za który już zapłaciłeś i nie możesz go w pełni wykorzystać.

Wskaźnik PUE nadal ma znaczenie. To współczynnik, a nie osobowość. Operatorzy gonią za nim, ponieważ każdy wat wydany na wentylatory i pompy to wat, który nie poszedł na kartę graficzną. Nie będę podawał „typowej” wartości; klimat i sposób, w jaki wyznaczasz granice, przesuwają je, a fałszywa precyzja jest gorsza niż żadna. Woda też ma znaczenie. Niektóre rośliny pobierają. Inne połykają. Chłodzenie wyparne jest wydajne, dopóki rzeka lub susza nie uczynią go politycznym.

Sieciowanie: dlaczego struktura ma takie samo znaczenie jak układy scalone

Ludzie fotografują procesory graficzne. Powinni fotografować przełączniki.

Trening to rozmowa. Tysiące akceleratorów wymieniających się gradientami, parametrami, fragmentami modelu, w ścisłej synchronizacji. Jeśli struktura sieciowa drga, całe zadanie czeka na najwolniejszy przeskok. Dlatego w AI Halls obsesyjnie dba się o sieci o dużej przepustowości, niskie opóźnienia i topologie, które nie załamują się w połowie w przypadku awarii łącza. Struktury w stylu InfiniBand, Ethernet w tej samej roli, połączenia GPU wewnątrz urządzenia, okablowanie, które musi działać poprawnie od razu.

Wnioskowanie to zupełnie inna sprawa. Obsługa modeli koncentruje się na opóźnieniu ogonowym – powolnym rozwiązaniu, a nie przeciętnym. Przetwarzanie wsadowe kontra przetwarzanie w czasie rzeczywistym rozdziela osobowość. Klaster szkoleniowy potrzebuje dużego, kolektywnego, niemal „wszystkich” ruchu. Flota obsługująca potrzebuje wielu mniejszych żądań i izolacji, bez zatorów w module równoważenia obciążenia.

Tęsknię, skoro już tu jestem: ludzie traktują sieć jak hydraulikę, a frytki jak restaurację. W tym budynku hydraulika to restauracja. Jeśli to przegapisz, kupisz kuchnię, która nie będzie mogła przyjmować zamówień na dowóz.

Szkolenie kontra wnioskowanie: dwa budynki, czasami dosłownie

Szkolenie to kampania. Budujesz klaster, wprowadzasz do niego dane, skrupulatnie tworzysz punkty kontrolne, pracujesz godzinami lub tygodniami i modlisz się, żeby struktura działała bez zakłóceń. Obciążony wsadowo, wymagający dużej przepustowości, cierpliwy – aż do momentu, gdy awaria węzła odgryzie się od przebiegu. Jeden niedziałający akcelerator w ściśle powiązanym zadaniu może zablokować cały chór.

Wnioskowanie to fasada sklepowa. Modele już wyszkolone, teraz odpowiadają na pytania, klasyfikują obrazy, generują tekst. Opóźnienie ma znaczenie. Nieco starszy akcelerator w pobliżu klienta może przebić ten bardziej efektowny na innym kontynencie.

Więc masz podział. Kampusy szkoleniowe gonią za mocą, ziemią i gęstością. Ośrodki wnioskowania gonią za latencją i obecnością. Istnieją również hale hybrydowe, ponieważ kapitał nie jest nieskończony. No cóż – nie zawsze dwa budynki. Czasami jedna hala z aksamitną liną i dwiema pętlami chłodzącymi.

Tutaj również pojawiają się kolokacje, kampusy hiperskalowalne i rozwidlenie systemów lokalnych. Hiperskalerzy budują na taką skalę, że my wszyscy wyglądamy jakbyśmy ustawiali meble. Kolonie sprzedają gęstość na stojaki. Systemy lokalne nadal działają, gdy dane nie mogą opuścić sieci.

Przepustowość pamięci masowej, punkty kontrolne i głodne chipy

Nikt nie umieszcza równoległego systemu plików na okładce broszury.

Dane treningowe muszą docierać wystarczająco szybko, aby procesory graficzne nie traciły czasu. Punkty kontrolne muszą być na miejscu, aby awaria nie zmarnowała tygodnia. Wagi modelu muszą zostać załadowane, zanim replika zostanie uruchomiona. Przepustowość pamięci masowej – nie tylko pojemność – jest cichym wąskim gardłem. Można wydać fortunę na akceleratory i zagłodzić je, stosując porządną macierz przeznaczoną dla maszyn wirtualnych.

Schemat jest znajomy: błyszczący klaster, kolejka zadań i oczekiwanie na wejście/wyjście niczym nieudolna faktura. Klastrowanie obliczeń bez klastrowania ścieżki danych to sposób na uzyskanie bardzo kosztownego bezczynnego stanu. Dbaj o zasilanie układów scalonych albo przyznaj, że kupiłeś rzeźbę.

Oprogramowanie, orkiestracja i mało efektowna warstwa operacyjna

Sprzęt jest gwiazdą. Planiści wykonują pracę.

Centrum danych AI jest bezużyteczne, jeśli zadania nie mogą znaleźć procesorów graficznych, jeśli dwa zespoły nie mogą współdzielić klastra bez walki, jeśli nie można zastąpić uszkodzonej pozycji, jeśli oprogramowanie sprzętowe dryfuje, aż do powolnej awarii struktury. Orkiestracja, obserwowalność, limitowanie mocy – mało efektowna warstwa operacyjna, dzięki której wiadomo, że ma znaczenie.

Mam słabość do tej warstwy. Poza tym, gdy źle skonfigurowana karta sieciowa przez całe popołudnie udaje problem z chłodzeniem... można się o tym przekonać na własnej skórze.

Kiedy węzeł umiera w trakcie działania

Węzeł umiera. Okna zmian nadal kolidują z przebiegami treningowymi, które nie uwzględniają Twojego kalendarza. Grupowo planujesz duże zadania, odgradzasz pule wnioskowania, piszesz runbooki dla awarii, które wyglądają na „zadanie jest powolne”, aż w końcu wyglądają na „zadanie jest martwe”. Nadmiarowość nadal ma znaczenie – zasilanie, chłodzenie, ścieżki, pamięć masowa – ale tryb awarii jest mniej uporządkowany niż stary schemat dziewiątek czasu sprawności. Wnioskowanie: replikacja, rozładowanie chorego węzła, ciągłe odpowiadanie. Trening wymaga punktów kontrolnych, a nie optymizmu.

Lokalizacja, woda, sieć i sąsiedzi

Nie umieszcza się ich obok domku tylko dla samego widoku.

Podłączenie do sieci jest często rzeczywistym procesem wyboru lokalizacji. Grunt jest łatwy do znalezienia w porównaniu z podstacją i dostawcą energii, który ma innych klientów. Woda do chłodzenia, jeśli jej używasz, staje się problemem dla sąsiadów, gdy tylko opady deszczu stają się intensywne. Hałas. Wizualna masa. Ciepło przy ogrodzeniu. Komisje planowania odkrywają opinie na temat „chmury” w momencie, gdy potrzebuje pola i rzeki.

Opóźnienie działa w drugą stronę. Wnioskowanie lubi być blisko użytkowników i połączeń międzysystemowych. Szkolenie może być ukryte na tańszych rynkach energii i w chłodniejszym klimacie. Branża mówi, jakby istniało jedno idealne miejsce. Ale tak nie jest. Jest kompromis w postaci komunikatu prasowego.

Resztki ciepła i nieproszony piec

Broszury uwielbiają ten fragment. „Przesyłajcie ciepło odpadowe do domów, basenów, szklarni” – to urocze sformułowanie. Czasami pętla okręgowa jest autentyczna. Czasami kampus jest w niewłaściwym miejscu, a ciepło i tak ucieka w powietrze. Jestem sceptyczny co do wersji z broszury; nie jestem sceptyczny co do fizyki.

Kto tego potrzebuje (i kto powinien wynająć)

Większość ludzi nie musi być właścicielem takiej sali.

Lista szczera:

  • Hiperskalerzy, bo produktem jest flota

  • Laboratoria, w których czas oczekiwania stanowi wąskie gardło lub dane nie mogą opuścić

  • Bank, grupa szpitalna, rząd lub producent dysponujący tajnym zbiorem danych – na miejscu lub w prywatnym centrum kolokacji – może działać racjonalnie, nawet jeśli jest to trudne

Wszyscy inni powinni wynajmować. Kolokacja z gęstością gotową na AI. Rezerwacja chmury. Zarządzany klaster. Otrzymujesz akceleratory, nie stając się jednocześnie operatorem elektrowni. Romans słabnie, gdy ktoś po raz pierwszy pyta, kto jest na dyżurze przy obiegu chłodziwa o 3 nad ranem.

Przyznaję, że jest w tym coś z dumy. Posiadanie klastra to jak posiadanie narzędzia przewidywania. A potem przychodzi rachunek za prąd i duma siada.

Do czego służy ten budynek

Czym więc jest centrum danych AI? Specjalistyczny kampus o wysokiej gęstości, w którym akceleratory, zasilanie, chłodzenie, infrastruktura i pamięć masowa są zorganizowane wokół modeli szkoleniowych i serwisowych – a nie uniwersalne IT z kartą graficzną w rogu. Wygląda jak magazyn. Zachowuje się jak elektrownia, która wykonuje obliczenia.

Jeśli nic innego nie pamiętasz: chipy zyskują sławę; podstacja, chłodziwo i sieć decydują, czy te chipy były dobrym pomysłem. Szkolenie i wnioskowanie mogą dzielić dach; nadal chcą różnych manier. Większość organizacji powinna wynajmować. Kilka powinno budować. Sąsiedzi i tak to zauważą.

Chmura zawsze miała budynek. W dzisiejszych czasach budynek ma opinie.

Przykład z życia wzięty: komórka treningowa z dwoma stojakami, gdy obrazy nie mogą opuścić

Scenariusz

Tomos jest kierownikiem ds. infrastruktury w Kestrel Precision, firmie produkcyjnej zatrudniającej 400 osób w West Midlands. Mają już niewielką halę lokalną: ERP, współdzielone pliki, maszyny wirtualne i mieszane środowisko, od którego rozpoczął się ten artykuł. Chłodzenie powietrzem. Zwykły Ethernet. Sieć SAN, która idealnie nadaje się do dysków biurowych.

Zespół ds. wizji maszynowej musi wyszkolić model inspekcji na fotosach fabrycznych. Fotosy nie mogą opuścić terenu zakładu. Pokazują proces, którego firma nie umieści na dysku w chmurze, nawet prywatnym. Rozwiązaniem dla działu zaopatrzenia są cztery serwery z podwójnym akceleratorem i slajd zatytułowany „Nasze centrum danych AI”. Serwery umieszczane są w dwóch istniejących szafach, ponieważ jest tam miejsce, a przestrzeń wydawała się być ograniczeniem.

Nie jest. W ciągu dwóch tygodni procesory graficzne wydają się być zajęte, a potem cichutko zwalniają. Zadania słabną, gdy punkt kontrolny trafia do sieci SAN. Węzeł pada po jedenastej godzinie i po prostu... koniec. Tomos nie omieszkał kupić chipów. Kupił stertę drogich stacji roboczych z tym samym kodem pocztowym. Budynek nadal był halą przedsiębiorstwa.

Nie potrzebują kampusu, nowej podstacji ani rzeki. Potrzebują małej komórki, która zachowuje się jak miniaturowe centrum danych AI: z zasilaniem, które racki rzeczywiście mogą utrzymać, ciepłem, które uchodzi bez niszczenia chipów, strukturą, przez którą zadanie szkoleniowe może się komunikować, pamięcią masową, która może obsługiwać punkt kontrolny, oraz podręcznikiem na wypadek awarii węzła. Ponieważ obrazy nie mogą się wydostać, wynajęcie klatki colo oddalonej o czterdzieści minut nie jest rozwiązaniem. Modernizacja dwóch racków już tak.

Czego potrzebuje komórka

  • Zmierzony budżet mocy w tym wierszu, z jednostek PDU, a nie z listy życzeń GPU. Jeśli zapasowa moc nie jest w stanie obsłużyć czterech serwerów przy obciążeniu treningowym, rozmowa kończy się w tym miejscu i rozważana jest gęstsza sieć colo, a nie cud

  • Chłodzenie powietrza nigdy nie było wymagane przy takiej gęstości: wymienniki ciepła w tylnych drzwiach, jeśli hala może je przyjąć, lub mała pętla cieczy, jeśli może ją przyjąć. Jeśli ani jedno, ani drugie, serwery nie wchodzą do środka

  • Dedykowana sieć o dużej przepustowości między czterema węzłami, a nie biurowy Ethernet. Jeśli dostawca ma w katalogu tylko przełącznik 10 Gb, nie jest to klaster

  • Lokalna szybka pamięć masowa dla punktów kontrolnych i fragmentów szkoleniowych, nie dla sieci SAN maszyn wirtualnych

  • Harmonogram, interwał punktów kontrolnych i zapisana ścieżka restartu. Sprzęt jest najważniejszy. Ta warstwa to zadanie

  • Ogrodzona skrzynka wnioskowania dla linii produkcyjnej, oddzielona od rozmów szkoleniowych, ponieważ obsługa wymaga opóźnień i izolacji, a nie zbiorowości

  • Zezwolenie na rejestrowanie zużycia energii, taktowania GPU, zdarzeń związanych z dławieniem i zegara ściennego zadań. Jeśli nie będą mogli tego sprawdzić, sfotografują GPU i pominą przełączniki

Przykładowa instrukcja

Tomos wyraził to w swoim opisie obiektu, mówiąc zwykłym językiem:

Nie nazywajmy tego kampusem AI. Zbudujmy dwuskrzydłową komórkę szkoleniową w istniejącej hali dla czterech serwerów z podwójnym akceleratorem. Obrazy fabryczne pozostają na miejscu. Sukces jest następujący: cztery węzły ukończą 12-etapowy schemat inspekcji i treningu bez ograniczenia termicznego, zapiszą punkt kontrolny w kilka minut, a nie w dziesiątki minut, i wznowią działanie od tego punktu kontrolnego, gdy celowo usuniemy rangę. Chłodzenie musi utrzymywać procesory graficzne z częstotliwością szkoleniową. Sieć musi być wspólną strukturą, którą te cztery serwery współdzielą, a nie ścieżką przez stos biurowy. Pamięć masowa musi zasilać układy. Jeśli wymienniki ciepła w tylnych drzwiach się nie zmieszczą, powiedz to i przestań. Nie podawaj PUE dla dwóch szaf w hali mieszanej. Ta liczba byłaby salą operacyjną.

Następnie umieszcza to w samym zadaniu szkoleniowym:

Punkt kontrolny co 30 minut do lokalnej puli szybkiego startu. Jeśli ranga zginie, zacznij od ostatniego ukończonego punktu kontrolnego. Nie czekaj na SAN. Nie kontynuuj treningu, gdy zegary spadły z powodu upału. Zanotuj to i przerwij, żebyśmy mogli zobaczyć przeciągnięcie.

Dobra godzina wygląda tak: wszystkie osiem GPU na zegarach treningowych, plik z punktem kontrolnym załadowany, zadanie wciąż w synchronizacji. Zła godzina wygląda tak: wentylatory na pełnej mocy, zegary wyłączone, punkt kontrolny 2% zapisany po dziesięciu minutach i ktoś w biurze mówi: „Klaster działa”. Działa to nie trening.

Jak to przetestować

Piszą test przed modernizacją, i o to właśnie chodzi, żeby nie ufać wersji demonstracyjnej.

  • Ta sama receptura z 12 epok, te same 120 000 alembików inspekcyjnych, osiem przebiegów

  • Czas mierzony jest od momentu przesłania zadania do ostatniego punktu kontrolnego epoki 12, wliczając w to każde ponowne uruchomienie, zgodnie z zegarem ściennym

  • Pomijanie przegrzania: taktowanie GPU utrzymuje się na poziomie docelowym dla danego przebiegu treningowego. Zdarzenie dławienia jest niepowodzeniem, nawet jeśli zadanie ostatecznie się zakończy

  • Przekazanie danych do magazynu: czas zapisu punktu kontrolnego, mediana i najgorszy czas z dziennika zadań

  • Przekazanie materiału: praca nie czeka w zbiorowym oczekiwaniu, dopóki szereg jest sprawny. Jeśli nie widzą tego oczekiwania, instrumentacja nie jest ukończona

  • Dwa z ośmiu przebiegów zostały celowo usunięte z rankingu na ustalonym etapie, aby przetestować ścieżkę ponownego uruchomienia

  • Wnioskowanie to oddzielny test 200 obrazów, przeprowadzany od linii produkcyjnej do ogrodzonego boksu serwującego. Sukces szkolenia nie jest wliczany do sukcesu serwowania

  • Rejestrują moc szafy z PDU w 15-minutowych próbkach, więc nikt nie musi wymyślać megawatów

Akceptacja dla określenia komórki jako „gotowej na sztuczną inteligencję”: 8 z 8 receptur kończy się; 0 z 8 wskazuje na przeciążenie termiczne; oba przerwane przebiegi zostają wznowione; punkty kontrolne pozostają w ciągu kilku minut. Jeśli tego nie zrobią, nadal mają serwerownię z wypasionymi kartami graficznymi.

Wynik

Wynik poglądowy, na podstawie wymyślonego testu składającego się z ośmiu prób, nie jest to opublikowana wartość Kestrel.

Założenia: cztery serwery z podwójnym akceleratorem w dwóch szafach; jeden model inspekcyjny; 120 000 alembików; osiem przebiegów stałej receptury obejmującej 12 epok; zegar ścienny obejmuje ponowne uruchomienia aż do zakończenia receptury; dławienie oznacza zarejestrowany spadek w zegarze szkoleniowym; czas punktu kontrolnego to zapis, a nie życzenie; moc szafy to próbki PDU, a nie PUE na terenie kampusu.

Przed modernizacją procesory graficzne w zwykłych szafach chłodzonych powietrzem na biurowej sieci Ethernet i sieci SAN maszyn wirtualnych:

  • 5 z 8 przebiegów ukończonych za pierwszym podejściem. Średni czas na zegarze ściennym wśród tych pięciu: 14 godzin

  • 3 z 8 musiało zostać uruchomionych ponownie po zatrzymaniu się około 11 godziny (dwa po awarii węzła z powodu nieaktualnego punktu kontrolnego, jeden po zapełnieniu SAN przez punkt kontrolny). Natychmiastowa ponowna próba, bez czekania w zegarze przez całą noc: 11 straconych godzin plus 14-godzinna druga próba, czyli 25 godzin do ukończenia receptury w tych trzech przypadkach

  • Średni czas wykonania przepisu dla wszystkich ośmiu, wliczając restarty: 18 godzin. (Pięć po 14 godzinach, trzy po 25. Mediana dla wszystkich ośmiu wynosi nadal 14, co ukryłoby restarty. Dlatego średnia jest tutaj punktem odniesienia)

  • Przepustnica termiczna zarejestrowana w 7 z 8 przebiegów. Mediana czasu przy obniżonym taktowaniu: 3 godziny w 14-godzinnej próbie

  • Zapis punktu kontrolnego: średnio 22 minuty

  • Zabójstwo z rangą nie było testem, który mogli zdać. Nie mieli podręcznika. Dwa przypadkowe zgony były dowodem

  • Szczytowe obciążenie IT na obu stojakach podczas treningu: około 18 kW. Rząd miał waty. Nie miał chłodzenia ani tkaniny

Po zainstalowaniu wymienników ciepła z tylnymi drzwiami na tych dwóch stojakach, dedykowanej struktury między czterema węzłami, małego puli NVMe na punkty kontrolne, 30-minutowego tworzenia punktów kontrolnych i podręcznika ponownego uruchamiania:

  • 8 z 8 ukończonych za pierwszym razem. Średni czas zegara ściennego: 9 godzin

  • Przepustnica termiczna: 0 z 8

  • Zapis punktu kontrolnego: mediana 90 sekund. Najgorszy w zestawie: 3 minuty

  • Dwa celowe zabójstwa zostały wznowione od ostatniego punktu kontrolnego 30 minut wcześniej. Dodatkowy czas na zegarze ściennym w tych dwóch biegach: około 40 minut każdy, wliczając diagnozę, więc te dwa biegi trwały blisko 9 godzin i 40 minut. Średnia z ośmiu nieruchomych rund do 9 godzin

  • Szczytowe obciążenie IT nadal wynosi około 18 kW. Te same chipy. Inne zachowanie budynku

W tej próbie średni czas ukończenia receptury spadł z 18 godzin do 9 godzin, czyli po 9 godzin w każdym, czyli 72 godziny w ośmiu przebiegach. Wskaźnik ukończenia za pierwszym razem spadł z 5 na 8 do 8 na 8. Wskaźnik przepustnicy spadł z 7 na 8 do 0 na 8. Ta ostatnia liczba wskazuje, czy kupili akceleratory, czy przyciski do papieru. Nie nazwaliby tej zmiany czasu 50% oszczędnością w produkcji. Osiem przebiegów to mały, łatwy zestaw.

Te liczby stanowią przykładowe szacunki oparte na wspomnianym teście, małej próbie, jednym modelu i jednej sali mieszanej. Nie są one wskaźnikiem PUE, nie są mocą obliczeniową kampusu ani dowodem na to, że Kestrel powinien zbudować placówkę szkoleniową w terenie. Przegląd rejestrów mieścił się w ciągu 9 godzin; nie ukryto tego. Wartość 18 kW to zaokrąglony odczyt PDU, a nie faktura za media. Nie przeliczono tych 72 godzin na koszt, ponieważ łączna stawka za energię elektryczną w fabryce stanowiłaby fałszywy argument biznesowy.

Kontrola serwowania była osobna i mniejsza: 200 zdjęć liniowych do ogrodzonego pola, wszystko na miejscu. To wnioskowanie, a nie szkolenie. Mieszanie tych dwóch rzeczy byłoby błędem hybrydowej sali w miniaturze.

Co może pójść nie tak

  • Dział zaopatrzenia wciąż nazywa cztery serwery „centrum danych AI”. Etykieta ukrywa hydraulikę, a kolejny zakup to kolejne procesory graficzne do tego samego, chorego alejki

  • Wymienniki tylnych drzwi wchodzą do środka, a nikt nie uruchamia strony wodnej. Wentylatory wciąż krzyczą. Zegary wciąż się przestawiają

  • Struktura to pojedynczy przełącznik bez ścieżki zapasowej. Jedno uszkodzone łącze, a „klaster” to ponownie cztery stacje robocze

  • Punkty kontrolne pozostają w sieci SAN, ponieważ pula NVMe była w „fazie drugiej”. Faza druga nie nadchodzi przed kolejnym martwym węzłem

  • Podają PUE dla dwóch regałów w hali mieszanej. Klimat, granica i reszta rzędu ERP sprawiają, że ten współczynnik jest kostiumem

  • Szkolenie i obsługa dzielą się materiałem. Zalew punktów kontrolnych sprawia, że ​​linia produkcyjna czeka. Opóźnienie na końcu linii produkcyjnej to produkt, a nie gęstość

  • Węzeł ulega awarii, a ktoś traktuje to jako zgłoszenie awarii, a nie jako restart punktu kontrolnego. Operatorzy przedsiębiorstwa i operatorzy sztucznej inteligencji rozmawiają ze sobą przez całe popołudnie

  • Mogliby wynająć klatkę, ale obrazy nie mogą jej opuścić. Zapomnienie o tym ograniczeniu wpędza ich w konwersację w chmurze, którą będą musieli odreagować

Praktyczne wskazówki

Centrum Danych AI w tym kształcie to nie magazyn ani faktura za GPU. To komórka, która pozwala akceleratorom dokończyć bieg: moc, którą mogą utrzymać, ciepło, które oddaje, struktura, punkt kontrolny i ktoś, kto odpowiada za utratę rangi. Kestrel nie potrzebował kampusu. Potrzebowali dwóch regałów, żeby przestać udawać. Większość zespołów powinna wynająć takie rozwiązanie. Kilka, z tajnym zestawem danych i halą, która może wytrzymać ciepło, powinno zbudować komórkę i odmówić poślizgu.

Często zadawane pytania

Czym jest centrum danych AI?

Centrum obliczeniowe o wysokiej gęstości, w którym zasilanie, chłodzenie, sieć i pamięć masowa koncentrują się na równoległym szkoleniu i obsłudze modeli, a nie na uporządkowanych rzędach serwerów ogólnego przeznaczenia. Zostało zaprojektowane tak, aby ogromna liczba akceleratorów mogła trenować i obsługiwać modele bez awarii, zatrzymywania się w sieci lub oczekiwania na dysk. Zwykła hala przedsiębiorstwa to mieszane osiedle. Hala AI to monokultura, której jednostką wartości jest akcelerator, taki jak procesory graficzne (GPU) lub układy scalone typu TPU. Wygląda jak magazyn i zachowuje się jak elektrownia wykonująca obliczenia.

Czym centrum danych AI różni się od zwykłego centrum danych?

Tradycyjne hale optymalizują mieszane obciążenia i czas sprawności wielu małych usług. Ośrodki AI odwracają proporcje: gęstość rośnie, sieć staje się strukturą, bez której szkolenie nie może się obejść, a pamięć masowa musi utrzymywać punkty kontrolne w ruchu, aby akceleratory nie były przeciążone. Dział operacyjny przedsiębiorstwa myśli w kategoriach zgłoszeń i okien zmian. Dział operacyjny AI myśli w kategoriach kolejek zadań i nieprzyjemnego uczucia, gdy węzeł umiera późno w dłuższej perspektywie. Nadal można dzwonić do obu centrów danych. Etykieta po prostu ukrywa hydraulikę.

Dlaczego centra danych AI zużywają tak dużo energii?

Wyróżniającym się sprzętem nie jest sprytny procesor. To akcelerator: układy GPU lub inne układy AI, umieszczone w serwerach, następnie w szafach rack, a następnie w rzędach, które współdzielą infrastrukturę o wysokiej przepustowości. Gęstość na szafę rack to zwrot akcji: mniej szaf, każda jak mały piec. Megawaty obciążenia IT ujawniają się, gdy hala się zapełnia, choć wymyślanie typowej wartości nie jest warte zachodu. Czynnikiem ograniczającym jest często stacja elektroenergetyczna, a nie lista życzeń dotyczących układów GPU.

Jak chłodzone są centra danych AI?

Szafy rack o wysokiej gęstości odprowadzają ciepło w sposób, w jaki powietrze nigdy nie było tak naprawdę od niego wymagane. Można mocniej tłoczyć powietrze dzięki wymiennikom ciepła z tylnymi drzwiami, cieplejszym alejkom i przemyślanym rozwiązaniom. Wtedy pojawia się ciecz: chłodzenie bezpośrednio do układu scalonego, pętle chłodzące i zanurzenie w niektórych konstrukcjach. Akcelerator, który ogranicza przepustowość, to taki, za który już zapłaciłeś i którego nie możesz w pełni wykorzystać. PUE nadal ma znaczenie, ponieważ każdy wat wydany na wentylatory i pompy to wat, który nie trafia do GPU. Woda również ma tu swoje miejsce: niektóre rośliny pobierają, inne połykają.

Dlaczego łączność sieciowa jest tak samo ważna jak procesory graficzne?

Trening to rozmowa: tysiące akceleratorów wymieniających się gradientami, parametrami i fragmentami modelu w ścisłej synchronizacji. Jeśli struktura sieciowa drga, całe zadanie czeka na najwolniejszy przeskok. Dlatego w AI Halls obsesyjnie skupiamy się na sieciach o dużej przepustowości, niskich opóźnieniach, strukturach w stylu InfiniBand lub Ethernetu w tej samej roli oraz topologiach, które nie załamują się na pół w przypadku awarii łącza. Wnioskowanie uwzględnia opóźnienie ogonowe, wiele mniejszych żądań i izolację. W tym budynku instalacja wodno-kanalizacyjna to restauracja.

Do czego służy centrum danych AI: do szkolenia czy wnioskowania?

Szkolenie to kampania: zbuduj klaster, prześlij mu dane, skrupulatnie przeprowadź punkt kontrolny i działaj godzinami lub tygodniami. Wnioskowanie to fasada: modele już wyszkolone, teraz udzielające odpowiedzi, z opóźnieniem, które ma znaczenie. Kampusy szkoleniowe gonią za mocą, gruntami i gęstością. Ośrodki wnioskowania gonią za opóźnieniem i obecnością. Hale hybrydowe istnieją, ponieważ kapitał nie jest nieskończony – czasami jedna hala z dwoma obiegami chłodzenia. Nieco starszy akcelerator blisko klienta może przebić ten bardziej efektowny na innym kontynencie.

Dlaczego pamięć masowa jest ważna w centrum danych AI?

Dane treningowe muszą docierać wystarczająco szybko, aby procesory graficzne nie traciły czasu. Punkty kontrolne muszą być na miejscu, aby awaria nie zmarnowała tygodnia. Wagi modelu muszą zostać załadowane, zanim replika zostanie uruchomiona. Przepustowość pamięci masowej, a nie tylko jej pojemność, stanowi ciche wąskie gardło. Można wydać fortunę na akceleratory i ograniczyć ich wykorzystanie za pomocą dyskretnej macierzy zaprojektowanej dla maszyn wirtualnych.

Co się dzieje, gdy węzeł umiera w trakcie działania?

Jeden niedziałający akcelerator w ściśle powiązanym zadaniu szkoleniowym może zablokować cały chór. Szkolenie wymaga punktów kontrolnych, a nie optymizmu. Wnioskowanie wyczerpuje wadliwy węzeł, utrzymuje replikę w stanie odpowiedzi i pozostaje aktywna. Okna zmian nadal kolidują z przebiegami szkoleniowymi, które nie uwzględniają Twojego kalendarza. Nadmiarowość nadal ma znaczenie dla zasilania, chłodzenia, ścieżek i pamięci masowej, ale tryb awarii jest mniej uporządkowany niż stary suwak dziewiątek czasu sprawności.

Jaki wpływ ma centrum danych AI na sieć energetyczną, wodę i sąsiadów?

Podłączenie do sieci często stanowi rzeczywisty proces wyboru lokalizacji. Grunt jest łatwy w porównaniu z podstacją i dostawcą energii, który ma innych klientów. Woda do chłodzenia, jeśli jest używana, staje się problemem dla sąsiadów, gdy opady deszczu są intensywne, podobnie jak hałas, wizualne obciążenie i ciepło przy ogrodzeniu. Szkolenie może być ukryte na tańszych rynkach energii i w chłodniejszym klimacie. Wnioskowanie lubi być blisko użytkowników. Nie ma jednej idealnej lokalizacji. Istnieje kompromis w postaci komunikatu prasowego.

Czy muszę posiadać centrum danych AI, czy lepiej je wynająć?

Większość ludzi nie musi posiadać jednej z tych hal. Hiperskalery powstają, ponieważ produktem jest flota. Laboratoria powstają, gdy czas oczekiwania jest wąskim gardłem lub dane nie mogą opuścić infrastruktury. Bank, szpital, rząd lub producent z tajnym zestawem danych może uzasadnić korzystanie z lokalnej lub prywatnej platformy kolokacyjnej. Wszyscy inni powinni wynająć: kolokację gotową na AI, rezerwację w chmurze lub zarządzany klaster. Akceleratory są dostępne bez konieczności zostawania operatorem elektrowni.

Odniesienia

  1. IEA - www.iea.org

  2. LBNL - datacenters.lbl.gov

  3. Zielona Siatka - www.thegreengrid.org

  4. LBNL - datacenters.lbl.gov

  5. LBNL - datacenters.lbl.gov

  6. Uptime Institute - journal.uptimeinstitute.com

  7. NVIDIA - developer.nvidia.com

  8. NVIDIA - docs.nvidia.com

  9. NVIDIA - docs.nvidia.com

  10. NVIDIA - docs.nvidia.com

  11. Google Cloud - docs.cloud.google.com

Znajdź najnowszą sztuczną inteligencję w oficjalnym sklepie z asystentami AI

O nas

Kwiz
1. Czym według artykułu jest centrum danych AI?

2. W wersji dotyczącej miejsc, a nie pałaców, co powinien zrobić zespół Kestrel, gdy obrazy fabryczne nie mogą opuścić witryny?

3. Dlaczego w artykule jako wartość bazową przed modernizacją przyjęto średnią 18-godzinną, a nie medianę 14-godzinną?

4. Co się zmieniło po modernizacji dwóch szaf w ramach przykładowego testu obejmującego osiem przebiegów?

5. Co artykuł mówi o podawaniu PUE dla tej dwustanowiskowej celi?


Powrót do bloga