HP ZGX Fury. Architektura GB300, modele LLM, testy i cena
HP ZGX Fury to komputer do uruchamiania dużych modeli AI na miejscu, w firmie lub laboratorium. StorageReview opisuje rozpoczęcie przyjmowania zamówień, a w nagłówku pojawiają się 748 GB pamięci i układ GB300. Przy takich liczbach nasuwa się pytanie: czy można postawić pod biurkiem model, który dotąd wymagał kilku drogich kart GPU?
Odpowiedź zależy od tego, gdzie znajdą się jego wagi i jak będą zapisane. Dostęp do poszczególnych części pamięci Fury odbywa się z różną szybkością.
Jeden Grace, jeden Blackwell Ultra
ZGX Fury jest realizacją platformy NVIDIA DGX Station. Jego podstawą jest GB300 Grace Blackwell Ultra Desktop Superchip, łączący procesor Grace z jednym GPU Blackwell Ultra. Grace ma 72 rdzenie Arm Neoverse V2. Obsługuje system, przygotowanie danych i uruchamianie obliczeń; GPU wykonuje operacje na modelu. Dokumentacja architektury NVIDIA
Słowo „Desktop” w nazwie ma znaczenie. Opisy serwerowych systemów GB300 mogą dotyczyć innej liczby GPU i innej pojemności pamięci. Na przykład DGX GB300 w skali całej szafy ma 72 GPU i 36 CPU. Tych parametrów nie należy przypisywać pojedynczemu Fury.
HP zamyka swój system w obudowie wieżowej, którą można też zamontować w szafie jako urządzenie 5U. Chłodzenie wykorzystuje zamknięty obieg cieczy. Jest to współdzielony zasób dla zespołu: programiści mogą łączyć się z własnych komputerów i korzystać z lokalnej usługi generującej odpowiedzi. Opis HP ZGX Fury
Do zwykłej sieci służy port 10 GbE, a kontroler ConnectX-8 udostępnia dwa porty po 400 Gb/s do szybkich połączeń między systemami. Osobny port 1 GbE obsługuje kontroler zarządzania BMC. Administrator może przez niego m.in. zdalnie włączyć maszynę i sprawdzić stan sprzętu. QuickSpecs HP, strony 2 i 18
Co naprawdę oznacza 748 GB pamięci
W specyfikacji HP występują dwie fizycznie różne pule:
| Pamięć | Pojemność | Deklarowana przepustowość | Rola |
|---|---|---|---|
| HBM3e przy GPU | 252 GB | 7,1 TB/s | Szybki dostęp GPU do wag i danych roboczych |
| LPDDR5X przy CPU | 496 GB | 396 GB/s | Pamięć systemowa i dodatkowa pojemność dla dużych modeli |
Suma wynosi 748 GB. Parametry potwierdza także dokumentacja platformy NVIDIA.
Procesory łączy NVLink-C2C o deklarowanej przepustowości 900 GB/s. Sprzęt utrzymuje spójność danych: CPU i GPU mogą korzystać ze wspólnej przestrzeni adresowej. GPU może więc odczytywać wagi umieszczone w pamięci Grace. Nie oznacza to, że cała pula zyskuje szybkość HBM. Parametry połączenia NVIDIA, opis spójności pamięci
Z porównania specyfikacji wynika, że przepustowość lokalnego HBM jest około 18 razy większa od przepustowości LPDDR5X: 7100 / 396 ≈ 17,9. To stosunek możliwości pamięci, bez przeliczenia na osiemnastokrotną różnicę szybkości modelu. Łącze nie przyspieszy odczytu ponad możliwości pamięci, z której pobierane są dane.
Oprogramowanie musi też właściwie rozmieścić wagi. NVIDIA zaleca jawny wybór miejsca alokacji przy optymalizacji wydajności. W opisanym w dokumentacji trybie CDMM zwykła alokacja systemowa pozostaje w pamięci CPU; nie przenosi się automatycznie do HBM. 748 GB w specyfikacji nie oznacza zatem, że każdy silnik zobaczy 748 GB zwykłego VRAM i sam optymalnie je wykorzysta. Zasady zarządzania pamięcią GB300
Moc obliczeniowa i pobór prądu
NVIDIA podaje dla DGX Station 20 PFLOPS w FP4 z wykorzystaniem sparsity oraz 15 PFLOPS w FP4 dla obliczeń gęstych. Jeden petaflops to 10¹⁵ operacji zmiennoprzecinkowych na sekundę. FP4 opisuje czterobitową reprezentację liczb, a sparsity pozwala pominąć część operacji dzięki określonej strukturze zer. Dla zwykłego FP32 producent podaje 80 TFLOPS. Te wartości dotyczą różnych rodzajów operacji i nie są zamienne. Tabela wydajności NVIDIA wraz z przypisami
W LLM liczy się także czas odczytu wag i przetworzenia kontekstu. Dlatego sam wynik w PFLOPS nie odpowiada na pytanie, ile tekstu dostanie użytkownik w ciągu sekundy. Potrzebny jest pomiar konkretnego modelu, formatu wag i obciążenia.
QuickSpecs HP, wersja z 14 sierpnia 2026 r., podaje zasilacz 1600 W, klasy Titanium, oraz znamionowe napięcie 100–240 V. To moc zasilacza, nie pomiar stałego zużycia energii. Tabela poboru w poszczególnych stanach nadal zawiera „TBD”. HP zaznacza też, że dodatkowa karta RTX PRO 6000 może spowodować ograniczenie mocy GB300 i wpłynąć na wydajność.
Do oszacowania rachunku potrzebna jest średnia moc pobierana z gniazdka. Przykładowo stały pobór 1 kW przez 30 dni oznacza 720 kWh, jeszcze bez chłodzenia pomieszczenia. To własny przykład rachunkowy, a nie pomiar Fury.
Jakie modele LLM można brać pod uwagę
Punktem wyjścia jest rozmiar wszystkich wag, czyli liczb zapisanych w wytrenowanym modelu. W BF16 jedna liczba zajmuje dwa bajty, w zapisie ośmiobitowym jeden, a czterobitowym nominalnie pół bajta. Kwantyzacja zmniejsza ten koszt, zmieniając dokładność reprezentacji.
Poniższa tabela przedstawia własny rachunek pojemności, nie listę wykonanych testów HP. Liczę liczbę parametrów pomnożoną przez liczbę bitów i podzieloną przez osiem. Używam dziesiętnych GB. Pomijam skale kwantyzacji, dodatkowe tensory i bufory, więc rzeczywisty plik oraz działająca usługa mogą potrzebować więcej pamięci.
| Przykładowy model | Założony zapis wag | Same wagi, w przybliżeniu | Wniosek z pojemności |
|---|---|---|---|
| Llama 3.3 70B | BF16 | 140 GB | Zostaje wyraźny zapas w HBM |
| Qwen3.5-397B-A17B | 4 bity | 198,5 GB | Kandydat do pracy głównie w HBM; narzut formatu i kontekst mogą zmienić bilans |
| DeepSeek-R1, 671B | 4 bity | 335,5 GB | Wagi przekraczają HBM; potrzebna także pamięć Grace |
| Kimi K2.5, 1T | 4 bity | 500 GB | Pojemność całego systemu daje przestrzeń na taki rozmiar, ale znacząca część wag trafi poza HBM |
To przykłady rozmiarów, nie ranking najnowszych modeli. Qwen ma opublikowany wariant NVFP4, a Kimi K2.5 wykorzystuje natywną kwantyzację INT4. „Cztery bity” nie określają jednak jednego formatu: silnik musi obsługiwać konkretny zapis i architekturę modelu. Sam rachunek bajtów nie jest potwierdzeniem działającej konfiguracji.
Litera „A” w nazwie Qwena wskazuje liczbę parametrów aktywnych podczas przetwarzania tokena. Model ma 397 miliardów parametrów łącznie, lecz wykorzystuje około 17 miliardów na token. To architektura Mixture of Experts, czyli MoE: mechanizm wyboru kieruje obliczenia do części modułów zwanych ekspertami. Mniejsza liczba aktywnych parametrów ogranicza pracę na token, ale pozostałe wagi nadal trzeba gdzieś przechować. Opis Qwen3.5
Do wag dochodzi pamięć rozmowy. KV cache przechowuje wyniki części wcześniejszych obliczeń uwagi, aby model nie wykonywał ich od nowa przy każdym kolejnym tokenie. Dłuższy kontekst i więcej równoległych rozmów zwiększają zapotrzebowanie na pamięć, zależnie od architektury i formatu cache. Silnik potrzebuje też miejsca na własne bufory. Dlatego model, którego plik prawie wypełnia 252 GB, może już wymagać przeniesienia części wag do Grace. NVIDIA: uruchamianie modeli przez vLLM
Hasło HP o modelach do biliona parametrów ma przypis dotyczący FP4. Podobnie deklaracja dostrajania modeli klasy 100B jest opatrzona warunkiem kwantyzacji. Nie określa ona kompletnej receptury treningowej. Wnioskowanie z gotowych wag, dostrajanie adapterów i aktualizowanie wszystkich parametrów to różne obciążenia pamięci oraz obliczeń. Warunki deklaracji HP
Co zmierzono na maszynie z tym samym GB300
StorageReview przetestowało MSI XpertStation WS300. Redakcja sterowała oprogramowaniem zdalnie na sprzęcie udostępnionym przez MSI, bez dodatkowej karty RTX. Wyniki dotyczą tej stacji, nie gotowej konfiguracji HP.
Poniżej szybkość generowanych tokenów, przy 512 tokenach wejścia i 512 wyjścia. Ostatnia kolumna sumuje odpowiedzi wszystkich jednoczesnych żądań.
| Model i format | Jedno żądanie, tok./s | Łącznie pod obciążeniem |
|---|---|---|
| MiniMax M2.7, NVFP4 | 193 | 4801 tok./s przy 128 żądaniach |
| GLM-5.2, NVFP4 | 36 | 139 tok./s przy 32 żądaniach |
| Nemotron-3-Ultra 550B, NVFP4 | 43 | 168 tok./s przy 32 żądaniach |
Dwa ostatnie wiersze mają szczególny warunek: wymuszono akceptację odpowiednio trzech i pięciu spekulowanych tokenów. Zwykle model musi sprawdzić proponowane tokeny i część odrzuca. Te wyniki pokazują optymistyczny scenariusz, nie zwykłą rozmowę z rzeczywistą skutecznością spekulacji.
GLM zajmował około 433 GB, z czego 216 GB wag ekspertów przeniesiono do Grace. Test potwierdza uruchomienie modelu przekraczającego HBM. Nie daje podstaw do obietnicy identycznej szybkości na HP.
Są również relacje z użycia samego Fury
Autor zbioru Nemotron 3 Nano KD Corpus deklaruje przygotowanie na pojedynczym HP ZGX Fury 4302 przykładów rozumowania przy użyciu DeepSeek-V4-Flash 284B w NVFP4. Model działał przez vLLM, przy 12 równoległych żądaniach. Cały proces generowania kandydatów, sprawdzania kodu i selekcji trwał około 15 godzin; końcowy korpus ma około 7,1 mln tokenów. Czas obejmuje wszystkie te etapy, więc nie jest czystym benchmarkiem inferencji.
W repozytorium eksperymentu autor opisuje również dostrojenie Nemotron 3 Nano 30B-A3B na tej maszynie. Użył adapterów LoRA, czyli niewielkiego zestawu dodatkowych trenowanych parametrów, przez Megatron-Bridge: 1500 kroków, sekwencje długości 4096, około dwóch godzin pracy. To udokumentowane zastosowanie treningowe z udostępnionym kodem, bez podstaw do uogólnienia go na pełny trening modelu 100B.
Parker Johnston z Insight, partnera HP, opisuje też pracę agentów i zużycie 11 mln tokenów w 90 minut. Relacja nie rozdziela tokenów wejścia, wyjścia i ponownie użytego kontekstu ani nie podaje nazw wszystkich modeli i warunków pomiaru. Liczby tej nie da się uczciwie przeliczyć na szybkość generowania porównywalną z tabelą powyżej.
StorageReview w wiadomości o rozpoczęciu sprzedaży informuje, że ma już HP w laboratorium i przygotowuje recenzję. W tym materiale nie publikuje jeszcze wyników Fury. Stan opisanych źródeł i ofert: 14 września 2026 r.
Oprogramowanie: Linux, CUDA i osobny plan Red Hata
Aktualne QuickSpecs HP wymieniają Ubuntu 24.04 LTS z narzędziami NVIDIA i wprost zaznaczają brak obsługi Windows w opisanej konfiguracji. Grace jest procesorem Arm, więc obrazy kontenerów i binarne zależności muszą być zgodne z tą architekturą. QuickSpecs HP, strona 3, architektura CPU
NVIDIA dokumentuje stos obejmujący CUDA, PyTorch, TensorRT-LLM, vLLM i SGLang. To silniki i biblioteki wykonujące model. HP dodaje Z Runtime do pobierania i udostępniania modeli oraz Z Toolkit do pracy z narzędziami AI. Konfigurację konkretnego modelu trzeba dobrać do GB300, formatu wag i sposobu użycia pamięci CPU. Stos oprogramowania DGX Station, narzędzia HP
Red Hat AI Factory to dodatkowa warstwa firmowego wdrażania i zarządzania modelami, obejmująca m.in. RHEL, OpenShift i oprogramowanie AI NVIDIA. Komunikat HP rozdziela dostępny sprzęt i certyfikację RHEL od planowanej wspólnej platformy. Terminy oraz konfiguracje środowiska ewaluacyjnego mają zostać podane później. Ogłoszenie współpracy nie dowodzi jeszcze dostępności całego pakietu w cenie komputera.
Cena: pojawiły się oferty powyżej 130 tys. USD
Wiadomość StorageReview słusznie odnotowała brak ceny w ogłoszeniu HP. Są jednak publiczne oferty amerykańskich sprzedawców:
| Sprzedawca | Konfiguracja z oferty | Wyświetlana cena |
|---|---|---|
| CompSource | HP E70LKUT#ABA, 4 × 2 TB SED, gwarancja 3 lata, bez dodatkowej karty graficznej | 130 550,57 USD |
| TetraChoice | Ten sam numer HP E70LKUT#ABA | 132 000 USD |
TetraChoice prosi o kontakt w sprawie ceny i dostępności. Trzeba więc traktować te liczby jako ceny ofertowe konkretnych sprzedawców, nie oficjalną globalną cenę startową HP ani potwierdzenie dostawy do Polski. Lokalna wycena musi uwzględniać podatki, transport, zakres serwisu i ewentualne licencje.
Określenie „bez karty graficznej” dotyczy dodatkowego układu do obrazu. Konfiguracja nadal zawiera GPU Blackwell Ultra z 252 GB HBM3e, co potwierdza szczegółowy opis TetraChoice. Monitor do zwykłej pracy graficznej wymaga opcjonalnego GPU; port Mini DisplayPort kontrolera BMC służy zarządzaniu systemem. Dokumentacja wyjść obrazu
Dla porównania CDW wystawia MSI WS300 748 GB, SKU WS300T60L, za 106 408,99 USD. To inna konfiguracja handlowa i inny producent, ale daje punkt odniesienia dla kosztu platformy GB300.
Przy takim wydatku próba przed zakupem powinna obejmować własny model w docelowej kwantyzacji, rzeczywistą długość rozmów i liczbę użytkowników. Oprócz czasu do pierwszego tokena i szybkości dalszej odpowiedzi trzeba sprawdzić poprawność zadań. Szczególnie wtedy, gdy założenie zakupu opiera się na uruchamianiu największej wersji modelu, jaką uda się zmieścić w 748 GB.
Źródła
- Brian Beeler, StorageReview: HP ZGX Fury Is Now Orderable.
- HP: strona ZGX Fury, QuickSpecs c09316164, wersja 1, komunikat o współpracy z Red Hat.
- NVIDIA: DGX Station, parametry wydajności, Development Guide, System Overview, Mixed Coherency Environment, Software Stack, Serve LLMs with vLLM, serwerowy DGX GB300.
- Meta: Llama 3.3 70B Instruct; vLLM: Qwen3.5-397B-A17B; DeepSeek: DeepSeek-R1; Moonshot AI: Kimi K2.5.
- Divyansh Jain, StorageReview: MSI XpertStation WS300 Review.
- curtburk: Nemotron 3 Nano KD Corpus, kod i opis eksperymentu; Parker Johnston, Insight: relacja z uruchomienia HP ZGX Fury.
- Oferty sprzętu: CompSource, HP E70LKUT#ABA, TetraChoice, HP E70LKUT#ABA, CDW, MSI WS300T60L.
Wykorzystuję treści generowane przez AI jako część mojego codziennego procesu nauki.