IBM Storage Scale równoległy system plików obsługuje rozproszone zarządzanie pamięcią podręczną KV w połączeniu z NVIDIA Dynamo, obsługując duże scenariusze wnioskowania AI z ogromnymi obciążeniami kontekstowymi.
IBM wydało oficjalny Redbook zatytułowanyKontext Without Limits: Wysokiej wydajności platforma KV Cache dla dużej skali AI Inference, dostarczając kompletną zwalidowaną architekturę odniesienia dla tego wspólnego rozwiązania.i IBM Storage Scale Erasure Coding Edition (ECE) w celu zbudowania wysokiej wydajności dzielonego poziomu pamięci masowej dla inferencji AIJako autorytatywne dokumenty techniczne opublikowane przez IBM ITSO (International Technical Support Organization), IBM Redbooks oferują praktyczne, praktyczne i praktyczne informacje na temat:szczegółowe wytyczne dotyczące wdrażania produktów infrastrukturalnych IBM klasy przedsiębiorstwa.
Redbook, którego współautorami są zespoły inżynierskie z IBM, Supermicro i NVIDIA, zajmuje się podstawowym punktem bólu obciążeń związanych z długim kontekstem pracy AI.Aplikacje odzyskiwania RAG i autonomiczne rurociągi agentów generują ogromne dane pamięci podręcznej KV wewnątrz GPU HBMPo usunięciu danych z pamięci podręcznej z ograniczonych zasobów HBM powtarzające się ponowne obliczenia spowoduje poważne zwiększenie opóźnienia, co sprawia, że trwałe przechowywanie pamięci podręcznej KV jest niezbędne.
Rozwiązanie wykorzystuje pięciostopniową hierarchiczną architekturę pamięci podręcznej KV obejmującą różne wymagania dotyczące opóźnienia i pojemności:
-
Warstwa G1: węzeł GPU lokalny HBM
-
Warstwa G2: system DRAM węzłów CPU
-
Warstwa G3: bezpośrednio podłączony lokalny dysk SSD
-
G3.5 Warstwa: Pod-level shared flash storage, fronted by NVIDIA BlueField DPUs with direct interconnection to GPU server DPUs
-
Warstwa G4: Zewnętrzny pool pamięci masowej sieci Ethernet podłączony do wszystkich serwerów obliczeniowych GPU
Obejmuje ona pamięć i hierarchię pamięci masowej, zapewnia ciągłą opóźnienie i gradienty pojemności, umożliwiając NVIDIA Dynamo inteligentne umieszczanie pamięci podręcznej,automatyczne usuwanie i dynamiczne przeładowywanie danych w całym stosie przechowywania, dostosowując się elastycznie do różnych wzorców dostępu do obciążenia pracą i budżetów całkowitych kosztów infrastruktury.
Wdrożony na serwerach pamięci masowej Supermicro Petascale, Storage Scale ECE służy jako poziom zimnej pamięci podręcznej G4. Jest zoptymalizowany dla danych pamięci podręcznej KV niewrażliwych na opóźnienie,włącznie z nieaktywnymi stanami rozmowy wielokrotnej, udostępnione dane kontekstu agenta i historyczne rekordy zapytania, które nie wymagają natychmiastowej odpowiedzi.
Zgodnie z wynikami testów zapisanymi w Redbook, ta gotowa do produkcji architektura odniesienia skutecznie przyspiesza usługi inferencji generowanej sztucznej inteligencji i agentycznej sztucznej inteligencji.W testach TTFT (Time To First Token) z pojedynczym żądaniem w porównaniu z samodzielnymi serwerami GPU bez zewnętrznej pamięci podręcznej KV Scale Storage, zintegrowany system utrzymuje stabilny TTFT niezależnie od szybkich zmian długości.56x przyspieszenieWykorzystuje wprowadzane kody pod 130k tokenów i całkowicie eliminuje wahania opóźnienia wnioskowania spowodowane wydłużonymi długościami poleceń.
Pod presją równoczesnego wnioskowania wielu użytkowników rozwiązanie osiąga dramatyczną poprawę wydajności: przepustowość żądania wzrasta z 0,19 RPS do 4,26 RPS, co oznacza, że22x zwiększenie przepustowościTymczasem całkowity czas przetwarzania 200 żądań inferencji spada o 95%, znacznie podnosząc efektywność wykorzystania GPU i ogólną skalowalność klastra inferencji.
Stack utrzymuje również solidną wydajność w trudnych testach stresu hałaśliwych sąsiadów.System zintegrowany nadal stabilnie działa na 3.6 RPS, kończąc wszystkie 200 wniosków w ciągu 55,56 sekund.18 razy wyższyniż podstawowa architektura rekomputowania tylko z GPU.
Zespół badawczy doszedł do wniosku w Redbook: "Dla przedsiębiorstw dążących do maksymalizacji zwrotu z inwestycji w kosztowny sprzęt GPU, ta zweryfikowana zintegrowana architektura zapewnia prostą,podejście gotowe do produkcji w celu zwiększenia przepustowości wniosków, zmniejszając opóźnienie od końca do końca, wspierając większą równoległość usług i budując bardziej opłacalną infrastrukturę wnioskowania sztucznej inteligencji na dużą skalę.
Kluczowe słowa: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo
Pekin Qianxing Jietong Technology Co., Ltd.
Sandy Yang, dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storagesserver.com
Skoncentruj się na biznesie:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami w celu dostarczania niezawodnych produktów i profesjonalnych usług.
Używanie technologii do budowy inteligentnego świata•Twój zaufany dostawca usług produktów ICT!