MinIO opracowało petabajtowy system buforowania MemKV dostosowany do procesorów graficznych Nvidia, wdrożony na platformie obiektowej pamięci masowej AIStor.
Klastry GPU obsługujące wnioskowanie wymagają pamięci o dużej przepustowości (HBM) do przechowywania kontekstu, tokenów wektorowych i pośrednich par klucz-wartość (KV). Po nasyceniu modułu GPU HBM dane są przesyłane kaskadą do pamięci DRAM procesora i dysków SSD NVMe, zarządzanych przez procesory DPU Nvidia BlueField-4 (BF4). Kiedy te warstwy osiągną pojemność, MinIO AIStor będzie działać jako ostateczna kopia zapasowa pamięci. Architektura STX firmy Nvidia zarządza tą wielowarstwową hierarchią pamięci podręcznej, a MemKV jest zgodny ze standardem, aby zapewnić trwały, współdzielony kontekst pomiędzy klastrami GPU na najwyższą skalę.
AB Periasamy, współzałożyciel i dyrektor generalny MinIO, skomentował: "Branża od lat tuszuje utratę kontekstu, ponieważ przy małej skali możesz pochłonąć podatek rekomputacyjny. Przy dzisiejszej dużej gęstości GPU dla hiperskalerów i neochmur nie jest to już opłacalne.
Ponowne obliczenie wygenerowanego kontekstu marnuje energię; w przypadku klastrów z tysiącami procesorów graficznych powoduje to zasadniczą nieefektywność strukturalną. Wnioskowanie na dużą skalę wymaga specjalnie zbudowanej infrastruktury, a MemKV zaprojektowano specjalnie dla tej ścieżki danych.
Po raz pierwszy MinIO umożliwia współdzielone pule kontekstów dla całych klastrów GPU przy przepływach pracy z dopasowywaniem opóźnień na poziomie mikrosekund, unikając opóźnień milisekundowych z konwencjonalnej pamięci zewnętrznej. Bez wystarczających warstw pamięci podręcznej procesory graficzne marnują zasoby na wielokrotne przeliczanie kontekstu.
W przypadku wdrożenia ze 128 procesorami graficznymi i długością kontekstu wynoszącą 128 tys. tokenów rozwiązanie MemKV skróciło czas do pierwszego tokenu przy obciążeniu produkcyjnym i zwiększyło wykorzystanie procesora graficznego z 50% do ponad 90%, generując szacunkowo 2 miliony dolarów rocznych oszczędności w kosztach obliczeń.
Zaprojektowany specjalnie dla architektury Nvidia STX, MemKV obsługuje narzędzia buforujące Nvidia Dynamo i NIXL. Dostarcza petabajty współdzielonej pamięci kontekstowej po kosztach porównywalnych z dyskami SSD, oddzielając skalowanie pamięci podręcznej od zasobów obliczeniowych procesora graficznego. Jego podstawowe funkcje są wymienione poniżej:
-
Natywna obsługa BF4 STX: Działa jako plik binarny ARM64 w infrastrukturze STX, osadzony w pamięci masowej, a nie w oddzielnych serwerach pamięci masowej x86.
-
Kompleksowy transport RDMA: Przesyła pamięć podręczną KV pomiędzy pamięcią GPU a NVMe poprzez RDMA, omijając konwencjonalne protokoły przechowywania plików i obiektów.
-
Rozmiar bloku zoptymalizowany pod kątem procesora graficznego: wykorzystuje bloki o wielkości 2–16 MB na potrzeby przepustowości procesora graficznego zamiast starszych bloków pamięci o pojemności 4 KB.
-
Wydajność z szybkością drutu: Zoptymalizowany dla Nvidia Spectrum-X Ethernet i PCIe Gen6 w celu maksymalizacji przepustowości fizycznej struktury.
MemKV bezpośrednio przesyła dane z dysków SSD NVMe do potoków AI za pośrednictwem RDMA, eliminując obciążenie HTTP, translację systemu plików i pośrednie serwery pamięci masowej.
MinIO dzieli konkurencyjne rozwiązania pamięci kontekstowej na dwa typy: niewspółdzielona lokalna pamięć NVMe (G3) i współdzielona pamięć ogólnego przeznaczenia (G4). Pozycjonuje MemKV jako specjalnie zbudowaną warstwę G3.5, odróżniającą się od generycznych produktów pamięci masowej.
Firma podkreśla, że oferty G3.5 starszych dostawców nadal zachowują nadmiarowe węzły protokołów, usługi metadanych i warstwy translacji plików. Warstwy te zapewniają trwałość i spójność danych szkoleniowych i wag modeli, ale są niepotrzebne w przypadku efemerycznej, przeliczalnej pamięci podręcznej KV zoptymalizowanej dla bloków danych o wielkości 2–16 MB.
Dostawca sprzętu RAID GRAID i firma WEKA dostarczają również rozwiązania pamięci podręcznej KV kompatybilne z STX. Szeroka gama dostawców pamięci masowych obsługuje Nvidia STX, w tym Cloudian, Dell, DDN, Everpure, Hammerspace, Hitachi Vantara, HPE, Lightbits/ScaleFlux, NetApp, Nutanix, Peak:AIO, Pliops i VAST Data.
Pekin Qianxing Jietong Technology Co., Ltd.
Sandy Yang/dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
E-mail: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storageserver.com
Koncentracja biznesowa:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami, aby dostarczać niezawodne produkty i profesjonalne usługi.
„Wykorzystanie technologii do budowy inteligentnego świata”Twój zaufany dostawca usług produktów ICT!