logo
Dom Aktualności

wiadomości o firmie Redbook firmy Big Blue dotyczący zarządzania pamięcią podręczną KV w skali pamięci masowej

Orzecznictwo
Chiny Beijing Qianxing Jietong Technology Co., Ltd. Certyfikaty
Chiny Beijing Qianxing Jietong Technology Co., Ltd. Certyfikaty
Opinie klientów
Pracownicy sprzedaży Beijing Qianxing Jietong Technology Co., Ltd są bardzo profesjonalni i cierpliwi. Mogą szybko dostarczyć wyceny. Jakość i opakowanie produktów są również bardzo dobre. Nasza współpraca przebiega bardzo sprawnie.

—— 《Festfing DV》LLC

Kiedy pilnie szukałem procesora Intel i dysku SSD firmy Toshiba, Sandy z Beijing Qianxing Jietong Technology Co., Ltd udzieliła mi dużej pomocy i szybko dostarczyła mi potrzebne produkty. Naprawdę ją doceniam.

—— Kitty Jen

Sandy z Beijing Qianxing Jietong Technology Co.,Ltd jest bardzo uważnym sprzedawcą, który przy zakupie serwera potrafi przypomnieć mi o błędach konfiguracyjnych. Inżynierowie są również bardzo profesjonalni i mogą szybko zakończyć proces testowania.

—— Strelkin Michaił Władimirowicz

Jesteśmy bardzo zadowoleni z naszej współpracy z firmą Beijing Qianxing Jietong. Jakość produktu jest doskonała, a dostawy zawsze na czas. Ich zespół sprzedaży jest profesjonalny, cierpliwy i bardzo pomocny we wszystkich naszych pytaniach. Naprawdę doceniamy ich wsparcie i oczekujemy długoterminowej współpracy. Gorąco polecamy!

—— Ahmad Navid

Jakość: “Wielkie doświadczenie z moim dostawcą. MikroTik RB3011 był już używany, ale był w bardzo dobrym stanie i wszystko działa doskonale.i wszystkie moje obawy zostały szybko rozwiązaneBardzo niezawodny dostawca.

—— Geran Colesio

Im Online Czat teraz
firma Aktualności
Redbook firmy Big Blue dotyczący zarządzania pamięcią podręczną KV w skali pamięci masowej

IBM Storage Scale równoległy system plików obsługuje rozproszone zarządzanie pamięcią podręczną KV w połączeniu z NVIDIA Dynamo, obsługując duże scenariusze wnioskowania AI z ogromnymi obciążeniami kontekstowymi.

najnowsze wiadomości o firmie Redbook firmy Big Blue dotyczący zarządzania pamięcią podręczną KV w skali pamięci masowej  0

IBM wydało oficjalny Redbook zatytułowanyKontext Without Limits: Wysokiej wydajności platforma KV Cache dla dużej skali AI Inference, dostarczając kompletną zwalidowaną architekturę odniesienia dla tego wspólnego rozwiązania.i IBM Storage Scale Erasure Coding Edition (ECE) w celu zbudowania wysokiej wydajności dzielonego poziomu pamięci masowej dla inferencji AIJako autorytatywne dokumenty techniczne opublikowane przez IBM ITSO (International Technical Support Organization), IBM Redbooks oferują praktyczne, praktyczne i praktyczne informacje na temat:szczegółowe wytyczne dotyczące wdrażania produktów infrastrukturalnych IBM klasy przedsiębiorstwa.

Redbook, którego współautorami są zespoły inżynierskie z IBM, Supermicro i NVIDIA, zajmuje się podstawowym punktem bólu obciążeń związanych z długim kontekstem pracy AI.Aplikacje odzyskiwania RAG i autonomiczne rurociągi agentów generują ogromne dane pamięci podręcznej KV wewnątrz GPU HBMPo usunięciu danych z pamięci podręcznej z ograniczonych zasobów HBM powtarzające się ponowne obliczenia spowoduje poważne zwiększenie opóźnienia, co sprawia, że trwałe przechowywanie pamięci podręcznej KV jest niezbędne.

Rozwiązanie wykorzystuje pięciostopniową hierarchiczną architekturę pamięci podręcznej KV obejmującą różne wymagania dotyczące opóźnienia i pojemności:
  • Warstwa G1: węzeł GPU lokalny HBM
  • Warstwa G2: system DRAM węzłów CPU
  • Warstwa G3: bezpośrednio podłączony lokalny dysk SSD
  • G3.5 Warstwa: Pod-level shared flash storage, fronted by NVIDIA BlueField DPUs with direct interconnection to GPU server DPUs
  • Warstwa G4: Zewnętrzny pool pamięci masowej sieci Ethernet podłączony do wszystkich serwerów obliczeniowych GPU
Obejmuje ona pamięć i hierarchię pamięci masowej, zapewnia ciągłą opóźnienie i gradienty pojemności, umożliwiając NVIDIA Dynamo inteligentne umieszczanie pamięci podręcznej,automatyczne usuwanie i dynamiczne przeładowywanie danych w całym stosie przechowywania, dostosowując się elastycznie do różnych wzorców dostępu do obciążenia pracą i budżetów całkowitych kosztów infrastruktury.

Wdrożony na serwerach pamięci masowej Supermicro Petascale, Storage Scale ECE służy jako poziom zimnej pamięci podręcznej G4. Jest zoptymalizowany dla danych pamięci podręcznej KV niewrażliwych na opóźnienie,włącznie z nieaktywnymi stanami rozmowy wielokrotnej, udostępnione dane kontekstu agenta i historyczne rekordy zapytania, które nie wymagają natychmiastowej odpowiedzi.

Zgodnie z wynikami testów zapisanymi w Redbook, ta gotowa do produkcji architektura odniesienia skutecznie przyspiesza usługi inferencji generowanej sztucznej inteligencji i agentycznej sztucznej inteligencji.W testach TTFT (Time To First Token) z pojedynczym żądaniem w porównaniu z samodzielnymi serwerami GPU bez zewnętrznej pamięci podręcznej KV Scale Storage, zintegrowany system utrzymuje stabilny TTFT niezależnie od szybkich zmian długości.56x przyspieszenieWykorzystuje wprowadzane kody pod 130k tokenów i całkowicie eliminuje wahania opóźnienia wnioskowania spowodowane wydłużonymi długościami poleceń.

Pod presją równoczesnego wnioskowania wielu użytkowników rozwiązanie osiąga dramatyczną poprawę wydajności: przepustowość żądania wzrasta z 0,19 RPS do 4,26 RPS, co oznacza, że22x zwiększenie przepustowościTymczasem całkowity czas przetwarzania 200 żądań inferencji spada o 95%, znacznie podnosząc efektywność wykorzystania GPU i ogólną skalowalność klastra inferencji.

Stack utrzymuje również solidną wydajność w trudnych testach stresu hałaśliwych sąsiadów.System zintegrowany nadal stabilnie działa na 3.6 RPS, kończąc wszystkie 200 wniosków w ciągu 55,56 sekund.18 razy wyższyniż podstawowa architektura rekomputowania tylko z GPU.

Zespół badawczy doszedł do wniosku w Redbook: "Dla przedsiębiorstw dążących do maksymalizacji zwrotu z inwestycji w kosztowny sprzęt GPU, ta zweryfikowana zintegrowana architektura zapewnia prostą,podejście gotowe do produkcji w celu zwiększenia przepustowości wniosków, zmniejszając opóźnienie od końca do końca, wspierając większą równoległość usług i budując bardziej opłacalną infrastrukturę wnioskowania sztucznej inteligencji na dużą skalę.

Kluczowe słowa: SUPERMICRO, IBM Storage Scale, NVIDIA Dynamo

Pekin Qianxing Jietong Technology Co., Ltd.
Sandy Yang, dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storagesserver.com
Skoncentruj się na biznesie:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami w celu dostarczania niezawodnych produktów i profesjonalnych usług.
Używanie technologii do budowy inteligentnego świata•Twój zaufany dostawca usług produktów ICT!
Pub Czas : 2026-06-12 11:09:46 >> lista aktualności
Szczegóły kontaktu
Beijing Qianxing Jietong Technology Co., Ltd.

Osoba kontaktowa: Ms. Sandy Yang

Tel: 13426366826

Wyślij zapytanie bezpośrednio do nas (0 / 3000)