Podczas szczytu RAISE w Paryżu DDN zaprezentował swoją współpracę z Nebul, europejskim dostawcą chmury hybrydowej, koncentrującą się na zwiększaniu wydajności wdrożeń wnioskowania sztucznej inteligencji na dużą skalę.Odkryte w zeszłym tygodniu, wspólna inicjatywa łączy platformę inferencji Nebul, architekturę inteligencji danych Infinia DDN i przyspieszone obliczenia NVIDIA w celu rozwiązania kluczowego wąskiego gardła sztucznej inteligencji:Koszty przemieszczania danych i ograniczenia wydajności podczas obciążeń prac inferencyjnych.
DDN opracowuje współpracę wokół kluczowych wskaźników produkcji: wykorzystanie GPU, przepustowość tokenów, koszty na token i opóźnienie.Wniosek określa jego zyski operacyjne i handloweWzrost wykorzystania agentycznej sztucznej inteligencji, generowania zwiększonego odzyskiwaniem (RAG),i wysokiej konwerencji oznaczają, że infrastruktura pamięci masowej i danych bezpośrednio wpływa na wydajność akceleratora i prędkość odpowiedzi AI.
Ten aktywny projekt dowodu koncepcji przyniósł obiecujące wyniki.Partnerzy odnotowali wymierne poprawy w czasie do pierwszego tokena z włączoną pamięcią podręczną KV i ukończyli walidację infrastruktury opartej na RoCEDziałające obecnie badania porównawcze obejmują dłuższe długości sekwencji wnioskowania, co otwiera nowe możliwości optymalizacji platformy Infinia.Współpraca rozszerza się również na wspólne wysiłki NVIDIA w zakresie ram benchmarking, weryfikacji skalowalności oraz nadchodzących publikacji technicznych.
Zintegrowana platforma wykorzystuje rozproszone usługi pamięci podręcznej KV, ruch danych native GPU, inteligentną orkiestrę danych i wysokiej wydajności architekturę pamięci masowej.Przyspieszenie pamięci podręcznej KV zapewnia znaczące korzyści w wnioskowaniu poprzez zachowanie i szybkie odzyskiwanie wcześniej obliczonych stanów uwagi, zmniejszając nadmierne obliczenia i eliminując opóźnienia w dostarczaniu danych, które powodują, że procesor graficzny pracuje na braku.
Przywódcy DDN, Nebul i NVIDIA podkreślili istotną zmianę w branży: priorytety infrastruktury AI przechodzą od surowego wdrożenia GPU do efektywności operacyjnej,maksymalny zwrot z istniejącego sprzętu akceleratora. DDN CEO Alex Bouzari and Nebul CEO Arnold Juffer noted that past focus on larger model scales has given way to optimizing inference economics to make production AI commercially viable via lower per-token costsRod Evans, wiceprezes NVIDIA ds. infrastruktury chmurowej, dodał, że wielkoskalowe obciążenia pracy agentów mierzą obecnie sukces infrastruktury wykorzystaniem procesora graficznego i opóźnieniem, a nie czystą mocą obliczeniową.
DDN podkreśla, że infrastruktura sztucznej inteligencji musi ewoluować poza podstawowe funkcje magazynowania, aby aktywnie wspierać przepływy pracy wykonywania sztucznej inteligencji.Platformy infrastrukturalne firmy obsługują obecnie ponad milion procesorów graficznych na całym świecie., obsługujących hiperskalarzy, dostawców chmury, przedsiębiorstwa, rządy i instytucje badawcze.
Nowoczesne zespoły infrastruktury AI stawiają teraz priorytet na te podstawowe metryki produkcji:
Wykorzystanie GPU: mierzy aktywność akceleratora podczas wnioskowania, maksymalizując wartość zaawansowanego sprzętu GPU.
Koszty na żeton: Łączy wydajność infrastruktury bezpośrednio z kosztami operacyjnymi wydajności modelu sztucznej inteligencji.
Tokeny na wat: ocenia efektywność energetyczną wyników wnioskowania AI.
Czas na pierwszy znak: określa interaktywną odporność aplikacji AI i doświadczenie użytkownika.
Czas do produkcji: Kwantyfikuje wysiłki operacyjne w celu migracji usług sztucznej inteligencji z testowania do skalowalnego komercyjnego wdrożenia.
Jak wnioskowanie staje się dominującym obciążeniem AI, dostarczając zapisane w pamięci podręcznej dane kontekstu i przedsiębiorstwa do GPU z niskim,Stabilny czas opóźnienia będzie kluczowy dla utrzymania wysokiego wykorzystania GPU i kontrolowania długoterminowych kosztów operacyjnych.
Pekin Qianxing Jietong Technology Co., Ltd.
Sandy Yang, dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storagesserver.com
Skoncentruj się na biznesie:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami w celu dostarczania niezawodnych produktów i profesjonalnych usług.
Używanie technologii do budowy inteligentnego świata•Twój zaufany dostawca usług produktów ICT!
Sandy Yang, dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storagesserver.com
Skoncentruj się na biznesie:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami w celu dostarczania niezawodnych produktów i profesjonalnych usług.
Używanie technologii do budowy inteligentnego świata•Twój zaufany dostawca usług produktów ICT!



