Przyjmowanie sztucznej inteligencji jest obecnie utrudnione przez wysokie wydatki na tokeny i brak wstępnej jasności cenowej dla wniosków o sztuczną inteligencję, co prowadzi do niekontrolowanego nadmiernego wydatkowania tokenów.To ryzyko jest drastycznie wzmocnione przez agentów AI, które obecnie działają bez wbudowanych ograniczeń kosztów tokenów i mogą powodować ekstremalne wybuchy kosztów.
W tym artykule wyjaśniono, czym są tokeny sztucznej inteligencji, jak funkcjonuje cena tokenów oraz praktyczne strategie zapobiegania katastrofalnym wydatkom tokenów.Dobrze udokumentowany przypadek przedsiębiorstwa widział organizację zbierać $ 500,000Z drugiej strony, zespół inżynierów Uber rzekomo wyczerpał cały swój budżet AI na 2026 rok przed terminem.Tokeny są podstawowymi jednostkami, które duże modele językowe (LLM) i chatboty wykorzystują do rozbierania sygnałów językowych i generowania spójnych wyników AI.
Przykładowo, wpis "Tell me about sedimentation" jest podzielony na oddzielne elementy tokenowe:
- Powiedz.
-Mnie.
- Około.
- osady
-powtarzanie
Ten pięciokrotny podział dla jednego słowa "osadzenie" pomaga LLM dokładnie interpretować strukturę i znaczenie słów.Podzielenie korzenia sediment i sufiksu ation pozwala modelowi rozpoznać konsekwentne użycie sufiksu w wielu rzeczownikach, w tym kapitalizacja, komputeracja i opodatkowanie.skrócenie czasu przetwarzania zamiast skanowania każdego słowa zawierającego sufiksy pojedynczo.
Jako podstawowe jednostki danych, tokeny są przekształcane w wektorowe wbudowania ?? ciągi liczbowe matematyczne, które kodują znaczenie semantyczne i są przechowywane w indeksach modelu.model generuje wiele wektorów reprezentujących jego wielowymiarowe atrybuty, takich jak żywy organizm, zwierzę domowe, cechy kotów, rozmiar fizyczny i wiele innych.i syntetyczne zabawki dla kotów.
Hipotetyczne pięciwymiarowe wbudowanie wektora dla terminu cat może być wyrażone jako [1.5-0.4, 7.2, 19.6, 20.2].
Wszystkie dane wektorowe istnieją w zunifikowanej przestrzeni wektorowej, umożliwiając modeli identyfikacji semantycznie podobnej zawartości poprzez pomiar bliskości przestrzennej między punktami wektorowymi.
Po przekształceniu w wektory tokeny są przetwarzane na kosztownych serwerach GPU wyposażonych w pamięć o dużej przepustowości.NVIDIA DGX SuperPOD z 32 węzłami i 256 łącznymi procesorami graficznymi kosztuje od 12 do 20 milionów dolarówBardziej zaawansowana architektura referencyjna z 140 węzłami DGX H100, siecią Quantum-2 InfiniBand, pełną infrastrukturą pamięci masowej i sieciową oraz systemami wspierającymi może przekroczyć 100 milionów dolarów.Te znaczące koszty infrastruktury odzwierciedlają się bezpośrednio w systemach cenowych tokenów w głównych modelach fundacji.
Wiodący dostawcy LLM i chatbotów, w tym OpenAI i Anthropic, przyjmują modele rozliczeniowe oparte na tokenach, z przewidywalnymi zasadami konwersji tokenów dla treści tekstowych.Jeden angielski żeton równa się około czterech znaków lub 0.75 słów, co oznacza, że 750 słów odpowiada około 1000 żetonom.,Wydajność sztucznej inteligencji z 000 słów zużywa w sumie około 3667 żetonów.
Większe zużycie tokenów bezpośrednio wydłuża opóźnienie odpowiedzi AI. Wszystkie tokeny z jednej sesji szybkiej odpowiedzi są zawarte w oknie kontekstowym o skończonej pojemności.Okno kontekstowe z tokenem 000 może pomieścić około 751000 słów w języku angielskim, co odpowiada 300-stronicowej książce.
Niewystarczająca pojemność okna kontekstowego powoduje, że LLM tracą informacje kontekstowe, co prowadzi do niekompletnych lub niedokładnych wyników sztucznej inteligencji.GPT-4o obsługuje do 128,000 żetonów, Claude 3.5 Sonnet osiąga 200,000 żetonów, a wybrani użytkownicy korporacyjni Gemini 1.5 Pro mogą uzyskać dostęp do okna kontekstowego 2 milionów żetonów.
Ceny tokenów różnią się w zależności od dostawców modeli.
Według Intuition Labs, OpenAI's ChatGPT API działa na czystej strukturze rozliczeniowej opartej na tokenach.z tokenami wyjściowymi zazwyczaj kosztującymi więcej. Ceny wahają się również w zależności od stanu odpowiedzi w pamięci podręcznej. Każdy połączenie API wiąże się z dwiema różnymi opłatami: jedną za szybkie żetony wejściowe i jedną za żetony wyjściowe generowane przez sztuczną inteligencję.wykorzystując model o cenie 10 USD za milion tokenów wyjściowych dla 100 tokenów wejściowych i 400 tokenów wyjściowych wynosi koszty wejścia 10 × 100/1,000, 000) i kosztów produkcji 10 × 400/1,000, 000), przy czym całkowite wydatki są równe sumie tych dwóch liczb.
Przedsiębiorstwa mogą wdrożyć ukierunkowane kontrole zarządzania w celu ograniczenia wydatków na tokeny, w tym kwoty na użytkownika lub na miejsce, ograniczenie ruchu w oparciu o wykorzystanie, limity wydatków na projekt,i ograniczenia poziomu modeluTa dziedzina zarządzania szybko się rozwija, ponieważ producenci sztucznej inteligencji konkurują ze sobą w celu optymalizacji jakości usług, zrównoważenia źródeł dochodów i konkurowania z otwartymi modelami sztucznej inteligencji.
Agenci sztucznej inteligencji wprowadzają zupełnie nową warstwę ryzyka kosztów tokenów.Eksperci z branży zalecają traktowanie agentów sztucznej inteligencji jak pracowników cyfrowych, z zespołami FinOps wdrażającymi rygorystyczne, długotrwałe monitorowanie wydatków w celu uniknięcia katastrof kosztowych.
Pekin Qianxing Jietong Technology Co., Ltd.
Sandy Yang, dyrektor ds. strategii globalnej
WhatsApp / WeChat: +86 13426366826
Email: yangyd@qianxingdata.com
Strona internetowa: www.qianxingdata.com/www.storagesserver.com
Skoncentruj się na biznesie:
Dystrybucja produktów ICT/Integracja systemów i usługi/Rozwiązania infrastrukturalne
Dzięki ponad 20-letniemu doświadczeniu w dystrybucji IT współpracujemy z wiodącymi światowymi markami w celu dostarczania niezawodnych produktów i profesjonalnych usług.
Używanie technologii do budowy inteligentnego świata•Twój zaufany dostawca usług produktów ICT!