Alloy Compute dzieli modele AI między GPU i FPGA, by przyspieszyć odpowiedzi

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute poinformował, że zbudował system inferencji AI, który dzieli pracę modelu językowego między karty graficzne AMD a programowalne akceleratory FPGA, aby skrócić czas odpowiedzi.

Alloy Compute dzieli obciążenia inferencyjne

Spółka opisała 31 lipca swoją architekturę jako „rozproszoną”: poszczególne fazy działania modelu są kierowane do procesora najlepiej dopasowanego do danego etapu. Standardowe systemy inferencji zwykle obsługują wszystkie kroki na jednym typie układu.

W rozwiązaniu Alloy Compute procesory graficzne AMD odpowiadają za prefill promptu i mechanizmy uwagi (attention), natomiast akceleratory FPGA zajmują się dekodowaniem tokenów oraz warstwami mixture‑of‑experts.

Alloy Compute nie opublikował jeszcze wyników testów. Spółka podkreśla, że wciąż integruje system i równolegle mierzy opóźnienia, przepustowość, zużycie energii oraz ruch pomiędzy dwoma typami układów. Programy pilotażowe dla klientów nie zostały jeszcze uruchomione.

Zobacz także: Fundusze ETF na Bitcoina przyciągają 233,1 mln dol. dzięki jednemu głównemu funduszowi

Nour De Vos firmuje gwarancję niskich opóźnień

Założyciel i prezes Nour de Vos podkreśla, że prefill, attention i generowanie tokenów stawiają przed sprzętem różne wymagania, więc uruchamianie całego modelu na jednej architekturze prowadzi do marnowania zasobów. Spółka deklaruje gotowość do kontraktowego zagwarantowania czasu uzyskania pierwszego tokena poniżej 200 milisekund, ale wyłącznie w wdrożeniach, które mieszczą się w określonych limitach wielkości modeli, długości wejścia oraz poziomu równoległych żądań. Pierwsze implementacje obejmują skwantyzowane modele Qwen.

De Vos wszedł w infrastrukturę AI z sektora wielkoskalowego miningu kryptowalut, gdzie marże zależą od maksymalnego wykorzystania maszyn przy minimalnych rachunkach za energię. Jak podkreśla, podobne myślenie systemowe – traktujące chipy, pamięć, sieć i oprogramowanie jako jeden organizm – ukształtowało projekt tej architektury.

Przeczytaj następne: Traderzy Polymarket dają Spider‑Manowi 91% szans na historyczny debiut

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza jest doświadczonym dziennikarzem finansowym ze znacznym doświadczeniem w relacjonowaniu tematyki kryptowalut i technologii blockchain. Współpracował z Benzinga i Cointelegraph, a także innymi redakcjami, pisząc o nowych trendach, otoczeniu regulacyjnym i wielu innych kwestiach. Można go znaleźć jako @murtuza_merc na Twitterze oraz mmerchant001 na Telegramie. Informacja: Murtuza posiada ATOM, AKT, TIA, INJ i OSMO.

Zastrzeżenie i ostrzeżenie o ryzyku: Informacje zawarte w tym artykule służą wyłącznie celom edukacyjnym i informacyjnym i opierają się na opinii autora. Nie stanowią one porad finansowych, inwestycyjnych, prawnych czy podatkowych. Aktywa kryptowalutowe są bardzo zmienne i podlegają wysokiemu ryzyku, w tym ryzyku utraty całości lub znacznej części Twojej inwestycji. Handel lub posiadanie aktywów krypto może nie być odpowiednie dla wszystkich inwestorów. Poglądy wyrażone w tym artykule są wyłącznie poglądami autora/autorów i nie reprezentują oficjalnej polityki lub stanowiska Yellow, jej założycieli lub dyrektorów. Zawsze przeprowadź własne dokładne badania (D.Y.O.R.) i skonsultuj się z licencjonowanym specjalistą finansowym przed podjęciem jakiejkolwiek decyzji inwestycyjnej.
Najnowsze wiadomości
Pokaż wszystkie wiadomości
Alloy Compute dzieli modele AI między GPU i FPGA, by przyspieszyć odpowiedzi | Yellow