Alloy Compute verdeelt AI-modellen over gpu’s en fpga’s voor snellere reacties

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute zegt een AI-inferentiesysteem te hebben ontwikkeld dat het rekenwerk van taalmodellen opsplitst tussen AMD-grafische chips en programmeerbare accelerators om de reactietijd terug te dringen.

Alloy Compute verdeelt inferentielasten

Het bedrijf beschreef het ontwerp op 31 juli als een “disaggregated architecture”: een ontkoppelde opzet waarin elke fase van de modeluitvoering wordt doorgestuurd naar de processor die daar het meest geschikt voor is. De meeste inferentiesystemen draaien alle stappen op één type chip. In het ontwerp van Alloy Compute verzorgen AMD-gpu’s de prompt-prefill en attention, terwijl fpga-accelerators verantwoordelijk zijn voor tokendecodering en mixture-of-experts-lagen.

Alloy Compute heeft nog geen benchmarkresultaten gepubliceerd en zegt dat het systeem nog wordt geïntegreerd terwijl vertraging (latency), throughput, energieverbruik en dataverkeer tussen beide chiptypen worden doorgemeten. Klantprogramma’s voor evaluatie zijn nog niet geopend.

Ook interessant: Bitcoin-ETF’s slikken 233,1 miljoen dollar op, één fonds levert het grootste deel

Nour de Vos koppelt naam aan latency-garantie

Oprichter en CEO Nour de Vos stelt dat prefill, attention en tokengeneratie andere eisen stellen aan de onderliggende hardware, waardoor draaien van een volledig model op één architectuur onbenutte capaciteit oplevert. Het bedrijf zegt bereid te zijn een garantie af te geven op eerste-token-responsen van minder dan 200 milliseconden, maar dan alleen voor implementaties die binnen vooraf vastgestelde grenzen blijven voor modellengte, inputlengte en gelijktijdige gebruikers. De eerste toepassingen richten zich op gequantiseerde Qwen-modellen.

De Vos stapte over naar AI-infrastructuur vanuit grootschalige cryptomining, waar marges afhangen van maximaal draaiende machines en minimale stroomkosten. Volgens hem heeft datzelfde systeemdenken – chips, geheugen, netwerk en software als één geheel benaderen – de basis gelegd voor dit ontwerp.

Lees ook: Polymarket-handelaren geven Spider-Man 91% kans op een historische première

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza is een ervaren financieel journalist met uitgebreide ervaring in het verslaan van cryptovaluta en blockchaintechnologie. Hij heeft bijgedragen aan Benzinga en Cointelegraph, naast andere publicaties, waar hij verslag uitbracht over opkomende trends, het regelgevend landschap en meer. Je vindt hem op Twitter als @murtuza_merc en op Telegram als mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer en risicowaarschuwing: De informatie in dit artikel is uitsluitend voor educatieve en informatieve doeleinden en is gebaseerd op de mening van de auteur. Het vormt geen financieel, investerings-, juridisch of belastingadvies. Cryptocurrency-assets zijn zeer volatiel en onderhevig aan hoog risico, inclusief het risico om uw gehele of een substantieel deel van uw investering te verliezen. Het handelen in of aanhouden van crypto-assets is mogelijk niet geschikt voor alle beleggers. De meningen die in dit artikel worden geuit zijn uitsluitend die van de auteur(s) en vertegenwoordigen niet het officiële beleid of standpunt van Yellow, haar oprichters of haar leidinggevenden. Voer altijd uw eigen grondig onderzoek uit (D.Y.O.R.) en raadpleeg een gelicentieerde financiële professional voordat u een investeringsbeslissing neemt.
Alloy Compute verdeelt AI-modellen over gpu’s en fpga’s voor snellere reacties | Yellow