Alloy Compute zegt een AI-inferentiesysteem te hebben ontwikkeld dat het rekenwerk van taalmodellen opsplitst tussen AMD-grafische chips en programmeerbare accelerators om de reactietijd terug te dringen.
Alloy Compute verdeelt inferentielasten
Het bedrijf beschreef het ontwerp op 31 juli als een “disaggregated architecture”: een ontkoppelde opzet waarin elke fase van de modeluitvoering wordt doorgestuurd naar de processor die daar het meest geschikt voor is. De meeste inferentiesystemen draaien alle stappen op één type chip. In het ontwerp van Alloy Compute verzorgen AMD-gpu’s de prompt-prefill en attention, terwijl fpga-accelerators verantwoordelijk zijn voor tokendecodering en mixture-of-experts-lagen.
Alloy Compute heeft nog geen benchmarkresultaten gepubliceerd en zegt dat het systeem nog wordt geïntegreerd terwijl vertraging (latency), throughput, energieverbruik en dataverkeer tussen beide chiptypen worden doorgemeten. Klantprogramma’s voor evaluatie zijn nog niet geopend.
Ook interessant: Bitcoin-ETF’s slikken 233,1 miljoen dollar op, één fonds levert het grootste deel
Nour de Vos koppelt naam aan latency-garantie
Oprichter en CEO Nour de Vos stelt dat prefill, attention en tokengeneratie andere eisen stellen aan de onderliggende hardware, waardoor draaien van een volledig model op één architectuur onbenutte capaciteit oplevert. Het bedrijf zegt bereid te zijn een garantie af te geven op eerste-token-responsen van minder dan 200 milliseconden, maar dan alleen voor implementaties die binnen vooraf vastgestelde grenzen blijven voor modellengte, inputlengte en gelijktijdige gebruikers. De eerste toepassingen richten zich op gequantiseerde Qwen-modellen.
De Vos stapte over naar AI-infrastructuur vanuit grootschalige cryptomining, waar marges afhangen van maximaal draaiende machines en minimale stroomkosten. Volgens hem heeft datzelfde systeemdenken – chips, geheugen, netwerk en software als één geheel benaderen – de basis gelegd voor dit ontwerp.
Lees ook: Polymarket-handelaren geven Spider-Man 91% kans op een historische première






