Alloy Compute divide i modelli di AI tra GPU e FPGA per risposte più rapide

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute afferma di aver sviluppato un sistema di inferenza AI che ripartisce il lavoro dei modelli linguistici tra schede grafiche AMD e acceleratori programmabili, così da ridurre drasticamente i tempi di risposta.

Alloy Compute spezza i carichi di inferenza

L’azienda, illustrando il progetto il 31 luglio, parla di un’architettura disaggregata: ogni fase dell’esecuzione del modello viene instradata verso il processore più adatto. La maggior parte dei sistemi di inferenza oggi esegue invece tutte le fasi sullo stesso tipo di chip. Nel caso di Alloy Compute, le GPU AMD gestiscono prefill del prompt e attenzione, mentre gli acceleratori FPGA si occupano del decoding dei token e dei livelli mixture-of-experts.

Alloy Compute non ha ancora pubblicato risultati di benchmark e spiega di essere nella fase di integrazione, durante la quale sta misurando latenza, throughput, consumi energetici e traffico tra i due tipi di chip. I programmi di valutazione per i clienti non sono ancora stati avviati.

Da leggere anche: Gli ETF su Bitcoin assorbono 233,1 milioni di dollari, con un singolo fondo a fare la parte del leone

Nour De Vos punta su una garanzia di latenza

Il fondatore e amministratore delegato Nour de Vos osserva che prefill, attenzione e generazione dei token impongono requisiti molto diversi all’hardware; far girare l’intero modello su un’unica architettura significa quindi sprecare capacità. La società si dice pronta a garantire risposte del primo token sotto i 200 millisecondi, ma solo per implementazioni che rispettano limiti predefiniti su dimensione dei modelli, lunghezza dell’input e livello di concorrenza. I primi test riguardano modelli Qwen quantizzati.

De Vos arriva all’infrastruttura AI dal mining di criptovalute su larga scala, un settore in cui i margini dipendono dal mantenere le macchine sempre operative e dal contenere le bollette energetiche. Ha spiegato che lo stesso approccio “di sistema”, che considera chip, memoria, rete e software come un unico insieme, è alla base di questo design.

Prossimo articolo: I trader di Polymarket attribuiscono a Spider-Man il 91% di probabilità di un debutto da record

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza è un giornalista finanziario esperto con una vasta esperienza nella copertura di criptovalute e tecnologia blockchain. Ha collaborato con Benzinga e Cointelegraph, tra le altre testate, riportando sulle tendenze emergenti, sul quadro normativo e altro ancora. Puoi trovarlo su Twitter come @murtuza_merc e su Telegram come mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Disclaimer e avvertenza sui rischi: Le informazioni fornite in questo articolo sono solo per scopi educativi e informativi e sono basate sull'opinione dell'autore. Non costituiscono consulenza finanziaria, di investimento, legale o fiscale. Gli asset di criptovaluta sono altamente volatili e soggetti ad alto rischio, incluso il rischio di perdere tutto o una parte sostanziale del tuo investimento. Il trading o il possesso di asset crypto potrebbe non essere adatto a tutti gli investitori. Le opinioni espresse in questo articolo sono esclusivamente quelle dell'autore/autori e non rappresentano la politica ufficiale o la posizione di Yellow, dei suoi fondatori o dei suoi dirigenti. Conduci sempre la tua ricerca approfondita (D.Y.O.R.) e consulta un professionista finanziario autorizzato prima di prendere qualsiasi decisione di investimento.
Alloy Compute divide i modelli di AI tra GPU e FPGA per risposte più rapide | Yellow