Alloy Compute 以混合 GPU 與 FPGA 加速 AI 模型推理 回應時間主攻 200 毫秒內

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute 指出,已打造一套 AI 推理系統,將大型語言模型的運算工作,拆分到 AMD 圖像處理器(GPU)及可編程加速器(FPGA)之間,藉此壓縮回應延遲。

Alloy Compute 拆分推理負載

公司在 7 月 31 日披露設計細節,形容新方案屬「解耦架構」(disaggregated architecture),會按模型執行的不同階段,分派至最合適的處理器。傳統推理多數在同一類晶片上完成所有步驟;新設計則由 AMD GPU 負責 prompt 預填(prefill)及注意力機制(attention),而由 FPGA 加速器處理代幣解碼(token decoding)及 mixture-of-experts(MoE)層。

Alloy Compute 暫未公布任何基準測試成績,強調系統仍在整合調校中,現階段正量度延遲、吞吐量、能耗,以及兩類晶片之間的數據流量。面向客戶的評估或試用計劃亦尚未開放。

延伸閱讀:比特幣 ETF 單日吸納 2.331 億美元 幾乎全由一隻基金貢獻

Nour De Vos 提出延遲上限承諾

創辦人兼行政總裁 Nour de Vos 表示,預填、注意力計算與代幣生成對硬件的要求各不相同,將整個模型鎖死在單一架構上,等同浪費部分算力與資源。公司稱,有能力在特定條件下提供服務級別協議(SLA)式承諾:首個代幣回應時間低於 200 毫秒,但只適用於在模型規模、輸入長度及併發量等方面受嚴格限制的部署。現階段主要針對量化後的 Qwen 模型作優化。

De Vos 早年從事大規模加密貨幣挖礦,當時利潤高度取決於設備利用率及電力成本控制。他指出,這種以整個系統為單位、將晶片、記憶體、網絡與軟件一體化考量的思維,直接影響了今次 AI 基礎設施的設計取向。

下一篇:Polymarket 交易員押注《蜘蛛俠》新作有 91% 機會創歷史紀錄

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的採訪與報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,專注報導新興趨勢、監管環境等主題。你可以在 Twitter 上透過 @murtuza_merc,或在 Telegram 上透過 mmerchant001 找到他。 Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

免責聲明及風險提示: 本文資訊僅供教育與參考之用,並基於作者意見,並不構成金融、投資、法律或稅務建議。 加密貨幣資產具高度波動性並伴隨高風險,可能導致投資大幅虧損或全部損失,並非適合所有投資者。 文章內容僅代表作者觀點,不代表 Yellow、創辦人或管理層立場。 投資前請務必自行徹底研究(D.Y.O.R.),並諮詢持牌金融專業人士。
Alloy Compute 以混合 GPU 與 FPGA 加速 AI 模型推理 回應時間主攻 200 毫秒內 | Yellow