Alloy Compute 指出,已打造一套 AI 推理系統,將大型語言模型的運算工作,拆分到 AMD 圖像處理器(GPU)及可編程加速器(FPGA)之間,藉此壓縮回應延遲。
Alloy Compute 拆分推理負載
公司在 7 月 31 日披露設計細節,形容新方案屬「解耦架構」(disaggregated architecture),會按模型執行的不同階段,分派至最合適的處理器。傳統推理多數在同一類晶片上完成所有步驟;新設計則由 AMD GPU 負責 prompt 預填(prefill)及注意力機制(attention),而由 FPGA 加速器處理代幣解碼(token decoding)及 mixture-of-experts(MoE)層。
Alloy Compute 暫未公布任何基準測試成績,強調系統仍在整合調校中,現階段正量度延遲、吞吐量、能耗,以及兩類晶片之間的數據流量。面向客戶的評估或試用計劃亦尚未開放。
延伸閱讀:比特幣 ETF 單日吸納 2.331 億美元 幾乎全由一隻基金貢獻
Nour De Vos 提出延遲上限承諾
創辦人兼行政總裁 Nour de Vos 表示,預填、注意力計算與代幣生成對硬件的要求各不相同,將整個模型鎖死在單一架構上,等同浪費部分算力與資源。公司稱,有能力在特定條件下提供服務級別協議(SLA)式承諾:首個代幣回應時間低於 200 毫秒,但只適用於在模型規模、輸入長度及併發量等方面受嚴格限制的部署。現階段主要針對量化後的 Qwen 模型作優化。
De Vos 早年從事大規模加密貨幣挖礦,當時利潤高度取決於設備利用率及電力成本控制。他指出,這種以整個系統為單位、將晶片、記憶體、網絡與軟件一體化考量的思維,直接影響了今次 AI 基礎設施的設計取向。






