Alloy Compute 宣布打造出一套新型 AI 推論系統,透過在 AMD 顯示晶片與可程式化加速器(FPGA)之間分工, 將大型語言模型的不同運算階段拆開執行,以縮短整體回應延遲。
Alloy Compute 拆分推論工作負載
該公司在 7 月 31 日介紹,其設計屬於「解耦式架構」,也就是依照模型執行流程的不同階段,指派給最適合的處理器負責; 相較之下,多數現有推論系統會把所有階段都堆在同一類晶片上跑。
在這套架構中,AMD GPU 負責提示詞預填(prefill)與注意力機制(attention),而 FPGA 加速器則專門處理 token 解碼、 以及 mixture-of-experts(MoE,多專家)等層級,試圖藉由任務切分提高硬體使用效率。
Alloy Compute 目前尚未公布任何基準測試數據,並表示仍在整合整套系統,同步量測延遲、吞吐量、能耗以及兩種晶片間的資料流量。 客戶試用或評估計畫尚未正式開放。
延伸閱讀: 比特幣 ETF 單日吸金 2.331 億美元 單一基金幾乎包辦全部買盤
Nour de Vos 開出延遲保證條件
創辦人兼執行長 Nour de Vos 表示,預填、注意力與 token 產生三個階段,對硬體資源的需求大不相同, 若強迫整個模型都綁在同一種架構上運行,等於白白浪費大量算力與能耗。
公司對外稱,願意為特定部署情境提供「首個 token 回應低於 200 毫秒」的延遲保證,但前提是模型規模、輸入長度與同時併發數 都必須維持在事先約定的範圍內。目前初期支援的主要是量化後的 Qwen 系列模型。
de Vos 本人是從大規模加密貨幣挖礦轉戰 AI 基礎設施領域,在挖礦產業中,獲利高度依賴於設備維持高利用率與嚴控電費成本。 他表示,同樣以「系統層」思維來看待晶片、記憶體、網路與軟體的一體化設計,正是這次架構發想的核心。






