Alloy Compute 以 GPU 搭配 FPGA 分攤 AI 模型運算 號稱大幅壓低回應時間

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute 宣布打造出一套新型 AI 推論系統,透過在 AMD 顯示晶片與可程式化加速器(FPGA)之間分工, 將大型語言模型的不同運算階段拆開執行,以縮短整體回應延遲。

Alloy Compute 拆分推論工作負載

該公司在 7 月 31 日介紹,其設計屬於「解耦式架構」,也就是依照模型執行流程的不同階段,指派給最適合的處理器負責; 相較之下,多數現有推論系統會把所有階段都堆在同一類晶片上跑。

在這套架構中,AMD GPU 負責提示詞預填(prefill)與注意力機制(attention),而 FPGA 加速器則專門處理 token 解碼、 以及 mixture-of-experts(MoE,多專家)等層級,試圖藉由任務切分提高硬體使用效率。

Alloy Compute 目前尚未公布任何基準測試數據,並表示仍在整合整套系統,同步量測延遲、吞吐量、能耗以及兩種晶片間的資料流量。 客戶試用或評估計畫尚未正式開放。

延伸閱讀: 比特幣 ETF 單日吸金 2.331 億美元 單一基金幾乎包辦全部買盤

Nour de Vos 開出延遲保證條件

創辦人兼執行長 Nour de Vos 表示,預填、注意力與 token 產生三個階段,對硬體資源的需求大不相同, 若強迫整個模型都綁在同一種架構上運行,等於白白浪費大量算力與能耗。

公司對外稱,願意為特定部署情境提供「首個 token 回應低於 200 毫秒」的延遲保證,但前提是模型規模、輸入長度與同時併發數 都必須維持在事先約定的範圍內。目前初期支援的主要是量化後的 Qwen 系列模型。

de Vos 本人是從大規模加密貨幣挖礦轉戰 AI 基礎設施領域,在挖礦產業中,獲利高度依賴於設備維持高利用率與嚴控電費成本。 他表示,同樣以「系統層」思維來看待晶片、記憶體、網路與軟體的一體化設計,正是這次架構發想的核心。

下一則: Polymarket 交易員押注《蜘蛛人》新片 給出 91% 機率締造歷史級票房首映

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位資深的財經記者,在加密貨幣與區塊鏈技術領域擁有豐富的報導經驗。他曾為 Benzinga 和 Cointelegraph 等多家媒體撰稿,聚焦新興趨勢、監管環境等相關主題。你可以在 Twitter 上透過 @murtuza_merc 找到他,在 Telegram 上則是 mmerchant001。 Disclosure: Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免責聲明與風險警告: 本文提供的資訊僅供教育與參考用途,並基於作者觀點,不構成財務、投資、法律或稅務建議。 加密貨幣資產具有高度波動性並伴隨高風險,包括可能損失全部或大部分投資金額。買賣或持有加密資產可能並不適合所有投資者。 本文中所表達的觀點僅代表作者立場,不代表 Yellow、其創辦人或管理層的官方政策或意見。 請務必自行進行充分研究(D.Y.O.R.),並在做出任何投資決策前諮詢持牌金融專業人士。
Alloy Compute 以 GPU 搭配 FPGA 分攤 AI 模型運算 號稱大幅壓低回應時間 | Yellow