Alloy Compute 宣称,其已打造出一套全新的 AI 推理系统,将大语言模型的不同计算阶段在 AMD GPU 与可编程加速卡之间拆分,以压缩响应时间。
分拆推理负载:GPU 负责注意力,FPGA 负责解码
公司在 7 月 31 日介绍称,这一方案属于“解耦式架构”:模型执行过程被拆解成多个阶段,再分别调度到最合适的处理器上运行。传统推理通常把所有步骤都压在同一类芯片上。
在 Alloy Compute 的设计中,AMD 图形处理器负责提示预填充(prefill)和注意力(attention)等环节,而 FPGA 加速器则承担 token 解码以及 mixture-of-experts(专家混合)层的计算。
目前,Alloy Compute 尚未公布具体的基准测试结果。公司表示,系统仍处在集成与调优阶段,正在测量双芯片之间的端到端延迟、吞吐量、能耗以及互联流量,尚未正式对外开放客户评测项目。
延伸阅读: 比特币 ETF 单日吸金 2.331 亿美元 一只基金包揽大头
Nour De Vos:为首字延迟挂出“200 毫秒”承诺
创始人兼首席执行官 Nour de Vos 表示,预填充、注意力计算与 token 生成在硬件资源上的需求截然不同,把整套模型强行塞进同一种架构,必然导致算力浪费。
公司对外称,在满足特定约束条件的前提下,愿意对客户承诺“首个 token 响应时间低于 200 毫秒”。这些条件包括:模型规模、输入长度以及并发度须控制在预设上限以内。目前的早期工作侧重于量化后的 Qwen 系列模型。
De Vos 在进入 AI 基础设施领域前,长期从事大规模加密货币挖矿业务,其盈利高度依赖于提升设备利用率并压降低电成本。他表示,这种从“系统工程”出发的思路——把芯片、内存、网络与软件视作一个整体去优化——直接影响了本次架构设计。






