Alloy Compute 将 AI 模型拆分部署于 GPU 与 FPGA,加速响应时间

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute 宣称,其已打造出一套全新的 AI 推理系统,将大语言模型的不同计算阶段在 AMD GPU 与可编程加速卡之间拆分,以压缩响应时间。

分拆推理负载:GPU 负责注意力,FPGA 负责解码

公司在 7 月 31 日介绍称,这一方案属于“解耦式架构”:模型执行过程被拆解成多个阶段,再分别调度到最合适的处理器上运行。传统推理通常把所有步骤都压在同一类芯片上。

在 Alloy Compute 的设计中,AMD 图形处理器负责提示预填充(prefill)和注意力(attention)等环节,而 FPGA 加速器则承担 token 解码以及 mixture-of-experts(专家混合)层的计算。

目前,Alloy Compute 尚未公布具体的基准测试结果。公司表示,系统仍处在集成与调优阶段,正在测量双芯片之间的端到端延迟、吞吐量、能耗以及互联流量,尚未正式对外开放客户评测项目。

延伸阅读: 比特币 ETF 单日吸金 2.331 亿美元 一只基金包揽大头

Nour De Vos:为首字延迟挂出“200 毫秒”承诺

创始人兼首席执行官 Nour de Vos 表示,预填充、注意力计算与 token 生成在硬件资源上的需求截然不同,把整套模型强行塞进同一种架构,必然导致算力浪费。

公司对外称,在满足特定约束条件的前提下,愿意对客户承诺“首个 token 响应时间低于 200 毫秒”。这些条件包括:模型规模、输入长度以及并发度须控制在预设上限以内。目前的早期工作侧重于量化后的 Qwen 系列模型。

De Vos 在进入 AI 基础设施领域前,长期从事大规模加密货币挖矿业务,其盈利高度依赖于提升设备利用率并压降低电成本。他表示,这种从“系统工程”出发的思路——把芯片、内存、网络与软件视作一个整体去优化——直接影响了本次架构设计。

下一篇: Polymarket 交易员押注《蜘蛛侠》新片首映创纪录 概率高达 91%

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza 是一位经验丰富的财经记者,在报道加密货币和区块链技术方面具有丰富经验。他曾为 Benzinga 和 Cointelegraph 等多家媒体撰稿,报道新兴趋势、监管环境等内容。你可以在 Twitter 上通过 @murtuza_merc 和在 Telegram 上通过 mmerchant001 找到他。 披露:Murtuza 持有 ATOM、AKT、TIA、INJ 和 OSMO。

免责声明和风险警告: 本文提供的信息仅用于教育和信息目的,基于作者的意见。它不构成财务、投资、法律或税务建议。 加密货币资产具有高度波动性并面临高风险,包括失去全部或大部分投资的风险。交易或持有加密资产可能不适合所有投资者。 本文表达的观点仅为作者的观点,不代表Yellow、其创始人或高管的官方政策或立场。 在做出任何投资决定之前,请务必进行自己的全面研究(D.Y.O.R.)并咨询持牌金融专业人士。
最新新闻
查看所有新闻