Alloy Compute chia nhỏ mô hình AI trên GPU và FPGA để tăng tốc độ phản hồi

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute cho biết họ đã xây dựng một hệ thống suy luận AI cho mô hình ngôn ngữ, phân tán khối lượng xử lý giữa chip đồ họa AMD và các bộ tăng tốc lập trình được nhằm cắt giảm độ trễ phản hồi.

Alloy Compute chia tải suy luận giữa nhiều loại chip

Công ty mô tả thiết kế, công bố ngày 31/7, là một kiến trúc tách rời (disaggregated), trong đó từng giai đoạn thực thi của mô hình được gửi đến loại bộ xử lý phù hợp nhất. Phần lớn hệ thống suy luận hiện nay thường để mọi bước chạy trên cùng một loại chip.

Trong thiết kế của Alloy Compute, GPU AMD đảm nhiệm giai đoạn prefill prompt và các phép tính attention, trong khi các bộ tăng tốc FPGA xử lý phần giải mã token (token decoding) và các lớp mixture‑of‑experts.

Alloy Compute hiện chưa công bố kết quả benchmark và cho biết họ vẫn đang tích hợp hệ thống, đồng thời đo đạc độ trễ, thông lượng, mức tiêu thụ năng lượng và lưu lượng trao đổi giữa hai loại chip. Chương trình đánh giá thử nghiệm dành cho khách hàng vẫn chưa mở.

Xem thêm: Các quỹ ETF Bitcoin hút ròng 233,1 triệu USD khi một quỹ gần như “gánh” toàn bộ

Nour De Vos cam kết về độ trễ

Nhà sáng lập kiêm CEO Nour de Vos cho rằng các giai đoạn prefill, attention và sinh token có đặc thù phần cứng khác nhau, nên việc ép cả mô hình chạy trên một kiến trúc duy nhất dẫn tới lãng phí tài nguyên. Công ty khẳng định sẵn sàng cam kết thời gian trả token đầu tiên dưới 200 mili‑giây, nhưng chỉ với các triển khai tuân thủ chặt chẽ giới hạn về kích thước mô hình, độ dài đầu vào và mức độ đồng thời. Giai đoạn đầu, hệ thống được tối ưu cho các mô hình Qwen đã được lượng tử hóa.

De Vos bước sang lĩnh vực hạ tầng AI từ hoạt động đào tiền mã hóa quy mô lớn, nơi lợi nhuận phụ thuộc vào việc giữ cho máy luôn chạy tối đa và hóa đơn điện ở mức thấp nhất. Ông cho rằng tư duy ở cấp độ hệ thống đó – coi chip, bộ nhớ, mạng và phần mềm là một khối thống nhất – đã định hình nên kiến trúc hiện tại.

Bài kế tiếp: Nhà giao dịch trên Polymarket đánh giá Spider‑Man có 91% cơ hội lập kỳ tích khi ra mắt

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza là một nhà báo tài chính dày dạn kinh nghiệm với bề dày hoạt động trong lĩnh vực đưa tin về tiền điện tử và công nghệ blockchain. Anh đã cộng tác với Benzinga và Cointelegraph, cùng nhiều ấn phẩm khác, chuyên viết về các xu hướng mới nổi, bối cảnh quy định và nhiều chủ đề liên quan. Bạn có thể tìm anh ấy trên Twitter với tên @murtuza_merc và trên Telegram với tên mmerchant001. Công bố thông tin: Murtuza hiện nắm giữ ATOM, AKT, TIA, INJ và OSMO.

Tuyên bố miễn trừ trách nhiệm và cảnh báo rủi ro: Thông tin được cung cấp trong bài viết này chỉ dành cho mục đích giáo dục và thông tin, dựa trên ý kiến của tác giả. Nó không cấu thành lời khuyên tài chính, đầu tư, pháp lý hoặc thuế. Tài sản tiền mã hóa có tính biến động cao và chịu rủi ro cao, bao gồm rủi ro mất tất cả hoặc một phần lớn khoản đầu tư của bạn. Giao dịch hoặc nắm giữ tài sản crypto có thể không phù hợp với tất cả nhà đầu tư. Những quan điểm được bày tỏ trong bài viết này hoàn toàn là của (các) tác giả và không đại diện cho chính sách chính thức hoặc lập trường của Yellow, những người sáng lập hoặc giám đốc điều hành. Luôn tiến hành nghiên cứu kỹ lưỡng của riêng bạn (D.Y.O.R.) và tham khảo ý kiến chuyên gia tài chính được cấp phép trước khi đưa ra bất kỳ quyết định đầu tư nào.
Tin tức mới nhất
Xem tất cả tin tức
Alloy Compute chia nhỏ mô hình AI trên GPU và FPGA để tăng tốc độ phản hồi | Yellow