Alloy Compute cho biết họ đã xây dựng một hệ thống suy luận AI cho mô hình ngôn ngữ, phân tán khối lượng xử lý giữa chip đồ họa AMD và các bộ tăng tốc lập trình được nhằm cắt giảm độ trễ phản hồi.
Alloy Compute chia tải suy luận giữa nhiều loại chip
Công ty mô tả thiết kế, công bố ngày 31/7, là một kiến trúc tách rời (disaggregated), trong đó từng giai đoạn thực thi của mô hình được gửi đến loại bộ xử lý phù hợp nhất. Phần lớn hệ thống suy luận hiện nay thường để mọi bước chạy trên cùng một loại chip.
Trong thiết kế của Alloy Compute, GPU AMD đảm nhiệm giai đoạn prefill prompt và các phép tính attention, trong khi các bộ tăng tốc FPGA xử lý phần giải mã token (token decoding) và các lớp mixture‑of‑experts.
Alloy Compute hiện chưa công bố kết quả benchmark và cho biết họ vẫn đang tích hợp hệ thống, đồng thời đo đạc độ trễ, thông lượng, mức tiêu thụ năng lượng và lưu lượng trao đổi giữa hai loại chip. Chương trình đánh giá thử nghiệm dành cho khách hàng vẫn chưa mở.
Xem thêm: Các quỹ ETF Bitcoin hút ròng 233,1 triệu USD khi một quỹ gần như “gánh” toàn bộ
Nour De Vos cam kết về độ trễ
Nhà sáng lập kiêm CEO Nour de Vos cho rằng các giai đoạn prefill, attention và sinh token có đặc thù phần cứng khác nhau, nên việc ép cả mô hình chạy trên một kiến trúc duy nhất dẫn tới lãng phí tài nguyên. Công ty khẳng định sẵn sàng cam kết thời gian trả token đầu tiên dưới 200 mili‑giây, nhưng chỉ với các triển khai tuân thủ chặt chẽ giới hạn về kích thước mô hình, độ dài đầu vào và mức độ đồng thời. Giai đoạn đầu, hệ thống được tối ưu cho các mô hình Qwen đã được lượng tử hóa.
De Vos bước sang lĩnh vực hạ tầng AI từ hoạt động đào tiền mã hóa quy mô lớn, nơi lợi nhuận phụ thuộc vào việc giữ cho máy luôn chạy tối đa và hóa đơn điện ở mức thấp nhất. Ông cho rằng tư duy ở cấp độ hệ thống đó – coi chip, bộ nhớ, mạng và phần mềm là một khối thống nhất – đã định hình nên kiến trúc hiện tại.
Bài kế tiếp: Nhà giao dịch trên Polymarket đánh giá Spider‑Man có 91% cơ hội lập kỳ tích khi ra mắt






