Alloy Compute ผสาน GPU และ FPGA แบ่งงานโมเดล AI ดันเวลาตอบกลับให้เร็วขึ้น

Murtuza Merchant
Murtuza Merchant1 ชั่วโมงที่แล้ว
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute เผยว่าได้พัฒนาระบบอนุมานผล (inference) สำหรับโมเดลภาษา ที่กระจายงานระหว่างชิปกราฟิก AMD และตัวเร่งความเร็วแบบปรับแต่งได้ (FPGA) เพื่อกดเวลาในการตอบกลับให้สั้นลง

Alloy Compute แยกภาระงานอนุมานผลระหว่างชิป

บริษัทอธิบายเมื่อวันที่ 31 ก.ค. ว่าโครงสร้างดังกล่าวเป็น “สถาปัตยกรรมแบบแยกส่วน” (disaggregated architecture) คือส่งแต่ละช่วงของการรันโมเดลไปยังโปรเซสเซอร์ที่เหมาะสมที่สุด โดยระบบอนุมานส่วนใหญ่ในตลาดยังคงรันทุกสเตจบนชิปประเภทเดียว

ในดีไซน์นี้ ชิปกราฟิก AMD รับหน้าที่งาน prefill และ attention ของพรอมต์ ขณะที่ตัวเร่งความเร็ว FPGA ดูแลขั้นตอนถอดรหัสโทเคน (token decoding) และเลเยอร์แบบ mixture-of-experts (MoE)

Alloy Compute ยังไม่ได้เผยผลทดสอบประสิทธิภาพอย่างเป็นทางการ โดยระบุว่ากำลังอยู่ระหว่างอินทิเกรตระบบและวัดค่าความหน่วง (latency) ปริมาณงาน (throughput) การใช้พลังงาน และทราฟฟิกระหว่างชิปทั้งสองตระกูล นอกจากนี้ โปรแกรมให้ลูกค้าทดสอบใช้งานจริง (customer evaluation) ยังไม่เปิดตัว

อ่านเพิ่มเติม: กองทุน Bitcoin ETF ดูดเงินไหลเข้า 233.1 ล้านดอลลาร์ จากที่มีกองทุนเดียวเป็นหลัก

Nour De Vos หนุนการันตีค่า Latency

ผู้ก่อตั้งและซีอีโอ Nour de Vos ระบุว่า ขั้น prefill, attention และการสร้างโทเคน ต่างต้องการทรัพยากรฮาร์ดแวร์คนละแบบ การรันโมเดลทั้งก้อนบนสถาปัตยกรรมเดียวจึงทำให้ศักยภาพบางส่วนถูกทิ้งให้ว่างเปล่า

บริษัทระบุว่าพร้อม “การันตี” เวลาโทเคนแรกต่ำกว่า 200 มิลลิวินาที แต่เฉพาะดีพลอยเมนต์ที่อยู่ในกรอบข้อจำกัดที่กำหนด เช่น ขนาดโมเดล ความยาวอินพุต และจำนวนงานที่รันพร้อมกัน โดยงานระยะแรกโฟกัสที่โมเดล Qwen เวอร์ชัน quantized

De Vos ขยับจากธุรกิจขุดคริปโตขนาดใหญ่ มาสู่โครงสร้างพื้นฐาน AI โดยประสบการณ์จากเหมืองคริปโตที่ต้องรักษาเครื่องให้ทำงานเต็มประสิทธิภาพควบคู่กับบิลค่าไฟที่ต่ำที่สุด ทำให้เขาเน้นมุมมองเชิงระบบเป็นหลัก คือมองชิป หน่วยความจำ ระบบเครือข่าย และซอฟต์แวร์เป็นองค์รวมชุดเดียวกัน ซึ่งเป็นแนวคิดพื้นฐานของดีไซน์นี้

อ่านต่อ: เทรดเดอร์ Polymarket ให้โอกาส Spider-Man เปิดตัวสุดประวัติศาสตร์สูงถึง 91%

Murtuza Merchant profile photo

Murtuza Merchant

มูร์ตูซาเป็นนักข่าวการเงินมากประสบการณ์ที่มีความเชี่ยวชาญในการรายงานข่าวเกี่ยวกับสกุลเงินดิจิทัลและเทคโนโลยีบล็อกเชน เขาเคยเขียนบทความให้กับ Benzinga และ Cointelegraph รวมถึงสื่อสิ่งพิมพ์อื่น ๆ อีกมากมาย โดยมุ่งเน้นการรายงานเกี่ยวกับเทรนด์ที่เกิดขึ้นใหม่ ภูมิทัศน์ด้านกฎระเบียบ และประเด็นอื่น ๆ ที่เกี่ยวข้อง คุณสามารถติดตามเขาได้ที่ @murtuza_merc บน Twitter และ mmerchant001 บน Telegram การเปิดเผยข้อมูล: มูร์ตูซาถือครองเหรียญ ATOM, AKT, TIA, INJ และ OSMO

ข้อจำกัดความรับผิดชอบและคำเตือนความเสี่ยง: ข้อมูลที่ให้ไว้ในบทความนี้มีไว้เพื่อการศึกษาและการให้ข้อมูลเท่านั้น และอิงตามความเห็นของผู้เขียน ไม่ถือเป็นคำแนะนำทางการเงิน การลงทุน กฎหมาย หรือภาษี สินทรัพย์คริปโตมีความผันผวนสูงและมีความเสี่ยงสูง รวมถึงความเสี่ยงในการสูญเสียเงินลงทุนทั้งหมดหรือส่วนใหญ่ การซื้อขายหรือการถือครองสินทรัพย์คริปโตอาจไม่เหมาะสมสำหรับนักลงทุนทุกคน ความเห็นที่แสดงในบทความนี้เป็นของผู้เขียนเท่านั้น และไม่ได้แทนนโยบายหรือตำแหน่งอย่างเป็นทางการของ Yellow ผู้ก่อตั้ง หรือผู้บริหาร ควรทำการวิจัยอย่างละเอียดด้วยตนเอง (D.Y.O.R.) และปรึกษาผู้เชี่ยวชาญทางการเงินที่ได้รับใบอนุญาตก่อนตัดสินใจลงทุนใดๆ เสมอ
ข่าวล่าสุด
แสดงข่าวทั้งหมด
ข่าวที่เกี่ยวข้อง
บทความวิจัยที่เกี่ยวข้อง
บทความการเรียนรู้ที่เกี่ยวข้อง
Alloy Compute ผสาน GPU และ FPGA แบ่งงานโมเดล AI ดันเวลาตอบกลับให้เร็วขึ้น | Yellow