Alloy Compute توزّع نماذج الذكاء الاصطناعي بين معالجات الرسوميات وشرائح FPGA لردود أسرع

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

تقول شركة Alloy Compute إنها طوّرت نظام استدلال لنماذج الذكاء الاصطناعي يقسّم عبء عمل النماذج اللغوية بين معالجات الرسوميات من AMD والمعالجات القابلة للبرمجة، في محاولة لتقليص زمن الاستجابة.

توزيع مهام الاستدلال في Alloy Compute

عرضت الشركة في 31 يوليو تصميماً تصفه بأنه «هندسة مفككة»، حيث تُرسل كل مرحلة من مراحل تنفيذ النموذج إلى المعالج الأنسب لها، بدلاً من تشغيل جميع المراحل على نوع واحد من الشرائح كما تفعل أغلب أنظمة الاستدلال الحالية. تتولى معالجات AMD الرسومية مرحلة تهيئة الطلب (prefill) وحسابات الانتباه (attention)، بينما تتكفّل مسرّعات FPGA بمهام توليد الرموز (token decoding) وطبقات «مزيج الخبراء» (mixture-of-experts).

لم تنشر Alloy Compute حتى الآن أي نتائج لاختبارات معيارية، وتقول إنها ما زالت في مرحلة دمج النظام وقياس زمن الاستجابة، ومعدل الإنتاجية، واستهلاك الطاقة، وحجم حركة البيانات بين الشريحتين. كما لم تُفتح بعد برامج التجربة والتقييم للعملاء.

اقرأ أيضاً: صناديق بتكوين المتداولة تستقطب 233.1 مليون دولار مع استحواذ صندوق واحد على الحصة الأكبر

نور دو فوس يتعهد بسقف لزمن الاستجابة

يؤكد المؤسس والرئيس التنفيذي نور دو فوس أن مراحل التهيئة، والانتباه، وتوليد الرموز تفرض متطلبات مختلفة على العتاد، وأن تشغيل النموذج كاملاً على بنية واحدة يبدّد الكثير من السعة المتاحة. وتقول الشركة إنها مستعدة لتقديم تعهّد بزمن استجابة لأوّل رمز يقل عن 200 مللي ثانية، لكن فقط في الإطلاقات التي تلتزم بقيود محددة على حجم النماذج، وطول المدخلات، ومستويات التوازي في عدد الطلبات المتزامنة. العمل الأولي يركّز على نماذج Qwen مكبّرة الدقة (quantized).

جاء انتقال دو فوس إلى بنية تحتية للذكاء الاصطناعي من عالم تعدين العملات المشفّرة على نطاق واسع، حيث تعتمد الربحية على إبقاء الآلات في حالة تشغيل مستمر مع خفض فواتير الكهرباء إلى الحد الأدنى. ويقول إن التفكير على مستوى المنظومة ككل، عبر التعامل مع الشرائح والذاكرة والشبكات والبرمجيات كوحدة واحدة، كان أساسياً في صياغة هذا التصميم.

اقرأ التالي: متداولو Polymarket يمنحون «سبايدر مان» فرصة 91% لظهور تاريخي

Murtuza Merchant profile photo

Murtuza Merchant

مرتضى صحفي مخضرم في مجال المالية يتمتع بخبرة واسعة في تغطية العملات المشفرة وتقنية البلوكشين. وقد ساهم بكتاباته في Benzinga وCointelegraph، إضافة إلى عدد من المنصات الأخرى، حيث يغطي الاتجاهات الناشئة والمشهد التنظيمي وغير ذلك. يمكن العثور عليه عبر حسابه @murtuza_merc على تويتر، واسم المستخدم mmerchant001 على تيليغرام. الإفصاح: يحتفظ مرتضى بعملات ATOM وAKT وTIA وINJ وOSMO.

إخلاء المسؤولية وتحذير المخاطر: المعلومات المقدمة في هذا المقال مخصصة للأغراض التعليمية والإعلامية فقط وتستند إلى رأي المؤلف. وهي لا تشكل مشورة مالية أو استثمارية أو قانونية أو ضريبية. أصول العملات المشفرة شديدة التقلب وتخضع لمخاطر عالية، بما في ذلك خطر فقدان كامل أو جزء كبير من استثمارك. قد لا يكون تداول أو حيازة الأصول المشفرة مناسباً لجميع المستثمرين. الآراء المعبر عنها في هذا المقال هي آراء المؤلف (المؤلفين) فقط ولا تمثل السياسة أو الموقف الرسمي لشركة Yellow أو مؤسسيها أو مديريها التنفيذيين. قم دائماً بإجراء بحثك الشامل بنفسك (D.Y.O.R.) واستشر مختصاً مالياً مرخصاً قبل اتخاذ أي قرار استثماري.
آخر الأخبار
عرض جميع الأخبار
أخبار ذات صلة
مقالات البحث ذات الصلة
مقالات التعلم ذات الصلة
Alloy Compute توزّع نماذج الذكاء الاصطناعي بين معالجات الرسوميات وشرائح FPGA لردود أسرع | Yellow