Alloy Compute, Daha Hızlı Yanıtlar İçin Yapay Zekâ Modellerini GPU ve FPGA’lere Bölüyor

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute, dil modeli çıkarım sürecini AMD grafik işlemciler ile programlanabilir hızlandırıcılar arasında paylaştırarak yanıt sürelerini kısalttığını söylüyor.

Alloy Compute Çıkarım Yükünü Bölüyor

Şirket, 31 Temmuz’da paylaştığı tasarımı “dağıtık bir mimari” olarak tanımlıyor: Model çalışmasının her aşaması, o işe en uygun işlemciye yönlendiriliyor. Piyasadaki çoğu çıkarım sistemi ise tüm aşamaları tek tip yongada çalıştırıyor. Bu yaklaşımda istem (prompt) ön doldurma ve dikkat (attention) hesapları AMD grafik işlemcilere, token çözme (decoding) ve uzman karışımı (mixture‑of‑experts) katmanları ise FPGA tabanlı hızlandırıcılara bırakılıyor.

Alloy Compute henüz resmi performans sonuçları yayımlamadı. Şirket, sistemi entegre ederken iki yonga arasındaki gecikme, çıktı hacmi, enerji tüketimi ve trafik akışını hâlâ ölçtüğünü belirtiyor. Müşterilere dönük değerlendirme programları ise henüz başlamadı.

Ayrıca Oku: Bitcoin ETF’leri 233,1 Milyon Dolar Çekerken Bunun Büyük Bölümü Tek Bir Fona Ait

Nour de Vos Gecikme Taahhüdünün Arkasında

Kurucu ve Üst Düzey Yönetici Nour de Vos, ön doldurma, dikkat hesapları ve token üretiminin donanım üzerinde birbirinden farklı talepler yarattığını, bu yüzden tüm modeli tek bir mimaride çalıştırmanın kapasite israfına yol açtığını savunuyor. Şirket, model boyutu, girdi uzunluğu ve eşzamanlı oturum sayısı için belirlenen sınırlar içinde kalınması koşuluyla ilk token yanıtını 200 milisaniyenin altında tutmayı taahhüt etmeye hazır olduğunu bildiriyor. İlk uygulamalar, quantize edilmiş Qwen modelleri üzerinde yürütülüyor.

De Vos, yapay zekâ altyapısına, kârlılığın makineleri sürekli çalışır tutmaya ve elektrik faturasını aşağı çekmeye bağlı olduğu ölçekli kripto para madenciliği dünyasından geldi. Kendisinin, yongaları, belleği, ağ altyapısını ve yazılım katmanını tek bir sistem olarak ele alan bu bütüncül yaklaşımının, söz konusu mimarinin şekillenmesinde belirleyici olduğu ifade ediliyor.

Sıradaki Haber: Polymarket Yatırımcıları Örümcek-Adam’a Tarihi Bir Açılış İçin %91 Şans Veriyor

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza, kripto paralar ve blokzincir teknolojisi üzerine haber yapma konusunda kapsamlı deneyime sahip, kıdemli bir finans muhabiridir. Ortaya çıkan trendler, düzenleyici ortam ve daha fazlası hakkında haber yaparak, Benzinga ve Cointelegraph başta olmak üzere çeşitli yayınlara katkıda bulunmuştur. Ona Twitter'da @murtuza_merc, Telegram'da ise mmerchant001 üzerinden ulaşabilirsiniz. Açıklama: Murtuza’nun ATOM, AKT, TIA, INJ ve OSMO varlıkları bulunmaktadır.

Feragatname ve Risk Uyarısı: Bu makalede sağlanan bilgiler yalnızca eğitici ve bilgilendirici amaçlıdır ve yazarın görüşüne dayanmaktadır. Mali, yatırım, hukuki veya vergi tavsiyesi teşkil etmez. Kripto para varlıkları son derece değişkendir ve yatırımınızın tamamını veya önemli bir kısmını kaybetme riski dahil olmak üzere yüksek riske tabidir. Kripto varlık ticareti veya tutma tüm yatırımcılar için uygun olmayabilir. Bu makalede ifade edilen görüşler yalnızca yazara aittir ve Yellow, kurucuları veya yöneticilerinin resmi politikasını veya pozisyonunu temsil etmez. Her zaman kendi kapsamlı araştırmanızı yapın (D.Y.O.R.) ve herhangi bir yatırım kararı vermeden önce lisanslı bir finansal uzmanla görüşün.
Alloy Compute, Daha Hızlı Yanıtlar İçin Yapay Zekâ Modellerini GPU ve FPGA’lere Bölüyor | Yellow