Alloy Compute розподіляє AI‑моделі між GPU та FPGA для пришвидшення відповідей

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute заявляє, що створила систему інференсу ШІ, яка ділить роботу мовної моделі між графічними чипами AMD та програмованими прискорювачами, щоб суттєво скоротити час відповіді.

Alloy Compute розподіляє навантаження інференсу

Компанія 31 липня представила архітектуру як «дезагреговану» — кожен етап виконання моделі спрямовується на той процесор, який найкраще підходить саме для нього. Більшість рішень для інференсу запускають усі стадії на одному типі чипів. У рішенні Alloy Compute графічні процесори AMD відповідають за prefill‑обробку запиту та attention, тоді як FPGA‑прискорювачі беруть на себе декодування токенів і шари типу mixture‑of‑experts.

Alloy Compute ще не оприлюднила результатів бенчмарків і зазначає, що все ще інтегрує систему, паралельно вимірюючи затримку, пропускну здатність, енергоспоживання та обсяг трафіку між двома типами чипів. Програми клієнтського тестування поки не запущені.

Також читайте: Bitcoin‑ETF поглинають $233,1 млн, причому один фонд забезпечує більшу частину притоку

Нур де Вос гарантує затримку

Засновник і генеральний директор Нур де Вос пояснює, що prefill, attention і генерація токенів по‑різному навантажують «залізо», тож запуск усієї моделі на одній архітектурі веде до неефективного використання ресурсів. Компанія заявляє, що готова гарантувати час появи першого токена менш ніж 200 мілісекунд, але тільки для розгортань, які вкладаються у встановлені обмеження щодо розміру моделей, довжини вхідних даних та рівня паралельних запитів. Початкові тести охоплюють квантизовані моделі Qwen.

Де Вос прийшов в інфраструктуру ШІ з бізнесу великомасштабного майнінгу криптовалют, де прибутковість прямо залежала від максимальної завантаженості обладнання та мінімальних витрат на електроенергію. Він зазначає, що той самий системний підхід — розгляд чипів, пам’яті, мережі та софту як єдиного цілого — ліг в основу й нинішньої розробки.

Читайте далі: Трейдери Polymarket дають Людині‑павуку 91% шансів на рекордний дебют

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — досвідчений фінансовий журналіст із великим досвідом у висвітленні криптовалют та блокчейн‑технологій. Він співпрацював з Benzinga та Cointelegraph, а також іншими виданнями, висвітлюючи нові тренди, регуляторне середовище та інші аспекти галузі. Знайти його можна в Twitter за @murtuza_merc і в Telegram за ніком mmerchant001. Розкриття інформації: Муртуза володіє ATOM, AKT, TIA, INJ та OSMO.

Відмова від відповідальності та попередження про ризики: Інформація, надана в цій статті, призначена лише для освітніх та інформаційних цілей і базується на думці автора. Вона не є фінансовою, інвестиційною, правовою чи податковою консультацією. Криптоактиви є надзвичайно волатильними та піддаються високому ризику, включаючи ризик втрати всіх або значної частини ваших інвестицій. Торгівля або утримання криптоактивів може не підходити для всіх інвесторів. Думки, висловлені в цій статті, належать виключно автору(ам) і не представляють офіційну політику чи позицію Yellow, її засновників або керівників. Завжди проводьте власне ретельне дослідження (D.Y.O.R.) та консультуйтесь з ліцензованим фінансовим фахівцем перед прийняттям будь-яких інвестиційних рішень.
Останні новини
Показати всі новини
Схожі новини
Схожі дослідницькі статті
Схожі навчальні матеріали
Alloy Compute розподіляє AI‑моделі між GPU та FPGA для пришвидшення відповідей | Yellow