Alloy Compute заявляє, що створила систему інференсу ШІ, яка ділить роботу мовної моделі між графічними чипами AMD та програмованими прискорювачами, щоб суттєво скоротити час відповіді.
Alloy Compute розподіляє навантаження інференсу
Компанія 31 липня представила архітектуру як «дезагреговану» — кожен етап виконання моделі спрямовується на той процесор, який найкраще підходить саме для нього. Більшість рішень для інференсу запускають усі стадії на одному типі чипів. У рішенні Alloy Compute графічні процесори AMD відповідають за prefill‑обробку запиту та attention, тоді як FPGA‑прискорювачі беруть на себе декодування токенів і шари типу mixture‑of‑experts.
Alloy Compute ще не оприлюднила результатів бенчмарків і зазначає, що все ще інтегрує систему, паралельно вимірюючи затримку, пропускну здатність, енергоспоживання та обсяг трафіку між двома типами чипів. Програми клієнтського тестування поки не запущені.
Також читайте: Bitcoin‑ETF поглинають $233,1 млн, причому один фонд забезпечує більшу частину притоку
Нур де Вос гарантує затримку
Засновник і генеральний директор Нур де Вос пояснює, що prefill, attention і генерація токенів по‑різному навантажують «залізо», тож запуск усієї моделі на одній архітектурі веде до неефективного використання ресурсів. Компанія заявляє, що готова гарантувати час появи першого токена менш ніж 200 мілісекунд, але тільки для розгортань, які вкладаються у встановлені обмеження щодо розміру моделей, довжини вхідних даних та рівня паралельних запитів. Початкові тести охоплюють квантизовані моделі Qwen.
Де Вос прийшов в інфраструктуру ШІ з бізнесу великомасштабного майнінгу криптовалют, де прибутковість прямо залежала від максимальної завантаженості обладнання та мінімальних витрат на електроенергію. Він зазначає, що той самий системний підхід — розгляд чипів, пам’яті, мережі та софту як єдиного цілого — ліг в основу й нинішньої розробки.
Читайте далі: Трейдери Polymarket дають Людині‑павуку 91% шансів на рекордний дебют






