Alloy Compute распределяет ИИ‑модели между GPU и FPGA для ускорения отклика

Murtuza Merchant
Murtuza Merchant1 час назад
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute заявляет, что создала систему инференса ИИ, которая распределяет нагрузку языковых моделей между графическими процессорами AMD и программируемыми ускорителями, чтобы сократить время ответа.

Alloy Compute делит инференс между разными процессорами

Компания 31 июля представила свою архитектуру как дезагрегированную: каждую стадию выполнения модели она отправляет на тот тип процессора, который лучше всего подходит под конкретную задачу. Большинство систем инференса прогоняют все этапы на одном типе чипов. В конфигурации Alloy Compute графические процессоры AMD отвечают за префилл запроса и операции внимания (attention), тогда как FPGA‑ускорители обрабатывают декодирование токенов и слои типа mixture‑of‑experts.

Alloy Compute пока не публиковала результаты тестов и отмечает, что все еще интегрирует систему и параллельно измеряет задержки, пропускную способность, энергопотребление и объем трафика между двумя типами чипов. Программы тестирования решения с клиентами еще не запущены.

Также читайте: Bitcoin‑ETF поглотили $233,1 млн, при этом один фонд обеспечил основную часть притока

Нур де Вос дает гарантию по задержке

Основатель и гендиректор Нур де Вос подчеркивает, что префилл, attention и генерация токенов предъявляют к «железу» разные требования, поэтому запускать всю модель на одной архитектуре — значит терять эффективность. Компания заявляет о готовности гарантировать вывод первого токена менее чем за 200 миллисекунд, но только в конфигурациях, которые укладываются в заданные ограничения по размеру моделей, длине входных данных и уровню конкуренции запросов. На раннем этапе платформа ориентируется на квантованные модели семейства Qwen.

Де Вос пришел в область ИИ‑инфраструктуры из крупномасштабного майнинга криптовалют, где прибыль зависела от максимальной загрузки оборудования и минимизации расходов на электроэнергию. По его словам, именно такой системный подход — когда чипы, память, сеть и ПО рассматриваются как единый комплекс — лег в основу текущей архитектуры Alloy Compute.

Читайте далее: Трейдеры Polymarket дают «Человеку‑пауку» 91% шансов на исторический дебют

Murtuza Merchant profile photo

Murtuza Merchant

Муртуза — опытный финансовый журналист с обширным опытом освещения криптовалют и технологий блокчейн. Он публиковался в Benzinga и Cointelegraph, а также в других изданиях, рассказывая о новых трендах, регуляторной среде и многом другом. Найти его можно в Twitter по нику @murtuza_merc и в Telegram под именем mmerchant001. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Отказ от ответственности и предупреждение о рисках: Информация, представленная в этой статье, предназначена только для образовательных и информационных целей и основана на мнении автора. Она не является финансовой, инвестиционной, юридической или налоговой консультацией. Криптоактивы крайне волатильны и подвержены высоким рискам, включая риск потери всех или значительной части ваших инвестиций. Торговля или владение криптоактивами может не подходить для всех инвесторов. Мнения, выраженные в этой статье, принадлежат исключительно автору(ам) и не представляют официальную политику или позицию Yellow, её основателей или руководителей. Всегда проводите собственное тщательное исследование (D.Y.O.R.) и консультируйтесь с лицензированным финансовым специалистом перед принятием любых инвестиционных решений.
Последние новости
Показать все новости
Связанные Новости
Связанные исследовательские статьи
Связанные обучающие статьи
Alloy Compute распределяет ИИ‑модели между GPU и FPGA для ускорения отклика | Yellow