Alloy Compute répartit les modèles d’IA entre GPU et FPGA pour accélérer les réponses

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute affirme avoir mis au point un système d’inférence d’IA qui répartit le travail des grands modèles de langage entre cartes graphiques AMD et accélérateurs programmables, afin de réduire nettement les temps de réponse.

Alloy Compute segmente les charges d’inférence

L’entreprise a présenté, le 31 juillet, une architecture dite « désagrégée » : chaque phase d’exécution du modèle est envoyée vers le processeur le plus adapté. Là où la plupart des systèmes d’inférence font tourner toutes les étapes sur un seul type de puce, Alloy Compute confie le pré-remplissage du prompt et l’attention aux GPU AMD, tandis que les accélérateurs FPGA prennent en charge le décodage des tokens et les couches « mixture-of-experts ».

Alloy Compute n’a pas encore publié de résultats de benchmarks. La société explique être toujours en phase d’intégration du système et de mesure de la latence, du débit, de la consommation énergétique et du trafic entre les deux types de puces. Aucun programme d’évaluation client n’est ouvert pour l’instant.

À lire aussi : Les ETF Bitcoin absorbent 233,1 M$ alors qu’un seul fonds fournit l’essentiel

Nour De Vos assume une garantie de latence

Le fondateur et directeur général, Nour de Vos, souligne que le pré-remplissage, l’attention et la génération de tokens sollicitent différemment le matériel, si bien que faire tourner un modèle complet sur une seule architecture revient à gaspiller des ressources. Selon la société, il est possible de garantir un premier token en moins de 200 millisecondes, mais uniquement pour des déploiements respectant des limites strictes en matière de taille de modèle, de longueur d’input et de niveau de concurrence. Les premiers travaux portent sur des modèles Qwen quantifiés.

De Vos vient de l’infrastructure crypto à grande échelle, où la rentabilité dépendait de machines constamment sollicitées et de factures d’électricité contenues. Il revendique avoir transposé cette approche « système », qui considère puces, mémoire, réseau et logiciel comme un tout cohérent, dans la conception de cette architecture.

À suivre : Les traders de Polymarket donnent à Spider-Man 91 % de chances pour des débuts historiques

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza est un journaliste financier chevronné, doté d’une vaste expérience dans la couverture des cryptomonnaies et de la technologie blockchain. Il a contribué à Benzinga et Cointelegraph, entre autres publications, en rapportant sur les tendances émergentes, le paysage réglementaire, et plus encore. Retrouvez-le sur Twitter à @murtuza_merc et sur Telegram sous le nom mmerchant001. Divulgation : Murtuza détient ATOM, AKT, TIA, INJ et OSMO.

Avertissement et avertissement sur les risques : Les informations fournies dans cet article sont à des fins éducatives et informatives uniquement et sont basées sur l'opinion de l'auteur. Elles ne constituent pas des conseils financiers, d'investissement, juridiques ou fiscaux. Les actifs de cryptomonnaie sont très volatils et sujets à des risques élevés, y compris le risque de perdre tout ou une partie substantielle de votre investissement. Le trading ou la détention d'actifs crypto peut ne pas convenir à tous les investisseurs. Les opinions exprimées dans cet article sont uniquement celles de l'auteur/des auteurs et ne représentent pas la politique officielle ou la position de Yellow, de ses fondateurs ou de ses dirigeants. Effectuez toujours vos propres recherches approfondies (D.Y.O.R.) et consultez un professionnel financier agréé avant de prendre toute décision d'investissement.
Dernières nouvelles
Voir toutes les nouvelles
Alloy Compute répartit les modèles d’IA entre GPU et FPGA pour accélérer les réponses | Yellow