Alloy Compute affirme avoir mis au point un système d’inférence d’IA qui répartit le travail des grands modèles de langage entre cartes graphiques AMD et accélérateurs programmables, afin de réduire nettement les temps de réponse.
Alloy Compute segmente les charges d’inférence
L’entreprise a présenté, le 31 juillet, une architecture dite « désagrégée » : chaque phase d’exécution du modèle est envoyée vers le processeur le plus adapté. Là où la plupart des systèmes d’inférence font tourner toutes les étapes sur un seul type de puce, Alloy Compute confie le pré-remplissage du prompt et l’attention aux GPU AMD, tandis que les accélérateurs FPGA prennent en charge le décodage des tokens et les couches « mixture-of-experts ».
Alloy Compute n’a pas encore publié de résultats de benchmarks. La société explique être toujours en phase d’intégration du système et de mesure de la latence, du débit, de la consommation énergétique et du trafic entre les deux types de puces. Aucun programme d’évaluation client n’est ouvert pour l’instant.
À lire aussi : Les ETF Bitcoin absorbent 233,1 M$ alors qu’un seul fonds fournit l’essentiel
Nour De Vos assume une garantie de latence
Le fondateur et directeur général, Nour de Vos, souligne que le pré-remplissage, l’attention et la génération de tokens sollicitent différemment le matériel, si bien que faire tourner un modèle complet sur une seule architecture revient à gaspiller des ressources. Selon la société, il est possible de garantir un premier token en moins de 200 millisecondes, mais uniquement pour des déploiements respectant des limites strictes en matière de taille de modèle, de longueur d’input et de niveau de concurrence. Les premiers travaux portent sur des modèles Qwen quantifiés.
De Vos vient de l’infrastructure crypto à grande échelle, où la rentabilité dépendait de machines constamment sollicitées et de factures d’électricité contenues. Il revendique avoir transposé cette approche « système », qui considère puces, mémoire, réseau et logiciel comme un tout cohérent, dans la conception de cette architecture.
À suivre : Les traders de Polymarket donnent à Spider-Man 91 % de chances pour des débuts historiques






