Alloy Compute reparte modelos de IA entre GPUs y FPGAs para acelerar las respuestas

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute asegura haber desarrollado un sistema de inferencia de IA que reparte la carga de trabajo de los modelos de lenguaje entre chips gráficos de AMD y aceleradores programables, con el objetivo de reducir de forma drástica los tiempos de respuesta.

Alloy Compute reparte las cargas de inferencia

La compañía presentó el 31 de julio un diseño que describe como una arquitectura desagregada: cada fase de ejecución del modelo se envía al procesador más adecuado para esa tarea. La mayoría de sistemas de inferencia ejecutan todas las etapas sobre un único tipo de chip. En este enfoque, las GPU de AMD asumen el prefill del prompt y las operaciones de atención, mientras que los aceleradores FPGA se encargan de la decodificación de tokens y de las capas de mixture-of-experts.

Alloy Compute aún no ha publicado resultados de rendimiento y afirma que sigue en fase de integración del sistema, midiendo latencia, rendimiento, consumo energético y tráfico entre ambos tipos de chip. Todavía no se han abierto programas de prueba para clientes.

También puede interesarte: Los ETF de Bitcoin absorben 233,1 M$ con un solo fondo aportando la mayor parte

Nour de Vos respalda una garantía de latencia

El fundador y consejero delegado, Nour de Vos, sostiene que el prefill, la atención y la generación de tokens plantean exigencias muy distintas al hardware, por lo que ejecutar todo el modelo sobre una sola arquitectura desaprovecha capacidad. La empresa dice estar dispuesta a garantizar tiempos de primer token inferiores a 200 milisegundos, aunque solo para despliegues que respeten límites definidos en cuanto a tamaño de modelo, longitud de entrada y concurrencia. El trabajo inicial se centra en modelos Qwen cuantizados.

De Vos llegó a la infraestructura de IA desde la minería de criptomonedas a gran escala, un negocio en el que los márgenes dependen de mantener las máquinas ocupadas y contener la factura eléctrica. Ha explicado que esa misma visión a nivel de sistema —tratando chips, memoria, red y software como un todo integrado— ha marcado el diseño actual.

Lee a continuación: Los traders de Polymarket dan a Spider-Man un 91% de probabilidades de un debut histórico

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza es un periodista financiero experimentado con amplia trayectoria cubriendo criptomonedas y tecnología blockchain. Ha contribuido a Benzinga y Cointelegraph, entre otras publicaciones, informando sobre tendencias emergentes, el panorama regulatorio y más. Encuéntralo en @murtuza_merc en Twitter y como mmerchant001 en Telegram. Divulgación: Murtuza posee ATOM, AKT, TIA, INJ y OSMO.

Descargo de responsabilidad y advertencia de riesgos: La información proporcionada en este artículo es solo para propósitos educativos e informativos y se basa en la opinión del autor. No constituye asesoramiento financiero, de inversión, legal o fiscal. Los activos de criptomonedas son altamente volátiles y están sujetos a alto riesgo, incluido el riesgo de perder toda o una cantidad sustancial de su inversión. Operar o mantener activos cripto puede no ser adecuado para todos los inversores. Las opiniones expresadas en este artículo son únicamente las del autor/autores y no representan la política oficial o posición de Yellow, sus fundadores o sus ejecutivos. Siempre realice su propia investigación exhaustiva (D.Y.O.R.) y consulte a un profesional financiero licenciado antes de tomar cualquier decisión de inversión.
Últimas noticias
Ver todas las noticias
Alloy Compute reparte modelos de IA entre GPUs y FPGAs para acelerar las respuestas | Yellow