Alloy Compute divide modelos de IA entre GPUs e FPGAs para acelerar respostas

Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)
Alloy Compute claims sub-200-millisecond first-token responses from its combined AMD GPU and FPGA design, with performance data still unpublished. (Image: Shutterstock)

Alloy Compute afirma ter desenvolvido um sistema de inferência de IA que reparte o processamento de modelos de linguagem entre chips gráficos da AMD e aceleradores programáveis, reduzindo o tempo de resposta.

Alloy Compute reparte cargas de inferência

A empresa apresentou o projeto em 31 de julho como uma arquitetura desagregada, em que cada fase de execução do modelo é enviada ao processador mais adequado. A maioria dos sistemas de inferência roda todas as etapas em um único tipo de chip. No desenho da Alloy Compute, as GPUs AMD cuidam do prefill do prompt e da atenção, enquanto aceleradores em FPGA assumem a decodificação de tokens e as camadas de mixture-of-experts.

A Alloy Compute ainda não publicou resultados de benchmark e diz que continua integrando o sistema enquanto mede latência, throughput, consumo de energia e tráfego entre os dois tipos de chip. Programas formais de avaliação por clientes ainda não foram abertos.

Leia também: ETFs de Bitcoin absorvem US$ 233,1 mi com um único fundo respondendo pela maior parte

Nour De Vos aposta em garantia de latência

O fundador e CEO Nour de Vos afirma que prefill, atenção e geração de tokens impõem exigências distintas ao hardware, o que torna ineficiente rodar o modelo inteiro em uma única arquitetura. A empresa diz estar pronta para garantir respostas de primeiro token abaixo de 200 milissegundos, mas apenas em implantações que respeitem limites definidos de tamanho de modelo, comprimento de entrada e nível de concorrência. Os primeiros testes focam modelos Qwen quantizados.

De Vos migrou para infraestrutura de IA após atuar em mineração de criptomoedas em larga escala, onde a rentabilidade depende de manter as máquinas ocupadas e reduzir a conta de energia. Segundo ele, essa mesma visão de sistema — tratando chips, memória, rede e software como um conjunto integrado — orientou o desenho atual.

Leia a seguir: Apostadores da Polymarket dão 91% de chance de estreia histórica para o Homem-Aranha

Murtuza Merchant profile photo

Murtuza Merchant

Murtuza é um jornalista financeiro experiente, com ampla vivência na cobertura de criptomoedas e tecnologia blockchain. Ele já contribuiu para a Benzinga e a Cointelegraph, entre outras publicações, reportando sobre tendências emergentes, o cenário regulatório e muito mais. Você pode encontrá-lo em @murtuza_merc no Twitter e como mmerchant001 no Telegram. Disclosure: Murtuza holds ATOM, AKT, TIA, INJ, and OSMO.

Isenção de responsabilidade e aviso de risco: As informações fornecidas neste artigo são apenas para fins educacionais e informativos e são baseadas na opinião do autor. Elas não constituem aconselhamento financeiro, de investimento, jurídico ou tributário. Ativos de criptomoedas são altamente voláteis e sujeitos a alto risco, incluindo o risco de perder todo ou uma quantia substancial do seu investimento. Negociar ou manter ativos cripto pode não ser adequado para todos os investidores. As opiniões expressas neste artigo são exclusivamente do(s) autor(es) e não representam a política oficial ou posição da Yellow, seus fundadores ou seus executivos. Sempre conduza sua própria pesquisa minuciosa (D.Y.O.R.) e consulte um profissional financeiro licenciado antes de tomar qualquer decisão de investimento.
Alloy Compute divide modelos de IA entre GPUs e FPGAs para acelerar respostas | Yellow