In Breve
- Qual è l'obiettivo della partnership tra AMD e Cerebras?
- Creare una soluzione disaggregata per l'inferenza AI combinando Helios e Wafer-Scale Engine.
- Quando sarà disponibile la nuova soluzione?
- Nella seconda metà del 2026.
- Quali sono i vantaggi della nuova architettura?
- Un aumento fino a cinque volte dei token per secondo per watt rispetto a una configurazione WSE standalone.
Il settore dell’intelligenza artificiale sta vivendo una fase di rapida evoluzione, e l’ultima novità arriva da AMD e Cerebras Systems, che hanno annunciato una partnership tecnica innovativa. Questa collaborazione combina il rackscale Helios di AMD con il Wafer-Scale Engine (WSE) di Cerebras, creando una soluzione disaggregata per l’inferenza AI, prevista per essere disponibile tramite Cerebras Cloud nella seconda metà del 2026.
Secondo i test interni condotti dalle due aziende, la nuova architettura promette un aumento fino a cinque volte dei token per secondo per watt (TPS/W) rispetto a una configurazione WSE standalone. Questo miglioramento è stato misurato utilizzando l’open-source Kimi 2.6 1T, un modello di mixture-of-experts con un trilione di parametri totali, ma con circa 32 miliardi di parametri attivi per token e un peso completo in INT4 di circa 500 GB.
Un aspetto cruciale della nuova architettura è il modo in cui gestisce l’elaborazione dei dati. La fase di prefill e l’elaborazione dei prompt vengono spostate sul rack Helios, il che compensa le minori efficienze del WSE in questa fase del flusso di lavoro. Il WSE, d’altra parte, si concentra sul decode e sulla generazione dei token, ottimizzando così l’intero processo.
Un singolo wafer Cerebras contiene 44 GB di memoria. Di conseguenza, un’implementazione che utilizza solo il WSE richiederebbe oltre una dozzina di wafer per gestire un modello così complesso. In confronto, un rack Helios è in grado di ospitare il modello molte volte, rendendo questa soluzione particolarmente significativa per modelli che non possono risiedere interamente su pochi wafer WSE, ma che potrebbero essere adattati a modelli più densi e compatti.
Nonostante i risultati promettenti, è necessario effettuare ulteriori test comparativi, specialmente rispetto ad altre offerte rackscale disponibili sul mercato. I dettagli finanziari dell’accordo tra AMD e Cerebras non sono stati resi noti, ma il movimento arriva in un contesto di crescente attenzione da parte degli investitori e del mercato verso il finanziamento circolare nel settore dell’AI.
Inoltre, questa partnership si inserisce in un periodo di fluttuazioni significative per Cerebras, che è stata quotata in borsa a maggio, e per AMD, che continua a registrare rialzi notevoli nel valore azionario dall’inizio dell’anno. È interessante notare che questa collaborazione segue un accordo di Nvidia per una licenza non esclusiva sulla tecnologia di SRAM decode di Groq, valutata 20 miliardi di dollari, evidenziando la competitività e l’innovazione nel settore.
In conclusione, la sinergia tra AMD e Cerebras potrebbe rappresentare un passo significativo verso l’ottimizzazione delle prestazioni nell’inferenza AI, aprendo la strada a nuove possibilità per le applicazioni future.
