A mesura que els grans models de llenguatge es converteixen en agents que han de respondre en temps real —copilots de programació, assistents de veu, sistemes de robòtica—, el focus de la indústria del maquinari d'IA s'ha anat desplaçant de l'entrenament de models cap a la inferència, és a dir, l'execució ràpida i barata d'aquests models un cop ja entrenats. En aquest terreny hi conviuen des de fa temps AMD, amb la seva plataforma de racks Helios i els processadors gràfics Instinct, i Cerebras Systems, coneguda pel seu Wafer-Scale Engine, un únic xip de la mida d'un plat especialitzat a generar text a una velocitat molt alta.
Les dues companyies van anunciar el 23 de juliol una associació tècnica per combinar totes dues tecnologies en una sola solució d'inferència "desagregada": els racks Helios d'AMD s'encarreguen del processament inicial de les peticions i de les finestres de context llargues, mentre que el Wafer-Scale Engine de Cerebras assumeix la generació token a token, la fase que exigeix més amplada de banda de memòria. Segons les dues empreses, aquesta combinació pot arribar a multiplicar per cinc els tokens generats per segon i per watt consumit respecte a solucions convencionals. La consellera delegada d'AMD, Lisa Su, ha afirmat que "Helios ofereix un rendiment i una escala capdavanters per a la gamma més àmplia de càrregues de treball d'inferència", mentre que el seu homòleg a Cerebras, Andrew Feldman, ha dit que l'associació els dona "una oportunitat extraordinària de portar aquest rendiment a més clients". La solució conjunta estarà disponible primer a través de Cerebras Cloud durant la segona meitat del 2026.
La notícia és rellevant perquè trenca amb la lògica dels blocs tancats que ha dominat fins ara el mercat de maquinari d'IA —normalment articulats al voltant de Nvidia de cap a peus— i aposta per una arquitectura "desagregada" en què diferents fabricants es reparteixen les fases del càlcul segons la seva especialitat. Per a AMD, reforça la seva estratègia d'ampliar l'ecosistema al voltant d'Instinct i Helios; per a Cerebras, que ha buscat sense èxit sortir a borsa, li obre una via addicional d'ingressos monetitzant el seu xip gegant a través del núvol.
Les xifres de rendiment —fins a cinc vegades més tokens per segon i watt— són dades facilitades per les dues companyies i encara no han estat verificades per proves independents. La disponibilitat inicial es limita, a més, al núvol de Cerebras, sense que s'hagi concretat encara un calendari per a un desplegament més ampli entre altres proveïdors de núvol o clients empresarials directes.