La carrera de la intel·ligència artificial s'ha centrat sobretot en la mida dels models, però des de fa temps un segon front hi guanya pes: la velocitat amb què un sistema respon un cop entrenat, la «inferència». Cerebras, la companyia californiana coneguda per fabricar els xips més grans del món -obleus sencers de silici, no els quadrats retallats que fan servir Nvidia o AMD-, hi ha apostat des del principi com a alternativa a les targetes gràfiques (GPU) convencionals.
La companyia va presentar el 18 d'agost el CS-4, un sistema en format rack amb tres obleus WSE-3 Turbo interconnectats, capaç de moure 750 petaflops de còmput i 129,6 petabytes per segon d'amplada de banda de memòria, amb una latència de només 2 microsegons entre obleus. Segons Cerebras, el sistema supera els 4.400 tocs (tokens) per segon i usuari en el model GPT-OSS-120B, fins a 30 vegades més que les solucions basades en GPU, i multiplica per deu el rendiment per watt respecte del CS-3 anterior. «En IA, la velocitat és productivitat», ha declarat el conseller delegat i cofundador, Andrew Feldman, mentre que el director tècnic, Sean Lie, ha afirmat que «ser 30 vegades més ràpid no fa només que una resposta sembli ràpida: dona a un sistema agent marge per fer un ordre de magnitud més de raonament, verificació o ús d'eines». La companyia ha presentat el CS-4 juntament amb acords amb OpenAI -que ja fa servir maquinari de Cerebras per al mode «Ultrafast» de GPT-5.6 Sol-, AMD i AWS.
La rellevància del CS-4 no és només tècnica: si els agents d'IA autònoms necessiten encadenar moltes crides al model per planificar, verificar i actuar, la velocitat de resposta esdevé un coll d'ampolla tan important com la capacitat del model mateix. L'analista Dylan Patel, fundador de la firma SemiAnalysis, ho ha resumit dient que el CS-4 «fa millores dràstiques en desplegabilitat, fiabilitat i xarxa, cosa que permet escalar el rendiment cap a models més grans per a fàbriques de tocs a gran escala». L'anunci arriba mentre Nvidia continua dominant còmodament el mercat de xips d'IA, però amb un nombre creixent de competidors -Cerebras, Groq, AMD- que intenten guanyar quota oferint velocitats de resposta que les GPU generalistes no igualen.
Les xifres de rendiment provenen, de moment, exclusivament de proves internes de Cerebras, sense una validació independent encara publicada, i les comparacions «fins a 30 vegades» corresponen als millors escenaris, no necessàriament al rendiment mitjà en càrregues de treball reals. La companyia només ha confirmat que els primers enviaments del CS-4 començaran «aquest trimestre», sense detallar preus ni el volum de comandes rebudes, i el pes econòmic real dels acords amb OpenAI, AMD i AWS -més enllà del contracte de 750 megawatts i més de 10.000 milions de dòlars signat amb OpenAI el gener- encara no s'ha fet públic en detall.