Google fabrica des de fa anys les seves pròpies TPU per entrenar i executar els models Gemini, però la despesa creixent en inferència a gran escala sembla estar-la empenyent a explorar un disseny de xip encara més especialitzat.

Segons ha revelat SiliconANGLE el 20 de juliol, citant una filtració prèvia de The Information basada en fonts anònimes, Google treballa internament en un processador conegut com "Frozen v2" que integraria elements de l'arquitectura del model Gemini directament al silici, en comptes dels seus pesos entrenats, per reduir el nombre de càlculs i el moviment de dades durant la inferència. Els enginyers implicats calculen que el xip podria oferir entre sis i deu vegades més tokens processats per watt que les TPU actuals de Google, encara que aquesta xifra és una projecció interna i no un resultat validat mitjançant proves comparatives publicades. El disseny inclouria també més memòria per executar Gemini íntegrament dins del xip i compatibilitat amb commutadors de circuits òptics personalitzats, amb un desplegament previst als centres de dades de Google per al 2028, com a complement de les TPU i no com a substitut.

La notícia és rellevant perquè, si les xifres es confirmen, suposaria el salt d'eficiència més gran en una sola generació del programa de silici personalitzat de Google, en un moment en què el cost energètic de la inferència a gran escala s'ha convertit en un dels principals colls d'ampolla del sector, i perquè mostra com els grans laboratoris comencen a dissenyar maquinari fet a mida per a un sol model en lloc de xips d'ús general.

Google no ha confirmat oficialment l'existència del projecte ni els detalls tècnics avançats per les fonts de The Information, i no hi ha, de moment, cap dada de rendiment obtinguda fora de l'empresa que permeti contrastar la xifra de sis a deu vegades més eficiència.