Quan un agent d'IA encadena diverses consultes per completar una tasca —cercar informació, raonar-hi i tornar a consultar el model—, cada mil·lisegon d'espera es multiplica pel nombre de passos, i la latència es converteix en el principal coll d'ampolla de l'experiència d'ús. Nvidia porta mesos posicionant el seu maquinari perquè aquest tipus de càrrega de treball, diferent de l'entrenament de models, tingui xips dedicats.
La companyia ha anunciat aquesta setmana, al congrés Hot Chips, que el seu xip Groq 3 LPX —fruit de la compra de la start-up Groq per 20.000 milions de dòlars— ha entrat en producció a gran escala. El xip es presenta com un complement dels processadors Vera Rubin NVL72, ja en producció: mentre les GPU Rubin s'encarreguen del processament pesant del context d'una consulta, els LPU Groq 3 LPX assumeixen la fase de generació de la resposta, la més sensible a la latència. En un benchmark d'Artificial Analysis fet amb el model obert Gemma 4 31B, Nvidia afirma haver arribat a 3.400 tokens de sortida per segon en casos d'ús amb un context de 100.000 tokens, una xifra que la companyia xifra en quatre vegades més ràpida que la plataforma alternativa més propera. Nebius, CoreWeave i SpaceXAI figuren entre els primers clients que adopten la tecnologia, amb els primers racks previstos per a aquest mateix any.
La jugada és rellevant perquè mostra com Nvidia intenta blindar el seu domini del mercat de maquinari d'IA no només en l'entrenament de models, sinó també en la inferència especialitzada per a agents, un segment que creix de pressa a mesura que empreses i desenvolupadors passen d'usar xatbots senzills a sistemes que executen tasques de diversos passos de manera autònoma. Consolidar aquest terreny abans que rivals com AMD o els xips dissenyats a mida per OpenAI i Google guanyin quota podria allargar l'avantatge competitiu de Nvidia més enllà del que passa avui amb l'entrenament.
Les xifres de rendiment que Nvidia presenta provenen de proves internes de la mateixa companyia i d'un soci extern, Artificial Analysis, sense que encara hi hagi una auditoria completament independent que les repliqui en condicions reals de producció. Caldrà veure, a més, com respon el mercat un cop els primers clients tinguin els racks funcionant a ple rendiment i es puguin comparar els resultats amb la resta de plataformes d'inferència disponibles.