La inferència -el procés d'executar un model ja entrenat per generar respostes, en lloc d'entrenar-lo- s'ha convertit en un dels principals motors de la demanda de capacitat de còmput, i tant els proveïdors de núvol com els fabricants de xips inverteixen milers de milions de dòlars per ampliar-la. Together AI, amb seu a San Francisco, ofereix una plataforma perquè les empreses entrenin i executin models oberts com DeepSeek, MiniMax o Kimi a un cost inferior al dels sistemes tancats.
IBM i Together AI han signat un acord plurianual de 240 milions de dòlars per construir un clúster d'IA a gran escala a IBM Cloud amb sistemes Nvidia. El clúster inicial farà servir uns 2.000 xips Blackwell B300 -els processadors més recents de Nvidia- connectats amb la xarxa Spectrum-X Ethernet, i s'ubicarà als Estats Units.
El clúster ha de començar a funcionar el primer trimestre de 2027, però Kai Mak, director d'ingressos de Together AI, ha afirmat que "creiem que estarà venut com a mínim dos o tres mesos abans" que arribi. L'acord confirma que IBM aposta per convertir-se en proveïdora de capacitat d'inferència -el que al sector es coneix com a "neocloud"- per competir amb els grans hiperescalers en un mercat que creix més ràpid que el de l'entrenament de nous models.
Les xifres exactes de rendiment i de capacitat del clúster no s'han fet públiques més enllà del nombre de xips inicials, i el calendari de posada en marxa -a més d'un any vista- depèn encara de la construcció de la infraestructura.