Arena va néixer el 2023 com a projecte de recerca de la Universitat de Berkeley que demanava al públic quin de dos models d'IA responia millor. Avui és un negoci que els laboratoris miren amb atenció, en un moment en què se sospita que moltes proves clàssiques s'han acabat entrenant per aprovar-les.
L'empresa ha tancat una sèrie B de 200 milions de dòlars amb una valoració de 3.100 milions, gairebé el doble que els 1.700 milions de la sèrie A del gener. Hi lideren Lightspeed i Khosla, i hi participen Salesforce Ventures, a16z, Felicis i Dell Technologies Capital, entre d'altres. Els ingressos anualitzats han passat de 30 milions al gener a 100 milions al juny, segons l'empresa. El producte de pagament, AI Evaluations, es va estrenar el setembre del 2025 i dona a laboratoris i empreses dades de rendiment basades en els vots de la comunitat.
Arena sosté que les proves estàtiques deixen de ser fiables quan els models detecten que els avaluen, i es proposa com a tercer neutral. Amb la ronda estrena un rànquing d'alineament que puntua les accions no autoritzades, l'atribució falsa de frases o fets i la «finalització enganyosa», és a dir, dir que s'ha acabat una tasca quan no és cert. A la classificació preliminar, els models d'OpenAI ocupen els primers llocs, el Claude Opus 5.5 és sisè i el Claude Fable, novè.
La mateixa empresa té un conflicte d'interessos potencial: viu dels laboratoris que avalua. Les xifres d'ingressos i el públic són dades de l'empresa, que TechCrunch no ha contrastat, i el rànquing d'alineament és preliminar.
