Cognition, l'empresa darrere de l'agent de programació Devin, ha llançat SWE-2, el seu model més capaç fins ara, en una setmana en què OpenAI, Anthropic, Google i Meta també han tret models nous gairebé alhora.
SWE-2 s'ha post-entrenat amb aprenentatge per reforç sobre Kimi K3, el model obert de 2,8 bilions de paràmetres de la xinesa Moonshot AI, i aconsegueix un 50,0% al banc de proves FrontierCode 1.1 Main —a un punt de Claude Fable 5.1— per un 64% menys de cost, i una quarta part del cost de GPT-6 Astra amb un resultat molt proper (50,0% enfront del 53,3%). Segons Cognition, la versió mitjana de SWE-2 necessita un 58% menys de passos que el seu predecessor SWE-1.7 i costa de mitjana un 81% menys a FrontierCode. Ja és disponible a Devin Desktop i CLI, i serà gratuït durant un mes per als usuaris de pagament.
Que una startup nord-americana construeixi el seu producte estrella sobre un model d'accés obert xinès mostra fins a quin punt Kimi K3 s'ha convertit en una base habitual per a qui vol un rendiment d'alt nivell sense pagar els preus dels laboratoris nord-americans de referència. La coincidència és rellevant perquè arriba el mateix dia que Washington acusa Moonshot i altres empreses xineses de basar la seva estratègia en la destil·lació de models nord-americans, i Pequín ho rebutja i amenaça amb represàlies.
Les xifres de rendiment són les que reporta la mateixa Cognition, sense verificació independent encara publicada. L'empresa mateixa reconeix que en tasques complexes els nivells «high» i «max» de SWE-2 continuen sent millors que el «medium» que protagonitza els titulars, i precisa que els resultats representen «la millor puntuació entre els diferents nivells d'esforç», no un rendiment uniforme en tots els casos.