iaintel·ligènciaartificial.cat← Portada

MODELS · 4 MIN

Cognition presenta SWE-2, un agent de programació construït sobre el model xinès Kimi K3

L'empresa darrere de l'agent Devin post-entrena el model obert de Moonshot AI i diu igualar Claude Fable 5.1 al banc de proves FrontierCode amb un 64% menys de cost, el mateix dia que Washington acusa els laboratoris xinesos de destil·lar models nord-americans.

Il·lustració editorial de Cognition presenta SWE-2, un agent de programació construït sobre el model xinès Kimi K3
Escolta:

Cognition, l'empresa darrere de l'agent de programació Devin, ha llançat SWE-2, el seu model més capaç fins ara, en una setmana en què OpenAI, Anthropic, Google i Meta també han tret models nous gairebé alhora.

SWE-2 s'ha post-entrenat amb aprenentatge per reforç sobre Kimi K3, el model obert de 2,8 bilions de paràmetres de la xinesa Moonshot AI, i aconsegueix un 50,0% al banc de proves FrontierCode 1.1 Main —a un punt de Claude Fable 5.1— per un 64% menys de cost, i una quarta part del cost de GPT-6 Astra amb un resultat molt proper (50,0% enfront del 53,3%). Segons Cognition, la versió mitjana de SWE-2 necessita un 58% menys de passos que el seu predecessor SWE-1.7 i costa de mitjana un 81% menys a FrontierCode. Ja és disponible a Devin Desktop i CLI, i serà gratuït durant un mes per als usuaris de pagament.

Que una startup nord-americana construeixi el seu producte estrella sobre un model d'accés obert xinès mostra fins a quin punt Kimi K3 s'ha convertit en una base habitual per a qui vol un rendiment d'alt nivell sense pagar els preus dels laboratoris nord-americans de referència. La coincidència és rellevant perquè arriba el mateix dia que Washington acusa Moonshot i altres empreses xineses de basar la seva estratègia en la destil·lació de models nord-americans, i Pequín ho rebutja i amenaça amb represàlies.

Les xifres de rendiment són les que reporta la mateixa Cognition, sense verificació independent encara publicada. L'empresa mateixa reconeix que en tasques complexes els nivells «high» i «max» de SWE-2 continuen sent millors que el «medium» que protagonitza els titulars, i precisa que els resultats representen «la millor puntuació entre els diferents nivells d'esforç», no un rendiment uniforme en tots els casos.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.