iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 4 MIN

SpaceXAI llança el Grok 4.7, que puja del 65,2% al 71% a la prova de programació DeepSWE sense apujar el preu

La companyia d'IA de l'entorn d'Elon Musk presenta un model amb una base més gran i més aprenentatge per reforç, i publica els resultats de sis proves comparatives amb la versió anterior. Manté els 2 dòlars per milió de tokens d'entrada.

Il·lustració editorial de SpaceXAI llança el Grok 4.7, que puja del 65,2% al 71% a la prova de programació DeepSWE sense apujar el preu
Escolta:

El ritme de llançaments de models de frontera no ha afluixat aquest setembre: en poc més d'una setmana han sortit versions noves de gairebé tots els grans laboratoris, fins al punt que part de la premsa especialitzada ha començat a parlar de fatiga de models entre els desenvolupadors que els han d'integrar. SpaceXAI hi ha afegit la seva peça amb el Grok 4.7, que la companyia presenta com el seu model més potent per a programació i per a feines de coneixement.

Segons la nota publicada per la mateixa empresa, el Grok 4.7 parteix d'un model base més gran que el de la versió anterior i ha rebut un entrenament per reforç més llarg sobre tasques difícils. La companyia publica la comparació amb el Grok 4.6 en sis proves: a DeepSWE v1.1, que mesura la resolució de problemes reals de programari, passa del 65,2% al 71%; a CursorBench 4.0, del 40,4% al 46,3%; a EEBench, una prova d'enginyeria elèctrica, del 53% al 64%; a HealthBench Professional, del 48,5% al 56,7%; i a l'agent jurídic de Harvey, del 15,8% al 19,6%. El preu es manté en 2 dòlars per milió de tokens d'entrada i 6 per milió de sortida, amb una variant ràpida que costa el doble i entrega el text a doble velocitat.

El detall que val la pena retenir no és cap dels percentatges per separat sinó on es concentra la millora: les tasques de programació llargues, les que un agent ha de sostenir durant hores sense perdre el fil. És exactament el terreny on competeixen ara mateix tots els laboratoris, perquè és el que les empreses paguen. Que el salt més gran de la taula sigui el d'enginyeria elèctrica, onze punts, apunta en la mateixa direcció: el valor comercial d'aquests models s'està desplaçant cap a dominis tècnics concrets i verificables, no cap a la conversa general.

Totes aquestes xifres, això sí, són les que publica el venedor sobre proves que ha triat el venedor, i encara no hi ha avaluacions independents del Grok 4.7. Les puntuacions a proves de programació tenen a més una relació coneguda però imperfecta amb el rendiment en una base de codi real, i les proves de domini mèdic o jurídic mesuren respostes a preguntes tancades, no la fiabilitat d'un professional. Fins que no hi hagi mesures de tercers i experiència d'ús acumulada, el que se'n pot dir és que la companyia reporta una millora consistent en sis proves mantenint la tarifa.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.