iaintel·ligènciaartificial.cat← Portada

TECNOLOGIA · 4 MIN

La start-up francesa Kog diu que pot fer la inferència d'IA fins a 30 vegades més ràpida amb el mateix maquinari

L'empresa parisenca, fundada per Gaël Delalleau i amb només onze persones, presenta un motor d'inferència que arriba a 3.000 tokens per segon en una sola petició sobre GPU estàndard, aprofitant l'ample de banda de memòria no explotat en lloc d'esperar xips nous.

Il·lustració editorial de La start-up francesa Kog diu que pot fer la inferència d'IA fins a 30 vegades més ràpida amb el mateix maquinari
Escolta:

La indústria de la IA ha abocat desenes de milers de milions de dòlars a xips cada cop més potents per accelerar la inferència dels models, la fase en què responen a l'usuari. Una petita start-up francesa aposta per un camí diferent: exprimir més rendiment del maquinari que ja existeix, només amb software.

TechCrunch va explicar el 14 d'agost que Kog, una empresa parisenca de només onze persones fundada el 2023 per Gaël Delalleau -enginyer de l'École Polytechnique amb bagatge en ciberseguretat ofensiva-, ha presentat una prova tècnica del seu Kog Inference Engine: 3.000 tokens per segon en una sola petició sobre vuit GPU AMD MI300X, i 2.100 sobre vuit Nvidia H200, sense recórrer a tècniques com la descodificació especulativa. La demostració es basa en Laneformer, un model propi de només 2.000 milions de paràmetres que l'empresa ha obert en codi obert, i combina tres peces: un temps d'execució "monokernel" que evita els talls entre crides al processador, una capa de comunicacions pròpia amb una latència de menys de 3 microsegons, i un disseny de model pensat perquè la comunicació i el càlcul se superposin. Segons Kog, el coll d'ampolla real a l'hora de generar tokens no és la capacitat de càlcul sinó l'ample de banda de memòria, que les GPU estàndard deixen sense aprofitar per ineficiències de software.

El cas és rellevant perquè qüestiona la narrativa dominant que la velocitat d'inferència només es pot guanyar amb generacions noves de xips, en un moment en què laboratoris i núvols hi inverteixen sumes multimilionàries. Kog, en canvi, ha captat només 5 milions de dòlars de Varsity VC i del programa Deep Tech de Bpifrance, amb el segell francès French Tech 2030, i es juga la ronda Sèrie A a demostrar, abans de setembre del 2026, un guany de deu vegades en la velocitat de models grans reals, no només en el seu propi model petit de demostració.

La prova presentada es limita a una sola petició alhora ("batch size 1") i a un model propi de mida reduïda, sense suport encara per a l'ús simultani de múltiples peticions en producció, ni descodificació especulativa ni quantització. Les projeccions de Kog sobre com rendiria la tècnica amb models grans d'altres companyies, com DeepSeek-V4-Pro, són estimacions teòriques basades en càlculs d'ample de banda, no mesures reals encara.

Mateix tema

Veure tot el tema →

Butlletí de dissabte

La setmana d’IA, en cinc minuts.