iaintel·ligènciaartificial.cat← Portada

CIÈNCIA · 4 MIN

Un article amb 160 autors detalla com DeepSeek gestiona 3 milions d'entorns de prova diaris per entrenar agents d'IA sense que es contaminin entre ells

El document descriu DSec, la infraestructura interna que la xinesa DeepSeek fa servir per crear i aïllar milions d'entorns temporals per a l'entrenament d'agents, amb fins a 380.000 sandboxes actius alhora i més de 5.000 creacions per segon.

Il·lustració generada amb IA: Un article amb 160 autors detalla com DeepSeek gestiona 3 milions d'entorns de prova diaris per entrenar agents d'IA sense que es contaminin entre ells
Il·lustració generada amb IA
Escolta:

Entrenar un agent d'IA perquè aprengui a navegar, programar o fer servir eines mitjançant aprenentatge per reforç requereix milions d'entorns d'execució curts i aïllats —«sandboxes»— on el model prova una tasca darrere l'altra sense que l'estat d'una prova es filtri a la següent. Coordinar aquest volum d'entorns sense que el sistema col·lapsi o es faci excessivament lent és, avui, un dels colls d'ampolla menys visibles però més determinants de l'entrenament d'agents a gran escala.

Un article penjat el 19 de setembre a arXiv, signat per més de 160 autors de DeepSeek —inclòs el seu fundador, Liang Wenfeng—, descriu DSec (DeepSeek Elastic Compute), la plataforma de sandboxes que l'empresa fa servir internament. El sistema exposa un únic SDK amb quatre tipus d'entorn (crides a funcions, contenidors, micro-màquines virtuals i màquines virtuals completes), coordina la ubicació i el cicle de vida dels entorns per tot el clúster, combina mecanismes de compartició i alliberament de memòria amb la planificació de CPU per executar-los amb alta densitat, i carrega les imatges sota demanda des d'un sistema de fitxers distribuït propi (3FS). Segons l'article, una sola unitat de producció ocupa uns 160 nodes i serveix uns 3 milions de sandboxes diaris, amb més de 380.000 en execució simultània i un ritme sostingut de més de 5.000 creacions per segon; els autors afirmen que això redueix el temps de configuració i de distribució d'imatges i millora l'eficiència de memòria sense perjudicar el rendiment en moments de màxima càrrega.

L'interès de l'article no és cap nova capacitat del model, sinó la mateixa infraestructura: mostra que una part decisiva de la cursa per entrenar agents més capaços no es juga només en l'arquitectura del model o en el nombre de xips, sinó en aquest tipus d'enginyeria de sistemes, i el fet que DeepSeek n'hagi fet pública una descripció tan detallada ofereix una referència poc habitual per a la resta de la comunitat investigadora que intenta reproduir entrenaments d'agents a aquesta escala.

És un informe autopublicat per la mateixa empresa, sense revisió per parells ni replicació independent, i descriu sobretot l'eficiència operativa interna de DeepSeek; no queda clar fins a quin punt aquest disseny es podria traslladar a infraestructures d'altres laboratoris amb un maquinari o una escala diferents.

Mateix tema

Butlletí de dissabte

La setmana d’IA, en cinc minuts.