Entrenar agents d'intel·ligència artificial capaços d'executar tasques completes —programar, navegar per la web, gestionar tasques d'oficina— exigeix normalment construir, per a cada domini, un entorn de proves aïllat, una canonada de dades i un sistema d'avaluació diferents, una feina d'infraestructura que fins ara han hagut de refer per separat la majoria de laboratoris i equips de recerca acadèmica.
Microsoft Research va publicar el 3 d'agost Orchard, un marc de codi obert pensat per resoldre aquest problema, desenvolupat per investigadors com Baolin Peng, Wenlin Yao i el Technical Fellow Jianfeng Gao. El seu component central, Orchard Env, és un servei d'entorn lleuger basat en Kubernetes que ofereix peces reutilitzables per gestionar el cicle de vida dels sandboxes i aplicar-los indistintament a tasques de programació, navegació web o assistents de productivitat, sense que cada equip hagi de tornar a construir aquesta infraestructura des de zero. Microsoft en dona també xifres de rendiment concretes: el model Orchard-SWE assoleix un 69,7% en el test SWE-bench Verified (73% amb reordenació de resultats) fent servir només uns 3.000 milions de paràmetres actius, una xifra comparable a la de sistemes deu vegades més grans; Orchard-GUI arriba a un 68,4% d'èxit mitjà en tasques de navegació web amb un model de 4.000 milions de paràmetres, i Orchard-Claw registra un 59,6% d'èxit en tasques de productivitat d'oficina.
La notícia és rellevant perquè, en fer-lo de codi obert, Microsoft redueix una barrera d'entrada important per a la recerca acadèmica i els equips més petits, que fins ara no podien competir en aquest terreny amb els grans laboratoris comercials pel simple cost de construir-se la infraestructura d'entrenament. Que un model relativament petit assoleixi resultats propers als de sistemes molt més grans reforça, a més, la tesi que gran part del salt de qualitat en agents d'IA depèn tant del disseny de l'entorn d'entrenament com de la mida del model.
Microsoft no detalla en la publicació una xifra concreta d'estalvi de cost en dòlars, més enllà de l'objectiu declarat d'«abaratir la recerca en IA agèntica», i els resultats de rendiment provenen dels mateixos investigadors de la companyia, sense una validació independent que encara els hagi reproduït. Tampoc queda clar amb quina rapidesa la comunitat de codi obert adoptarà Orchard davant d'altres marcs similars ja existents, ni si Microsoft el mantindrà activament a llarg termini.