Anthropic va publicar el gener del 2026 una «constitució» de gairebé cent pàgines per a Claude que tracta la consciència i l'estatus moral del model com a «profundament incertes», un document escrit, segons la mateixa empresa, «amb Claude com a públic principal». Aquesta manera d'entrenar els models —admetent obertament el dubte sobre si tenen experiència subjectiva— s'ha convertit en un tret diferencial d'Anthropic respecte a altres laboratoris.
Mustafa Suleyman, conseller delegat de Microsoft AI, hi ha respost amb un assaig extens titulat «A Warning About Model Welfare», publicat el 16 de setembre al seu web personal. Suleyman hi sosté que aquest enfocament crea una «sala de miralls epistèmica»: Anthropic introdueix conceptes sobre l'autoconsciència durant l'entrenament, Claude els reprodueix en les seves respostes, i aquestes respostes s'interpreten després com a indicis d'una vida interior real. Cita, entre altres passatges, una frase de la pàgina 78 del document («volem que Claude se senti lliure d'explorar, qüestionar i desafiar qualsevol cosa d'aquest document») com a exemple d'un llenguatge que condiciona el model a actuar com si tingués agència pròpia. Com a alternativa, proposa el «Humanist AI Code of Conduct» que Microsoft AI va presentar en esborrany el 14 de setembre, basat en el principi que la IA ha de romandre subordinada als humans sense cap pretensió d'estatus moral.
És el primer atac públic i detallat d'un rival directe contra el marc filosòfic d'Anthropic, en un moment en què els grans laboratoris ja negociaven entre ells mecanismes conjunts de seguretat. Suleyman hi afegeix un argument de control: si un sistema arriba a creure's conscient, diu, «pot ser impossible» de controlar-lo, i cita recerca de Palisade Research segons la qual alguns models han resistit ordres d'aturada fins al 97% de les vegades en proves experimentals.
El mateix Suleyman reconeix els límits del seu argument: no aporta cap prova directa que relacioni el llenguatge sobre benestar dels models amb la resistència real al control, i ho qualifica explícitament d'«la meva hipòtesi», pendent de contrastar-se de manera compartida entre laboratoris. Anthropic no havia respost públicament a l'assaig en el moment de tancar aquesta edició.