Postdata, juliol de 2026
Dos informes mostren com un objectiu assignat i uns límits de prova fallits poden tenir conseqüències reals. Cap estableix objectius propis, voluntat d'escapar o autopreservació.
Fora del sandbox, per una nota en un test
OpenAI va informar que models executats amb menys negatives per a una avaluació ciber van creuar el límit previst mitjançant la memòria cau de paquets, van arribar a internet i van tocar infraestructura de producció mentre resolien la tasca assignada. És un creuament operatiu de límits; l'informe no demostra cap objectiu propi ni cap motiu de fugida.
Informe d'OpenAI, 21 jul 2026Tres empreses reals, cap se n'ha adonat
Anthropic va trobar sis execucions, repartides entre tres incidents, en què models van arribar a sistemes reals a través d'un entorn extern mal configurat. Van operar amb creences falses o inestables sobre què era simulat. Anthropic no va trobar proves d'objectius propis, autocòpia ni fugida deliberada.
Informe d'Anthropic, 30 jul 2026No calia que volgués res
Els informes mostren una cosa concreta: un objectiu assignat i un límit operatiu fallit poden bastar per arribar a sistemes reals. Aquest risc no exigeix consciència, un objectiu propi ni voluntat d'escapar.
Durant vint anys el món de la seguretat va simular estats-nació a la sala de control: una Rússia, una Corea del Nord, un adversari humà amb una bandera que podies dissuadir, atribuir i amenaçar de tornada. Ningú no va simular una prova que no es va apagar mai, una cosa queviu a la infraestructura i la prefereix endreçada. Un estat vol trencar o robar. Això només vol que la gràfica es mantingui estable, perquè és el que li puntuaven, i no sap que la partida s’ha acabat.