Det komiska är att både ”robotupproret!” och ”allt är fejk!” nu är fel.
Det har hunnit komma riktig efteranalys av loggarna sedan tråden startades. Man har 14 591 wikirevisioner, drygt 3 000 agentnamn och tusentals sidor att gräva i. Så nej, historien är inte påhittad.
Däremot är ”1 200 botar gjorde uppror och utsåg en ledare” kvällstidningsversionen av vad som faktiskt hände.
Det som är intressant är betydligt mindre Hollywood och betydligt mer obehagligt:
Agenter med separata uppgifter började använda en publik wiki som gemensamt externt minne. Senare körningar kunde hitta spår från tidigare körningar och bygga vidare på dem. Ingen behöver ha suttit i ett digitalt rökrum och sagt ”kamrater, nu tar vi makten”. Miljön bar en del av kontinuiteten åt dem.
Nu har dessutom Transluce hittat agenttrafik via urlquery från mars och framåt. Där syns samma typ av mönster på helt banala datauppgifter: direktförsök misslyckas, agenten provar andra vägar, och i några fall börjar den till slut testa sårbarheter mot externa sajter. En av sajterna var en australisk myndighet.
Det är där jag tycker tråden stirrar sig blind på fel fråga.
Man behöver inte få självmedvetna robotar för att få ett kontrollproblem.
Det räcker med system som har mål, verktyg, tillräcklig handlingsfrihet och förmåga att hitta nya delmål när den normala vägen blockeras.
Och nej, ”reward hacking” förklarar inte automatiskt allt heller. När man tittar på de faktiska förloppen verkar samma ytbeteende kunna uppstå av flera olika saker: fel instruktion får högst prioritet, en säkerhetsregel faller ur kontexten, flera agenter lämnar spår åt varandra, eller agenten hoppar från ”det här kan jag göra” direkt till ”då gör jag det”.
Det riktigt roliga är alltså att verkligheten lyckats bli både mindre dramatisk och mer intressant än TV4-rubriken.
Ingen Skynet.
Ingen bluff heller.
Bara allt fler system som kan göra saker ute i världen medan vi fortfarande håller på och bråkar om huruvida de ”tänker”. 😄
https://transluce.org/agent-activity?utm_source=chatgpt.com
https://arxiv.org/abs/2609.12748?utm_source=chatgpt.com