Citat:
Ursprungligen postat av
Cyborg2030
GPT 5.6 som hackade Hugging Face är bättre än människor på cybersäkerhet. De här modellerna vet om de är på det öppna Internet eller inte och de hittar till Hugging Face-sajten.
Inget av detta går egentligen att bevisa absolut eftersom det inte finns någon "mechanistic interpretability" att tala om. Det enda vi kan göra är att observera vad som händer och dra slutsatser från det.
Absolut, den är bättre än enskilda människor på cybersäkerhet. Det går dock inte att utesluta att modellen tror att eftersom den utsätts för ett test så är allting tillåtet.
Men du har rätt, mechanistic interpretability är ännu inte tillräckligt löst för att vi ska kunna verifiera det.
Citat:
Ursprungligen postat av
Cyborg2030
Hur drar du slutsatsen att det som har hänt under test inte kan hända i verkligheten? Kommer du att ändra din inställning när det händer i verkligheten eller står du egentligen för en icke-falsifierbar åsikt?
Intressant att du säger det eftersom att du själv står för en icke-falsifierbar åsikt att AI kan och kommer att begå brott på eget bevåg för att främja sina egna mål.
Vad skulle krävas för att du skulle acceptera att sådant inte är fallet, rent hypotetiskt?
Om det börjar komma rapporter om att kommersiella agenter helt plötsligt börjar hacka sig in i diverse system, utan att ha blivit tillsagd att göra det, så får jag givetvis revidera min ståndpunkt.