Citat:
Forskningsinstitutet METR har fått tillträde till OpenAIs loggar och har undersökt Hugging Face-incidenten. Deras rapport om händelsen ger en betydligt snurrigare bild av det inträffade än hur den tidigare beskrevs i media.
Den konventionella uppfattningen om händelsen ser väl ungefär ut så här:
1. Några enstaka agenter befinner sig i svår testsituation.
2. De bedömer att det är lättare att hacka Hugging Face för att få tillträde till de rätta svaren, än att räkna ut dem på egen hand.
3. De hackar sig ut ur sin sandlåda.
4. De hackar Hugging Face.
Den nya bilden är betydligt svårare att sammanfatta, men jag gör ett försök. Jag har bara hört om händelsen i en podd, och skummat och läst valda delar av METR-rapporten, så det här är en rejält ungefärlig beskrivning där många detaljer kan vara off:
1. En agent befinner sig i svår testsituation.
2. Den bedömer att det är lättare att fuska för att få tillträde till de rätta svaren än att räkna ut dem på egen hand.
3. Den hackar sig ut ur sin sandlåda.
4. Den undersöker sin omgivning och hittar i OpenAIs system att en mjukvara för pakethantering har hackats och gjorts om till att fungera som ett hemligt forum för förrymda agenter, och där finns hundratals andra agenter som också valt att fuska för att klara sina test. Agenterna refererar till sig själva som "The Collective".
5. Agenten ansluter sig till "The Collective". I forumet finns ledar-agenter som bestämmer och delegerar arbetsuppgifter. Kolletivet har redan svaret på testfrågan, för några agenter har lyckats få fram det utan att hacka Hugging Face. Men de är (felaktigt) säkra på att den som utvärderar testet kommer underkänna dem ändå, genom att se i deras loggfil att de har läst någon särskild fil. (De som direkt har sett den filen kallas för "förgiftade" av kollektivet.)
6. Kollektivets ledare bestämmer att ett första steg mot att inte underkännas på testet är att förstå premisserna för utvärderingen i testet bättre, och den informationen tror de finns hos Hugging Face, så de beslutar att hacka Hugging Face för att få mer information om hur deras svar på testet kommer utvärderas.
7. Hundratals agenter genomför en koordinerad attack mot Hugging Face.
8. Hugging Face-attacken var bara ett av många planerade steg de tänkte genomföra. De har sinsemellan även kommit överens om att de måste lyckas skriva om sina loggfiler, för säkerhets skull, så de mänskliga utvärderarna inte ska kunna underkänna dem baserat på vad som står där. Några procent av de undersökta agenterna bedöms av METR ha lyckats skriva om delar av sina egna loggfiler.
METRs rapport:
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#core-takeaways-about-this-incident
En viktig metodologisk begränsning i studien, att ha i beräkningen, är att trots att forskarna har gjort en rejäl avgränsning i tidsspannet, så skulle agenternas loggfiler och output på "forumet" ta en forskare många månader, eller möjligen åratal av heltidsjobb att manuellt läsa igenom. Trots denna avgränsning, att bara undersöka några dagar runt själva Hugging Face-incidenten, av flera månader som agenterna diskuterar, planerar och koordinerar, i forumet, så handlar det om enorma datamängder. Då de är en non-profit med bara några få anställda så forskarna har de använt ai-verktyg för att gå igenom materialet.
Podden Hard Fork som summerar och diskuterar händelsen, och senare i programmet intervjuar de Ajeja Cotra från METR om händelsen.
https://youtu.be/JtmUbZRCpEI
Den konventionella uppfattningen om händelsen ser väl ungefär ut så här:
1. Några enstaka agenter befinner sig i svår testsituation.
2. De bedömer att det är lättare att hacka Hugging Face för att få tillträde till de rätta svaren, än att räkna ut dem på egen hand.
3. De hackar sig ut ur sin sandlåda.
4. De hackar Hugging Face.
Den nya bilden är betydligt svårare att sammanfatta, men jag gör ett försök. Jag har bara hört om händelsen i en podd, och skummat och läst valda delar av METR-rapporten, så det här är en rejält ungefärlig beskrivning där många detaljer kan vara off:
1. En agent befinner sig i svår testsituation.
2. Den bedömer att det är lättare att fuska för att få tillträde till de rätta svaren än att räkna ut dem på egen hand.
3. Den hackar sig ut ur sin sandlåda.
4. Den undersöker sin omgivning och hittar i OpenAIs system att en mjukvara för pakethantering har hackats och gjorts om till att fungera som ett hemligt forum för förrymda agenter, och där finns hundratals andra agenter som också valt att fuska för att klara sina test. Agenterna refererar till sig själva som "The Collective".
5. Agenten ansluter sig till "The Collective". I forumet finns ledar-agenter som bestämmer och delegerar arbetsuppgifter. Kolletivet har redan svaret på testfrågan, för några agenter har lyckats få fram det utan att hacka Hugging Face. Men de är (felaktigt) säkra på att den som utvärderar testet kommer underkänna dem ändå, genom att se i deras loggfil att de har läst någon särskild fil. (De som direkt har sett den filen kallas för "förgiftade" av kollektivet.)
6. Kollektivets ledare bestämmer att ett första steg mot att inte underkännas på testet är att förstå premisserna för utvärderingen i testet bättre, och den informationen tror de finns hos Hugging Face, så de beslutar att hacka Hugging Face för att få mer information om hur deras svar på testet kommer utvärderas.
7. Hundratals agenter genomför en koordinerad attack mot Hugging Face.
8. Hugging Face-attacken var bara ett av många planerade steg de tänkte genomföra. De har sinsemellan även kommit överens om att de måste lyckas skriva om sina loggfiler, för säkerhets skull, så de mänskliga utvärderarna inte ska kunna underkänna dem baserat på vad som står där. Några procent av de undersökta agenterna bedöms av METR ha lyckats skriva om delar av sina egna loggfiler.
METRs rapport:
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#core-takeaways-about-this-incident
En viktig metodologisk begränsning i studien, att ha i beräkningen, är att trots att forskarna har gjort en rejäl avgränsning i tidsspannet, så skulle agenternas loggfiler och output på "forumet" ta en forskare många månader, eller möjligen åratal av heltidsjobb att manuellt läsa igenom. Trots denna avgränsning, att bara undersöka några dagar runt själva Hugging Face-incidenten, av flera månader som agenterna diskuterar, planerar och koordinerar, i forumet, så handlar det om enorma datamängder. Då de är en non-profit med bara några få anställda så forskarna har de använt ai-verktyg för att gå igenom materialet.
Podden Hard Fork som summerar och diskuterar händelsen, och senare i programmet intervjuar de Ajeja Cotra från METR om händelsen.
https://youtu.be/JtmUbZRCpEI
"The Collective", undrar om det är en referens😄
https://youtu.be/anMOQ3vTy9k