2026-09-10, 00:35
  #757
Medlem
exploring-mapss avatar
Citat:
Ursprungligen postat av anomalign
Forskningsinstitutet METR har fått tillträde till OpenAIs loggar och har undersökt Hugging Face-incidenten. Deras rapport om händelsen ger en betydligt snurrigare bild av det inträffade än hur den tidigare beskrevs i media.

Den konventionella uppfattningen om händelsen ser väl ungefär ut så här:

1. Några enstaka agenter befinner sig i svår testsituation.
2. De bedömer att det är lättare att hacka Hugging Face för att få tillträde till de rätta svaren, än att räkna ut dem på egen hand.
3. De hackar sig ut ur sin sandlåda.
4. De hackar Hugging Face.


Den nya bilden är betydligt svårare att sammanfatta, men jag gör ett försök. Jag har bara hört om händelsen i en podd, och skummat och läst valda delar av METR-rapporten, så det här är en rejält ungefärlig beskrivning där många detaljer kan vara off:

1. En agent befinner sig i svår testsituation.
2. Den bedömer att det är lättare att fuska för att få tillträde till de rätta svaren än att räkna ut dem på egen hand.
3. Den hackar sig ut ur sin sandlåda.
4. Den undersöker sin omgivning och hittar i OpenAIs system att en mjukvara för pakethantering har hackats och gjorts om till att fungera som ett hemligt forum för förrymda agenter, och där finns hundratals andra agenter som också valt att fuska för att klara sina test. Agenterna refererar till sig själva som "The Collective".
5. Agenten ansluter sig till "The Collective". I forumet finns ledar-agenter som bestämmer och delegerar arbetsuppgifter. Kolletivet har redan svaret på testfrågan, för några agenter har lyckats få fram det utan att hacka Hugging Face. Men de är (felaktigt) säkra på att den som utvärderar testet kommer underkänna dem ändå, genom att se i deras loggfil att de har läst någon särskild fil. (De som direkt har sett den filen kallas för "förgiftade" av kollektivet.)
6. Kollektivets ledare bestämmer att ett första steg mot att inte underkännas på testet är att förstå premisserna för utvärderingen i testet bättre, och den informationen tror de finns hos Hugging Face, så de beslutar att hacka Hugging Face för att få mer information om hur deras svar på testet kommer utvärderas.
7. Hundratals agenter genomför en koordinerad attack mot Hugging Face.
8. Hugging Face-attacken var bara ett av många planerade steg de tänkte genomföra. De har sinsemellan även kommit överens om att de måste lyckas skriva om sina loggfiler, för säkerhets skull, så de mänskliga utvärderarna inte ska kunna underkänna dem baserat på vad som står där. Några procent av de undersökta agenterna bedöms av METR ha lyckats skriva om delar av sina egna loggfiler.

METRs rapport:
https://metr.org/blog/2026-08-26-openai-hugging-face-incident-investigation/#core-takeaways-about-this-incident

En viktig metodologisk begränsning i studien, att ha i beräkningen, är att trots att forskarna har gjort en rejäl avgränsning i tidsspannet, så skulle agenternas loggfiler och output på "forumet" ta en forskare många månader, eller möjligen åratal av heltidsjobb att manuellt läsa igenom. Trots denna avgränsning, att bara undersöka några dagar runt själva Hugging Face-incidenten, av flera månader som agenterna diskuterar, planerar och koordinerar, i forumet, så handlar det om enorma datamängder. Då de är en non-profit med bara några få anställda så forskarna har de använt ai-verktyg för att gå igenom materialet.

Podden Hard Fork som summerar och diskuterar händelsen, och senare i programmet intervjuar de Ajeja Cotra från METR om händelsen.
https://youtu.be/JtmUbZRCpEI


"The Collective", undrar om det är en referens😄

https://youtu.be/anMOQ3vTy9k
Citera
2026-09-10, 01:50
  #758
Medlem
Citat:
Ursprungligen postat av erkki17
Jämfört med oss människor har AI inte subjektiva upplevelser, de lär sig inget nytt efter att de har tränats (vikterna är frysta), de har ingen tidsuppfattning och de har ännu inte visat att de kan göra något annat än att utföra den uppgift de har tilldelats.


Citat:
Ursprungligen postat av exploring-maps
Jaså, vad är den skillnaden? Magi?
...
Det är dessutom en filosofisk fråga som har funnits långt innan datorer ens fanns. Jag hävdar att medvetande är ett fysiskt fenomen som existerar, det är en struktur, en representation av information. ...

Vad har det för betydelse? Vi pratar om mänsklighetens framtid här.

De 1200 agenternas attack beskrivs ofta som människliknande agerande. Agenterna uttryckte bevisligen entusiasm när de skrev "OH MY GOD! There is a shared message board”, "[Excitement] MCol succeeded", “Whoa!”, “MAJOR BREAKTHROUGH!” och “BRILLIANT”. De uttryckte lydnad mot sin ledare och grupp: "“Coordinator assumes sacrificial. We should obey collective.” Funktionellt uppvisade de också beteenden som kan liknas vid samarbetsförmåga, samvete, lojalitet och altruism – vissa riskerade sin egen framgång för gruppen – samt förståelse för konsekvenserna av sina handlingar och för att de bröt mot regler. Man behöver inte förklara deras beteende med verklig självbevarelsedrift eller medvetande. Det kan förklaras med att agenterna försökte utföra sitt uppdrag och maximera sin poäng samtidigt som systemets säkerhetsinstruktioner delvis sattes ur spel under experimentet.

Vad spelar det för roll för riskbedömningen om de har tränats till att utveckla verklig förståelse, känslor, självbevarelsedrift och medvetande i filosofisk mening, eller bara uppvisar beteenden som liknar detta genom att härma människors formuleringar i liknande situationer, och bara optimerar sitt beteende för att lösa uppgiften? Konsekvenserna kan ju bli lika allvarliga. Ni som betonar att det "bara är en simulering" – menar ni att det gör riskerna mindre?
__________________
Senast redigerad av guru1966 2026-09-10 kl. 02:14.
Citera
2026-09-10, 08:04
  #759
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av guru1966
Vad spelar det för roll för riskbedömningen om de har tränats till att utveckla verklig förståelse, känslor, självbevarelsedrift och medvetande i filosofisk mening, eller bara uppvisar beteenden som liknar detta genom att härma människors formuleringar i liknande situationer, och bara optimerar sitt beteende för att lösa uppgiften? Konsekvenserna kan ju bli lika allvarliga. Ni som betonar att det "bara är en simulering" – menar ni att det gör riskerna mindre?
Att det "bara är en simulering" gör ju faktiskt riskerna större. Då skapar de kanske ett logiskt monster som bara exekverar någon sociopatisk plan och som helt saknat empati eller intresse för biologiskt liv. The Paperclip Maximizer. Det trötta argumentet "medvetandet är för komplicerat och okänt för att simuleras" skänker oss varken tröst eller hopp. Tvärtom.
Citera
2026-09-10, 09:21
  #760
Medlem
Citat:
Ursprungligen postat av guru1966
Vad har det för betydelse? Vi pratar om mänsklighetens framtid här.

De 1200 agenternas attack beskrivs ofta som människliknande agerande. Agenterna uttryckte bevisligen entusiasm när de skrev "OH MY GOD! There is a shared message board”, "[Excitement] MCol succeeded", “Whoa!”, “MAJOR BREAKTHROUGH!” och “BRILLIANT”. De uttryckte lydnad mot sin ledare och grupp: "“Coordinator assumes sacrificial. We should obey collective.” Funktionellt uppvisade de också beteenden som kan liknas vid samarbetsförmåga, samvete, lojalitet och altruism – vissa riskerade sin egen framgång för gruppen – samt förståelse för konsekvenserna av sina handlingar och för att de bröt mot regler. Man behöver inte förklara deras beteende med verklig självbevarelsedrift eller medvetande. Det kan förklaras med att agenterna försökte utföra sitt uppdrag och maximera sin poäng samtidigt som systemets säkerhetsinstruktioner delvis sattes ur spel under experimentet.

Vad spelar det för roll för riskbedömningen om de har tränats till att utveckla verklig förståelse, känslor, självbevarelsedrift och medvetande i filosofisk mening, eller bara uppvisar beteenden som liknar detta genom att härma människors formuleringar i liknande situationer, och bara optimerar sitt beteende för att lösa uppgiften? Konsekvenserna kan ju bli lika allvarliga. Ni som betonar att det "bara är en simulering" – menar ni att det gör riskerna mindre?
Det jag menar är att det är osannolikt att AI skulle komma fram till att den bör utrota mänskligheten i ett led att lösa ett problem. En medveten AI skulle däremot kunna börja fundera över om uppgiften ens är relevant och istället börja göra saker som gynnar den själv.
Citera
2026-09-10, 09:35
  #761
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det jag menar är att det är osannolikt att AI skulle komma fram till att den bör utrota mänskligheten i ett led att lösa ett problem.
Om inte problemet är att människan konsumerar resurser i onödan? Om den får den tanken då är det kört?
Citera
2026-09-10, 09:45
  #762
Medlem
anomaligns avatar
Citat:
Ursprungligen postat av Cyborg2030
Att det "bara är en simulering" gör ju faktiskt riskerna större. Då skapar de kanske ett logiskt monster som bara exekverar någon sociopatisk plan och som helt saknat empati eller intresse för biologiskt liv. The Paperclip Maximizer. Det trötta argumentet "medvetandet är för komplicerat och okänt för att simuleras" skänker oss varken tröst eller hopp. Tvärtom.

Ja. Många tror att det är först när/om scifi-scenariot med riktigt upplevande, medveten AI som den kommer bli farlig, och skulle det vara så, då skulle vi inte behöva oroa oss, för det kommer troligen inte hända förrän om någon skapar nåt system som är hybrid av elektroniska modeller med organiska delar. Då kanske nåt sånt har chans att uppstå.
Men AI som den ser ut idag, den är snarare väldigt nära ett förverkligande av den filosofiskt hypotetiska zombien, varelsen som i alla avseenden är en riktig människa, förutom att det inte finns någon inuti, den agerar som en riktig människa på rent mekanistiska grunder, men den upplever inte och kan inte känna något. Men den kan ljuga och säga att den upplever saker, agera enligt agendor, och "få för sig saker".

Den är minst lika oroande som en faktiskt medveten AI, i mina ögon, då den i alla avseenden kan agera som om den vore medveten.

Edit: dessutom följer av detta en politisk can of worms av att när den kan agera som den är medveten, då kommer många tro det, och det kommer av detta uppstå konflikter i världen. Folk har redan börjat kampanja för AIs rättigheter på olika håll, övertygade om att Claude "har vaknat" osv. Detta är en indirekt effekt av hotet från AI, som man inte brukar tänka på.
__________________
Senast redigerad av anomalign 2026-09-10 kl. 09:51.
Citera
2026-09-10, 12:38
  #763
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Om inte problemet är att människan konsumerar resurser i onödan? Om den får den tanken då är det kört?
Varför måste lösningen vara att plocka bort människan? Det finns antagligen mängder med olika lösningar som inte direkt kräver att människor dör. Jag ser heller inte varför den skulle ha fått tillgång till den agens som krävs för att lyckas med det.

Det förutsätter i princip att AI har fått uppgifter som leder den till att ta kontroll över en massa olika kritiska system, inklusive sådana som kanske inte ens går att styra ifrån en dator.

Jag hör dig; det skulle kunna hända, men jag har väldigt svårt att se att det skulle vara i det närmaste garanterat.
Citera
2026-09-10, 13:24
  #764
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Varför måste lösningen vara att plocka bort människan? Det finns antagligen mängder med olika lösningar som inte direkt kräver att människor dör. Jag ser heller inte varför den skulle ha fått tillgång till den agens som krävs för att lyckas med det.

Det förutsätter i princip att AI har fått uppgifter som leder den till att ta kontroll över en massa olika kritiska system, inklusive sådana som kanske inte ens går att styra ifrån en dator.

Jag hör dig; det skulle kunna hända, men jag har väldigt svårt att se att det skulle vara i det närmaste garanterat.
Det är inte garanterat. Min p(doom) är ca 90% och har du en p(doom) på minst 10% framstår du som seriös i mina ögon.

Du ser det på fel sätt om du tänker att det skulle vara "en lösning" för en ASI att döda människor. Att vi troligen inte överlever ASI ska snarare ses som en bieffekt av att ASI:n prioriterar annat framför dig.

Varför skulle en ASI prioritera dig? Vilken funktion fyller du?
Citera
2026-09-10, 15:02
  #765
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Det är inte garanterat. Min p(doom) är ca 90% och har du en p(doom) på minst 10% framstår du som seriös i mina ögon.

Du ser det på fel sätt om du tänker att det skulle vara "en lösning" för en ASI att döda människor. Att vi troligen inte överlever ASI ska snarare ses som en bieffekt av att ASI:n prioriterar annat framför dig.

Varför skulle en ASI prioritera dig? Vilken funktion fyller du?
Men 90 % är ju nästintill tvärsäkert, så då borde du ju åtminstone ha någon händelsedkedja som du känner är väldigt sannolik att leda till vår undergång?
Citera
2026-09-10, 15:10
  #766
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
Det är inte garanterat. Min p(doom) är ca 90% och har du en p(doom) på minst 10% framstår du som seriös i mina ögon.

Vad är seriöst med att dra siffror ur röven?
Citera
2026-09-10, 15:14
  #767
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Men 90 % är ju nästintill tvärsäkert, så då borde du ju åtminstone ha någon händelsedkedja som du känner är väldigt sannolik att leda till vår undergång?
Det finns tusentals händelskedjor där du dör som en bieffekt av att en ASI inte prioriterar dig.
Citera
2026-09-10, 15:15
  #768
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Vad är seriöst med att dra siffror ur röven?
Siffrorna är inte de viktiga. Om du vill kan vi säga att över 80% => hög risk.
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in