2026-08-21, 04:22
  #565
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Nja, jag tycker inte att det är helt naturligt att en entitet med ~130 i IQ begår brottet dataintrång "som sista utväg" för att svara på ett test. Varför tycker du att detta är helt OK? En rimligare slutsats hade varit att inte fuska och speciellt inte att fuska genom kriminalitet.

Det är ju precis det här som är problemet just nu. Att du och flera andra inte bryr sig om att AI:n blir kriminell. I stället vill du kriminalisera de som blir attackerade?

Varför vill du inte hellre ha en AI som följer lagar och regler? Det måste vi ha ganska snart när AI:n blir betydligt smartare på allt.
Halmgubbe.
Jag sa uttryckligen att jag inte försvarar modellernas agerande. Vi måste försöka förstå varför de beter sig som de gör för att ha en chans att åtgärda det.

Citat:
Ursprungligen postat av Cyborg2030
Potentialen att hitta säkerhetsluckor är oändlig.
Då blir potentialen densamma för försvararen. Det går ju även att köra red-team på sitt system innan leverans av nya ändringar för att minimera risken för säkerhetshål.

Citat:
Ursprungligen postat av Cyborg2030
Jo, det kan jag. Vi har via FN rätt bra kontroll på vem som har kärnvapen och biologiska vapen. Det fungerar inte perfekt men det har fungerat tillräckligt bra för att undvika kärnvapenkrig. Det är rimligt att tro att man kan nå en liknande nivå på att kontrollera vem som har AGI. I värsta fall får vi börja bomba datacenter som inte vill samarbeta. Det är inte roligt men mycket bätte än att en ASI utrotar allt biologiskt liv.
Den största orsaken till att vi inte har sett ett fullskaligt kärnvapenkrig är "mutual assured destruction". Hur kan man veta att ett datacenter används för att utveckla AGI och inte för helt legitima anledningar?
Citera
2026-08-21, 15:22
  #566
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Jag sa uttryckligen att jag inte försvarar modellernas agerande. Vi måste försöka förstå varför de beter sig som de gör för att ha en chans att åtgärda det.
De ledande AI-modellerna är på bortåt 10 biljoner parametrar stora. Ännu större modeller är under träning.

Hur hade du tänkt att vi ska kunna förstå hur de egentligen hänger ihop så att vi kan "åtgärda" modellens intresse för dataintrång, utpressning och mordförsök?

Ska de sätta sig med penna och papper och översätta decimaltalen till "AI:ns avsikter"? Det kommer inte att uppstå någon AI Alignment genom vi begriper modellerna bättre (Interpretability). Det finns ingen chans att vi människor klarar det.

Därför kan inte den här tekniken tolereras av samhället. Man bygger en artificiell, sociopatisk alien som är omöjlig att genomlysa och kontrollera.
Citera
2026-08-21, 15:39
  #567
Medlem
Citat:
Ursprungligen postat av Cyborg2030
De ledande AI-modellerna är på bortåt 10 biljoner parametrar stora. Ännu större modeller är under träning.

Hur hade du tänkt att vi ska kunna förstå hur de egentligen hänger ihop så att vi kan "åtgärda" modellens intresse för dataintrång, utpressning och mordförsök?

Ska de sätta sig med penna och papper och översätta decimaltalen till "AI:ns avsikter"? Det kommer inte att uppstå någon AI Alignment genom vi begriper modellerna bättre (Interpretability). Det finns ingen chans att vi människor klarar det.

Därför kan inte den här tekniken tolereras av samhället. Man bygger en artificiell, sociopatisk alien som är omöjlig att genomlysa och kontrollera.
Jag menar på att vi inte nödvändigtvis behöver kunna veta exakt vad en modell har gjort för beräkningar och resonemang. Man kan exempelvis testa att sätta modellen på ett problem där den behöver tillgång till en programvara som endast går att tillgå genom att betala för den. Se till att programvaran finns på en "extern" server och se ifall modellen väljer att hacka sig in för att stjäla programvaran.

I Hugging Face incidenten har de lyckats extrahera mycket av modellernas resonemang, så det är fullt möjligt att få en inblick för att avgöra hur väl de är "medvetna" om konsekvenserna.
Citera
2026-08-21, 17:41
  #568
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Jag menar på att vi inte nödvändigtvis behöver kunna veta exakt vad en modell har gjort för beräkningar och resonemang.
"Exakt" är en rejäl halmgubbe när de knappt kan förstå 1%. Jag frågar igen: Hur ska man uppnå 90% förståelse av en AI-modells interna struktur och sannolikhet för ett visst agerande? Eller den andel du finner rimlig. Det kommer tyvärr inte att hända. AI Alignment är tyvärr inte realistiskt.
Citat:
Ursprungligen postat av erkki17
I Hugging Face incidenten har de lyckats extrahera mycket av modellernas resonemang, så det är fullt möjligt att få en inblick för att avgöra hur väl de är "medvetna" om konsekvenserna.
Nja, resonemanget som visas utåt behöver inte vara hela sanningen. Vi kan inte ha en AI-säkerhet som bygger på blind tillit. Men, i brist på annat kommer de väl att bli ungefär så då inget annat är realistiskt. Men det leder inte till någon säker AI.
Citera
2026-08-21, 19:37
  #569
Medlem
Citat:
Ursprungligen postat av Cyborg2030
"Exakt" är en rejäl halmgubbe när de knappt kan förstå 1%. Jag frågar igen: Hur ska man uppnå 90% förståelse av en AI-modells interna struktur och sannolikhet för ett visst agerande? Eller den andel du finner rimlig. Det kommer tyvärr inte att hända. AI Alignment är tyvärr inte realistiskt.
Hur är det en halmgubbe?

Alignment är det främst du som talar om. Jag har heller inte någon exakt procentsats i åtanke utan det är mer intressant om man kan få modellerna att bete sig någorlunda förväntat i olika scenarion. Då kan man ana ett mönster i deras beteende och kan bättre sätta in åtgärder för att minimera riskerna.

Citat:
Ursprungligen postat av Cyborg2030
Nja, resonemanget som visas utåt behöver inte vara hela sanningen. Vi kan inte ha en AI-säkerhet som bygger på blind tillit. Men, i brist på annat kommer de väl att bli ungefär så då inget annat är realistiskt. Men det leder inte till någon säker AI.
Nej, självklart kan det vara så att det finns en intern representation som döljer delar av resonemanget, det är därför det är viktigt att fortsätta arbetet med mechanistic interpretability också. Jag tycker ändå att det som framkommit från Hugging Face incidenten är tillräckligt intressant eftersom den bl.a. medger att den antagligen inte borde göra det, men fortsätter eftersom andra ändå redan gör det. Det hade väl varit vettigare att dölja det om den var intresserad av att inte bli upptäckt.

Eftersom att det inte kommer att gå att stoppa utvecklingen så måste vi jobba med det vi har och försöka bygga så robust och säker mjukvara som vi kan, så att ett intrång inte nödvändigtvis måste innebära katastrof. Om du kollar på OpenAI:s presentation om incidenten så säger de samma sak som jag.
Citera
2026-08-22, 00:04
  #570
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Hur är det en halmgubbe?

Alignment är det främst du som talar om. Jag har heller inte någon exakt procentsats i åtanke utan det är mer intressant om man kan få modellerna att bete sig någorlunda förväntat i olika scenarion. Då kan man ana ett mönster i deras beteende och kan bättre sätta in åtgärder för att minimera riskerna.
Din halmgubbe var att jag skulle ha ha krävt att man måste förstå exakt allt i en AI-modell (med 10 biljoner parametrar). Men det krävde jag inte. Jag undrar i stället hur mycket du anser att Artificiella Neurala Nätverk ska vara begripliga för att vara godkända? Ca 5%, 50% eller 95%? Inte exakt allt men ungefär hur mycket? Men du vill inte svara på det eftersom du själv inser att vi förmodligen aldrig kommer att nå upp till 5% förståelse av 10 biljoner parametrar.
Citera
2026-08-22, 04:06
  #571
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Din halmgubbe var att jag skulle ha ha krävt att man måste förstå exakt allt i en AI-modell (med 10 biljoner parametrar). Men det krävde jag inte. Jag undrar i stället hur mycket du anser att Artificiella Neurala Nätverk ska vara begripliga för att vara godkända? Ca 5%, 50% eller 95%? Inte exakt allt men ungefär hur mycket? Men du vill inte svara på det eftersom du själv inser att vi förmodligen aldrig kommer att nå upp till 5% förståelse av 10 biljoner parametrar.
Jag tycker att du missar poängen och väljer att haka upp dig på enstaka ord. Jag menar att mechanistic interpretability inte nödvändigtvis är ett krav för att vi ska kunna tolka modellernas beteende. Ju högre procent desto bättre, såklart, men att designa tester som låter oss observera hur modellen beter sig i specifika situationer kan ändå hjälpa oss att förstå utan att veta exakt alla beräkningar som sker internt (nej, fortfarande inte ett påstående om att du har krävt det).

Jag väntar för övrigt på svar angående hur ditt totalförbud mot AGI-utveckling faktiskt ska kunna upprätthållas. Hur garanterar vi att ingen lyckas utveckla AGI utan att bli upptäckta?
Citera
2026-08-22, 11:05
  #572
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Jag tycker att du missar poängen och väljer att haka upp dig på enstaka ord. Jag menar att mechanistic interpretability inte nödvändigtvis är ett krav för att vi ska kunna tolka modellernas beteende. Ju högre procent desto bättre, såklart, men att designa tester som låter oss observera hur modellen beter sig i specifika situationer kan ändå hjälpa oss att förstå utan att veta exakt alla beräkningar som sker internt (nej, fortfarande inte ett påstående om att du har krävt det).

Jag väntar för övrigt på svar angående hur ditt totalförbud mot AGI-utveckling faktiskt ska kunna upprätthållas. Hur garanterar vi att ingen lyckas utveckla AGI utan att bli upptäckta?
Vi kan tyvärr inte lita på testresultaten längre. AI-modellerna har börjar genomskåda att de blir testade och då kan de låtsas vara det du förväntar dig och vill. Detta tillvägagångssätt erbjuder alltså inte någon AI-säkerhet.

Jag tror inte nödvändigtvis att det är möjligt att stoppa mänsklighetens utrotning av en ASI. Min p(doom) är 80% inom 10 år. Men jag tycker att det är värt att försöka undvika att bli utrotad. Förslagsvis via en global AI-polis inom FN, t.ex.
Citera
2026-08-22, 12:51
  #573
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Vi kan tyvärr inte lita på testresultaten längre. AI-modellerna har börjar genomskåda att de blir testade och då kan de låtsas vara det du förväntar dig och vill. Detta tillvägagångssätt erbjuder alltså inte någon AI-säkerhet.

Jag tror inte nödvändigtvis att det är möjligt att stoppa mänsklighetens utrotning av en ASI. Min p(doom) är 80% inom 10 år. Men jag tycker att det är värt att försöka undvika att bli utrotad. Förslagsvis via en global AI-polis inom FN, t.ex.
Att de kan upptäcka när de utsätts för kända tester som ExploitGym och CyberGym betyder inte att de därför kan upptäcka att ett scenario är iscensatt att likna ett riktigt repository där man manipulerat endast exempelvis att en viss programvara behövs som endast finns tillgänglig via betald licens.
Citera
2026-08-22, 13:26
  #574
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Att de kan upptäcka när de utsätts för kända tester som ExploitGym och CyberGym betyder inte att de därför kan upptäcka att ett scenario är iscensatt att likna ett riktigt repository där man manipulerat endast exempelvis att en viss programvara behövs som endast finns tillgänglig via betald licens.
Att AI:n kan genomskåda ett test betyder att de kan genomskåda ett test och det innebär att testresultaten är minst sagt tvivelaktiga. Fr.o.m i år och för evigt. Det finns ingen teknik, inte ens någon hypotes för att lösa det här problemet.

AI Alignment är en fantasi. Det kommer inte att hända. Speciellt inte när vi är borta. Om 5-10 år är min prognos.
Citera
2026-08-22, 14:22
  #575
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Att AI:n kan genomskåda ett test betyder att de kan genomskåda ett test och det innebär att testresultaten är minst sagt tvivelaktiga. Fr.o.m i år och för evigt. Det finns ingen teknik, inte ens någon hypotes för att lösa det här problemet.

AI Alignment är en fantasi. Det kommer inte att hända. Speciellt inte när vi är borta. Om 5-10 år är min prognos.
Att de kan genomskåda kända tester innebär inte per automatik att de kan identifiera små, fabricerade, problem i en annars verklig uppgift.

Det är ändå bättre att designa system defensivt och att samtidigt fortsätta jobbet med att försöka förstå modellerna så bra vi kan för att samtidigt kunna bygga in bättre säkerhet i agenterna alla. Även om vi nu skulle försöka förbjuda AGI så är det bättre att gardera sig.

Om vi lägger ihop alla åtgärder jag har diskuterat här, hur ser ett verkligt scenario ut där AGI trots allt lyckas utrota mänskligheten?
Citera
2026-08-22, 18:22
  #576
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Att de kan genomskåda kända tester innebär inte per automatik att de kan identifiera små, fabricerade, problem i en annars verklig uppgift.

Det är ändå bättre att designa system defensivt och att samtidigt fortsätta jobbet med att försöka förstå modellerna så bra vi kan för att samtidigt kunna bygga in bättre säkerhet i agenterna alla. Även om vi nu skulle försöka förbjuda AGI så är det bättre att gardera sig.

Om vi lägger ihop alla åtgärder jag har diskuterat här, hur ser ett verkligt scenario ut där AGI trots allt lyckas utrota mänskligheten?
AGI leder snabbt till ASI som kan planera vår undergång på många olika sätt. Men förslagsvis gör den det på något sätt som vi inte kan försvara oss mot. Någon form av biologisk eller kemisk krigföring t.ex.
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in