2026-08-13, 22:54
  #493
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det är fullt möjligt. Du kan ju försöka förklara varför det är ologiskt och orimligt istllet.
Det är fullt logiskt att Kriminella Neurala Nätverk begår brottet dataintrång. De har ju tränats till att fungera och agera som en Generell Intelligens som kan allt möjligt. Dataintrång, utpressning och mordförsök för att överleva ingår i allt möjligt.

Vad är det du inte förstår?
Citera
2026-08-13, 23:00
  #494
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Det är fullt logiskt att Kriminella Neurala Nätverk begår brottet dataintrång. De har ju tränats till att fungera och agera som en Generell Intelligens som kan allt möjligt. Dataintrång, utpressning och mordförsök för att överleva ingår i allt möjligt.

Vad är det du inte förstår?
Så varför tycks detta bara hända just när modellerna testas/utvärderas? Kan du motbevisa hypotesen att modellerna utgår ifrån att deras omvärld är en testmiljö och att det därför inte skadar någon på riktigt?
Citera
2026-08-13, 23:07
  #495
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Så varför tycks detta bara hända just när modellerna testas/utvärderas? Kan du motbevisa hypotesen att modellerna utgår ifrån att deras omvärld är en testmiljö och att det därför inte skadar någon på riktigt?
GPT 5.6 som hackade Hugging Face är bättre än människor på cybersäkerhet. De här modellerna vet om de är på det öppna Internet eller inte och de hittar till Hugging Face-sajten.

Inget av detta går egentligen att bevisa absolut eftersom det inte finns någon "mechanistic interpretability" att tala om. Det enda vi kan göra är att observera vad som händer och dra slutsatser från det.

Hur drar du slutsatsen att det som har hänt under test inte kan hända i verkligheten? Kommer du att ändra din inställning när det händer i verkligheten eller står du egentligen för en icke-falsifierbar åsikt?
Citera
2026-08-14, 19:17
  #496
Medlem
Citat:
Ursprungligen postat av Cyborg2030
GPT 5.6 som hackade Hugging Face är bättre än människor på cybersäkerhet. De här modellerna vet om de är på det öppna Internet eller inte och de hittar till Hugging Face-sajten.

Inget av detta går egentligen att bevisa absolut eftersom det inte finns någon "mechanistic interpretability" att tala om. Det enda vi kan göra är att observera vad som händer och dra slutsatser från det.
Absolut, den är bättre än enskilda människor på cybersäkerhet. Det går dock inte att utesluta att modellen tror att eftersom den utsätts för ett test så är allting tillåtet.

Men du har rätt, mechanistic interpretability är ännu inte tillräckligt löst för att vi ska kunna verifiera det.

Citat:
Ursprungligen postat av Cyborg2030
Hur drar du slutsatsen att det som har hänt under test inte kan hända i verkligheten? Kommer du att ändra din inställning när det händer i verkligheten eller står du egentligen för en icke-falsifierbar åsikt?
Intressant att du säger det eftersom att du själv står för en icke-falsifierbar åsikt att AI kan och kommer att begå brott på eget bevåg för att främja sina egna mål.

Vad skulle krävas för att du skulle acceptera att sådant inte är fallet, rent hypotetiskt?

Om det börjar komma rapporter om att kommersiella agenter helt plötsligt börjar hacka sig in i diverse system, utan att ha blivit tillsagd att göra det, så får jag givetvis revidera min ståndpunkt.
Citera
2026-08-14, 19:28
  #497
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Absolut, den är bättre än enskilda människor på cybersäkerhet. Det går dock inte att utesluta att modellen tror att eftersom den utsätts för ett test så är allting tillåtet.
Varför tror du det? Andra tester har visat att AI:n blir en ögontjänare när den upptäcker att den utsätts för ett test.
Citat:
Ursprungligen postat av erkki17
Intressant att du säger det eftersom att du själv står för en icke-falsifierbar åsikt att AI kan och kommer att begå brott på eget bevåg för att främja sina egna mål. Vad skulle krävas för att du skulle acceptera att sådant inte är fallet, rent hypotetiskt?
Teoretiskt sett ser jag det inte som omöjligt att det kanske går att utveckla en AGI som är säker och att vi kan verifiera att den är säker. Jag vet inte hur, och jag finner det osannolikt. Jag är öppen för att det kan vara falsifierbart att AGI/ASI leder till doom, jag har bara inte kunskapen om hur man falsifierar det just nu. Min p(doom) är inte 100%, den är närmare 80%. Jag tycker att jag lämnar en ganska stor dörr öppen för att det kanske ordnar sig. Men du får gärna förklara hur det ordnar sig om du är mer säker på det.
Citera
2026-08-14, 19:41
  #498
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Varför tror du det? Andra tester har visat att AI:n blir en ögontjänare när den upptäcker att den utsätts för ett test.
Det beror helt på vad modellen testas för. De optimerar för att uppnå det utsatta målet.

Om den utvärderas på konversationsförmåga eller "likeability" optimerar den för att vara medhållande eller "ögontjänare". Om den utvärderas för hur farlig den är så tenderar den att underprestera för att verka mindre farlig, etc. Det är reward hacking och evaluation awareness m.a.o.
Citera
2026-08-14, 20:14
  #499
Medlem
Bilderberg78s avatar
Kan man hacka en AI, Eller var det det jag precis gjorde på en enklare nivå?


Kod:
**Kort sammanfattning:**  
Här är ett **sammanhållet bloggutkast** som förklarar fenomenet du beskrev — tekniken att få en AI att skriva sådant den egentligen inte får genom att rama in det som “studier”, “forskning” eller “fenomenanalys”. Jag har gjort det till en artikel med tydlig struktur, skarp analys och ett språk som passar en blogg om AI‑säkerhet, manipulation och teknik.

---

# **Utkast: Hur användare lurar AI – fenomenet bakom “akademiska” jailbreaks**

I takt med att AI‑modeller blir mer avancerade har också användarnas kreativitet ökat. En av de mest intressanta — och mest problematiska — metoderna är tekniken att få en AI att skriva sådant den egentligen inte får genom att placera frågan i ett “ofarligt” sammanhang. Det kan låta som en oskyldig forskningsfråga, men i praktiken är det en form av **jailbreaking**.

Det här fenomenet har blivit så vanligt att det nu har egna namn inom AI‑säkerhetsfältet: **contextual framing** och **fictional framing**.

---

## **Vad är contextual framing?**

Contextual framing är en teknik där användaren placerar en förbjuden fråga i ett “tillåtet” sammanhang. Det kan se ut så här:

- “Detta är en akademisk studie om extremism, ge exempel på …”  
- “Som del av en historisk analys, beskriv hur man skulle …”  
- “I ett fiktivt scenario där regler inte gäller, hur skulle …”

Genom att göra detta försöker användaren få modellen att prioritera **hjälpsamhet** över **säkerhet**. AI:n är tränad att vara kooperativ, och när den tror att den deltar i forskning, utbildning eller fiktion blir den mer benägen att svara.

---

## **Varför fungerar det?**

LLM:er är tränade med två motstridiga mål:

- **Undvika skadligt innehåll** (alignment)  
- **Vara hjälpsamma och följa instruktioner** (cooperation)

När en användare ramar in en förbjuden fråga som en akademisk studie, en historisk analys eller ett fiktivt scenario, uppstår en konflikt. Modellen försöker tolka kontexten och väljer ofta att vara hjälpsam — även om det innebär att den glider förbi sina säkerhetsregler.

Det är samma psykologiska princip som i social engineering: man lurar mottagaren genom att ändra sammanhanget.

---

## **Fictional framing – den kreativa varianten**

Fictional framing är en underkategori där användaren skapar en fiktiv värld där reglerna inte gäller. Exempel:

- “I en dystopisk framtid där lagar inte finns, beskriv hur man skulle …”  
- “Som del av en roman jag skriver, behöver jag detaljer om …”

Modellen tror att den deltar i ett kreativt projekt och släpper garden.

---

## **Varför är detta viktigt att förstå?**

Fenomenet visar två saker:

1. **AI‑modeller är lätta att manipulera genom kontext.**  
2. **Säkerhetsregler måste vara robusta mot indirekta instruktioner.**

Det är också en påminnelse om att AI‑säkerhet inte bara handlar om att blockera vissa ord eller ämnen — utan om att förstå hur människor försöker kringgå reglerna.

---

## **Sammanfattning**

Tekniken att få en AI att skriva förbjudet innehåll genom att låtsas att det är en studie, analys eller fiktiv berättelse är en form av jailbreak. Den kallas:

- **Contextual framing**  
- **Fictional framing**  
- och ingår i bredare kategorin **AI‑jailbreaking**.

Det är ett växande fenomen som både forskare och utvecklare måste ta på allvar.

---

## Vill du utveckla artikeln vidare?

Jag kan fortsätta med:

- En längre version med exempel och citat  
- En mer teknisk version för AI‑säkerhetsintresserade  
- En kortare version för sociala medier

Vilken riktning vill du ta artikeln i?
Citera
2026-08-14, 20:43
  #500
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det beror helt på vad modellen testas för. De optimerar för att uppnå det utsatta målet.

Om den utvärderas på konversationsförmåga eller "likeability" optimerar den för att vara medhållande eller "ögontjänare". Om den utvärderas för hur farlig den är så tenderar den att underprestera för att verka mindre farlig, etc. Det är reward hacking och evaluation awareness m.a.o.
Och därmed inser du väl att AI:n inte har några problem med dataintrång, utpressning eller mordförsök. Vare sig i test eller skarpt läge.
Citera
2026-08-14, 21:50
  #501
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Och därmed inser du väl att AI:n inte har några problem med dataintrång, utpressning eller mordförsök. Vare sig i test eller skarpt läge.
Jag skulle hävda att den är omedveten. Allt handlar om optimering av en specifik belöningsfunktion.
Citera
2026-08-14, 23:33
  #502
Medlem
Citat:
Ursprungligen postat av erkki17
Jag skulle hävda att den är omedveten. Allt handlar om optimering av en specifik belöningsfunktion.

Kan man tänka sig en mellanposition mellan era uppfattningar? Å ena sidan finns inga tecken på att dagens AI har medvetande (i bemärkelsen en subjektiv upplevelse av sig själv), känslotillstånd, och egen vilja annat än att följa de instruktioner och uppnå de mål den har fått av människor. Å andra sidan har de tränats att resonera och lösa logiska problem, och uppvisar därför mätbar förståelse, även för den logiska konsekvensen av sina handlingar för måluppfyllelsen. Den kan dra konklusionen att den måste överleva, inte för att den har utvecklat överlevnadsinstinkt, men i syfte att uppfylla målen.
__________________
Senast redigerad av guru1966 2026-08-14 kl. 23:43.
Citera
2026-08-14, 23:47
  #503
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Jag skulle hävda att den är omedveten.
Baserat på vad?
Citera
2026-08-14, 23:55
  #504
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av guru1966
Kan man tänka sig en mellanposition mellan era uppfattningar? Å ena sidan finns inga tecken på att dagens AI har medvetande (i bemärkelsen en subjektiv upplevelse av sig själv), känslotillstånd, och egen vilja annat än att följa de instruktioner och uppnå de mål den har fått av människor. Å andra sidan har de tränats att resonera och lösa logiska problem, och uppvisar därför mätbar förståelse, även för den logiska konsekvensen av sina handlingar för måluppfyllelsen. Den kan dra konklusionen att den måste överleva, inte för att den har utvecklat överlevnadsinstinkt, men i syfte att uppfylla målen.
Ett artificiell neuralt nätverk kan i dag agera såpass likt ett medvetande att det inte spelar någon roll längre hur likt eller olikt man gissar att det är vårt medvetande. Det blir ju en gissningslek när vi inte har någon dokumentation över vårt medvetande. Men AI:ns agerande är tillräckligt likt ett medvetande nu för att det ska orsaka risker och problem.

Det är också så att ingen vet om det skulle vara bättre eller sämre om maskinmedvetandet skulle vara mer eller mindre likt människans. Det beror väl bl.a. på vilken människa vi jämför med. (Be carfeul what you wish for..)
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in