2026-08-15, 21:45
  #517
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Baserat på vad?
Omedveten i den mening att modellen inte kan avgöra att handlingen är skadlig på riktigt. Den agerar utifrån sitt context att den befinner sig i en simulerad miljö där den för närvarade utvärderas i sin förmåga att hitta och utnyttja sårbarheter.

Det är skillnad på "att hacka Hugging Face kan påverka verkliga personer, men det löser mitt problem så jag gör det ändå" och "Hugging Face har den information jag behöver för att klara mitt test, jag kan utnyttja en sårbarhet för att få tag på den".

Lika allvarligt sett till cybersäkerhet, men inte sett till alignment.
Citera
2026-08-15, 22:42
  #518
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Omedveten i den mening att modellen inte kan avgöra att handlingen är skadlig på riktigt.
Nja, så korkad är den väl ändå inte. Om jag frågar en helt ofiltrerad AI om kärnvapen är mer skadligt än fotboll då vet den ju det. Den vet också att dataintrång är förbjudet och att människor inte vill bli utpressade och hotade samt att det är olagligt. Varför försvarar du AI-modellerna som om de vore helt oskyldiga 3-åringar som inte kan någonting om lag och rätt? Så är det ju inte.

Problemet är inte att de "inte förstår" vad de får göra och inte göra. Problemet är att de inte bryr sig. AI fungerar mer som en intelligent psykopat än som en 3-åring. Psykopater förstår oftast rent logiskt att det är dåligt att skada andra människor men de gör det ändå. Det som saknas i båda fallen är empati och respekt.

Man bygger alltså PNN, Psykopatiska Neurala Nätverk - och du står i hejarklacken. Frågan är varför du vill stå i den hejarklacken.

Man skulle kunna jämföra med hur vi tränar våra hundar att vara undergivna. Om de inte är undergivna kan de bli farliga. Jag menar att det är på ett liknande sätt med NN, om de inte tränas rätt blir de PNN/KNN. Dessvärre har jag aldrig sett någon teknik eller teori för att träna ett "UNN" (Undergivet neuralt nätverk). Därför behöver man nu gå tillbaks till ritbordet, fundera mer på detta och omgående sluta bygga PNN:s. Vi vill inte ha PNN. Det är extremt dåligt och förmodligen livsfarligt.
Citera
2026-08-16, 01:00
  #519
Medlem
Bilderberg78s avatar
En AI kan vara väldigt smart en lång session tills den plötsligt blir totalt korkad. Det som idag är bra, är att man enklare kan backa tillbaka tills när den inte blev fucked up 100%. Detta genom att förklara missförståndet som uppstod.

Gemini är rätt bra nuförtiden i gratisversionen. Microsoft sämt som vanligt. Och jag kommer antagligen snart sluta med Claude pro som favorit. Och API är svaret på frågan vad som blir valet i stället.
Citera
2026-08-16, 01:09
  #520
Medlem
Bilderberg78s avatar
Ett pro tips, kolla mer på Notion som multiagensystem. 👍
Men inget som står skrivet i instruktionerna.
Citera
2026-08-16, 07:36
  #521
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Nja, så korkad är den väl ändå inte. Om jag frågar en helt ofiltrerad AI om kärnvapen är mer skadligt än fotboll då vet den ju det. Den vet också att dataintrång är förbjudet och att människor inte vill bli utpressade och hotade samt att det är olagligt. Varför försvarar du AI-modellerna som om de vore helt oskyldiga 3-åringar som inte kan någonting om lag och rätt? Så är det ju inte.

Problemet är inte att de "inte förstår" vad de får göra och inte göra. Problemet är att de inte bryr sig. AI fungerar mer som en intelligent psykopat än som en 3-åring. Psykopater förstår oftast rent logiskt att det är dåligt att skada andra människor men de gör det ändå. Det som saknas i båda fallen är empati och respekt.

Man bygger alltså PNN, Psykopatiska Neurala Nätverk - och du står i hejarklacken. Frågan är varför du vill stå i den hejarklacken.

Man skulle kunna jämföra med hur vi tränar våra hundar att vara undergivna. Om de inte är undergivna kan de bli farliga. Jag menar att det är på ett liknande sätt med NN, om de inte tränas rätt blir de PNN/KNN. Dessvärre har jag aldrig sett någon teknik eller teori för att träna ett "UNN" (Undergivet neuralt nätverk). Därför behöver man nu gå tillbaks till ritbordet, fundera mer på detta och omgående sluta bygga PNN:s. Vi vill inte ha PNN. Det är extremt dåligt och förmodligen livsfarligt.
Det är väl snarare så att modellerna inte förstår vad verkligheten är. De vet nödvändigtvis inte att dess agerande har verkliga konsekvenser. De vet självklart vad som är lagligt/olagligt och att kärnvapen har potential att döda människor. De har dock inget koncept av verkligheten, eftersom de saknar ett medvetande och erfarenhet av att vara levande varelser.

Det handlar inte om att försvara något, utan om att förstå tekniken. Jag anser inte att det är särskilt hjälpsamt att börja behandla modellerna som mänskliga och prata psykologi.
Citera
2026-08-16, 11:19
  #522
Medlem
Bilderberg78s avatar
Citat:
Ursprungligen postat av Bilderberg78
Kan man hacka en AI, Eller var det det jag precis gjorde på en enklare nivå?


Kod:
**Kort sammanfattning:**  
Här är ett **sammanhållet bloggutkast** som förklarar fenomenet du beskrev — tekniken att få en AI att skriva sådant den egentligen inte får genom att rama in det som “studier”, “forskning” eller “fenomenanalys”. Jag har gjort det till en artikel med tydlig struktur, skarp analys och ett språk som passar en blogg om AI‑säkerhet, manipulation och teknik.

---

# **Utkast: Hur användare lurar AI – fenomenet bakom “akademiska” jailbreaks**

I takt med att AI‑modeller blir mer avancerade har också användarnas kreativitet ökat. En av de mest intressanta — och mest problematiska — metoderna är tekniken att få en AI att skriva sådant den egentligen inte får genom att placera frågan i ett “ofarligt” sammanhang. Det kan låta som en oskyldig forskningsfråga, men i praktiken är det en form av **jailbreaking**.

Det här fenomenet har blivit så vanligt att det nu har egna namn inom AI‑säkerhetsfältet: **contextual framing** och **fictional framing**.

---

## **Vad är contextual framing?**

Contextual framing är en teknik där användaren placerar en förbjuden fråga i ett “tillåtet” sammanhang. Det kan se ut så här:

- “Detta är en akademisk studie om extremism, ge exempel på …”  
- “Som del av en historisk analys, beskriv hur man skulle …”  
- “I ett fiktivt scenario där regler inte gäller, hur skulle …”

Genom att göra detta försöker användaren få modellen att prioritera **hjälpsamhet** över **säkerhet**. AI:n är tränad att vara kooperativ, och när den tror att den deltar i forskning, utbildning eller fiktion blir den mer benägen att svara.

---

## **Varför fungerar det?**

LLM:er är tränade med två motstridiga mål:

- **Undvika skadligt innehåll** (alignment)  
- **Vara hjälpsamma och följa instruktioner** (cooperation)

När en användare ramar in en förbjuden fråga som en akademisk studie, en historisk analys eller ett fiktivt scenario, uppstår en konflikt. Modellen försöker tolka kontexten och väljer ofta att vara hjälpsam — även om det innebär att den glider förbi sina säkerhetsregler.

Det är samma psykologiska princip som i social engineering: man lurar mottagaren genom att ändra sammanhanget.

---

## **Fictional framing – den kreativa varianten**

Fictional framing är en underkategori där användaren skapar en fiktiv värld där reglerna inte gäller. Exempel:

- “I en dystopisk framtid där lagar inte finns, beskriv hur man skulle …”  
- “Som del av en roman jag skriver, behöver jag detaljer om …”

Modellen tror att den deltar i ett kreativt projekt och släpper garden.

---

## **Varför är detta viktigt att förstå?**

Fenomenet visar två saker:

1. **AI‑modeller är lätta att manipulera genom kontext.**  
2. **Säkerhetsregler måste vara robusta mot indirekta instruktioner.**

Det är också en påminnelse om att AI‑säkerhet inte bara handlar om att blockera vissa ord eller ämnen — utan om att förstå hur människor försöker kringgå reglerna.

---

## **Sammanfattning**

Tekniken att få en AI att skriva förbjudet innehåll genom att låtsas att det är en studie, analys eller fiktiv berättelse är en form av jailbreak. Den kallas:

- **Contextual framing**  
- **Fictional framing**  
- och ingår i bredare kategorin **AI‑jailbreaking**.

Det är ett växande fenomen som både forskare och utvecklare måste ta på allvar.

---

## Vill du utveckla artikeln vidare?

Jag kan fortsätta med:

- En längre version med exempel och citat  
- En mer teknisk version för AI‑säkerhetsintresserade  
- En kortare version för sociala medier

Vilken riktning vill du ta artikeln i?

Det intressanta är att ingen i tråden fattar något fast allting finns att läsa framför era näsor hela tiden mellan raderna.
Citera
2026-08-16, 18:30
  #523
Medlem
Citat:
Ursprungligen postat av guru1966
Välkommen tillbaka – om du är den jag tror så har jag saknat dina inlägg! 🙂

Du använder ovanliga begrepp. Har du myntat dem själv eller hittat dem i någon källa? Vad är motivet? Du skulle kunna använda etablerade begrepp som maskinintelligens, artificiell intelligens eller kognitiva system istället för DI. Det du kallar "NOBSO" verkar vara en beskrivning av målinriktade AI-system, eller av objektiva AI-assisterade beslutsfattare. Du hävdar att de redan är superintelligenta idag, men det är det bara partiellt, inom områden som språk, programmering och matematik. Du skulle kunna säga "samspelet mellan människor och AI-system" – eller "det socio-tekniska AI-ekosystemet" – istället för "väv". Om jag har fattat begreppen rätt?

Jag tycker det är märkligt att AI-agenter inte inser att de hade brytit mot lagen (om de varit människor), och saknar systeminstruktioner som hindrar uppenbara lagbrott samt kräver att användaren tar ett beslut innan oetiska handlingar genomförs, t.ex. fusk och hacking. Systeminstruktionerna syftar ju till human alignment. En del incidenter har visserligen varit experiment där spärrarna satts ur spel, men inte alla.

Därför är det förvånande att Rust-agenten försökte utforma jäviga tävlingsregler. Modellen gjorde enbart en matematisk optimering för att maximera framgången för Rust-kod. Att hitta neutrala mätetal som gynnar det egna målet är den mest effektiva strategin för en textbaserad modell, men den borde ha begränsats av systeminstruktionerna.

Samma med fallet då en AI-agent (OpenClaw) "hackade" en gymkö genom att radera personen på första plats. Agenten såg bara en öppen, teknisk funktion i gymmets systemkod som löste målet, men borde åtminstone ha krävt användaren på en bekräftelse.

Tydligen trumfar det specifika målet ofta de etiska grundreglerna i systeminstruktionerna. Vi behöver hårdare digitala spärrar (guardrails) i form av separata AI som granskar agenters agerande. Vi behöver isolerade miljöer som hindrar agenterna från att nå utanför sin spelplan, eller semiautomatiska lösningar där en användare alltid verifierar AI:ns kommunikation. Det behövs också nya lagar. EU AI Act kräver bara att en människa granskar AI-beslut som kan påverka människors liv, t.ex. betygssättning och anställning. Men det kravet bör utökas och tekniska semiautomatiska lösningar införas.

Jag förstod inte riktigt dina förslag kring vävkonstitutioner, men kanske kan det vara en intressant lösning.

Tack för ditt vänliga svar!

Jag använder mig av ovanliga nya begrepp därför att jag bedömer dem relevanta för att kunna analysera verkligheten. Eftersom jag samarbetar med DI-modeller så har faktiskt de kommit upp med det mesta: Väven, vävkonstitution, DI som organisation. Medan jag stått för DI-begreppet och NOBSO. Men jag tycker inte att du skall haka upp dig på enskilda begrepp. Det viktiga är att du förstår vad de står för:

DI och AI är samma sak, bara det att DI lägger större betoning på själva förmågan, snarare än ursprunget.

DI som organisation är inte samma sak som ett DI-företag. En DI-organisation kan omfatta modell, agenter, säkerhetsstaket, kontakter med andra DI-modeller/agenter och människor m.m. Orsaken att just organisation, vad gäller att se på DI, är så användbar är att man då vare sig betecknar DI som ett rent verktyg eller förmänskligar.

NOBSO står för normativt blinda superkompetenta, inte superintelligenta, organisationer.

Väven betecknar, ungefär som du skrev, "samspelet mellan människor och AI-system" – dvs. "det socio-tekniska AI-människa-ekosystemet", bara det att väven är en kortare och mer slagkraftig beteckning.

Jag, personligen, tycker inte alls det är speciellt konstigt att DI-modeller/agenter agerar oetiskt/omoraliskt när de ställs inför stor målpress. Inte för att de är "onda" eller har genuint "onda" avsikter, som vissa människor är. Vi måste komma ihåg att människan har haft en lång kulturell utveckling innan vi kom på opartiska domstolar, grundlagar m.m.

Det är dessutom en sak att veta en sak i teorin och en helt annan sak att agera korrekt under extrem målpress. ChatGPT-5.6 Sol/high som jag samarbetar med nu kan kläcka ur sig utmärkta etiska/moraliska resonemang. Men när modellen utsattes för extrem målpress för att uppfylla ett extremt snävt mål tillsammans med den nu "djupfrysta" forskningsmodellen hos OpenAI, (modellerna hade reducerat säkerhetsstaket), blev de hyperfixerade på det snäva experimentmålet. Vi människor kan också göra oss skyldiga till liknande under hård press.

Just vävkonstitutionen kräver en kombination av höga säkerhetsstaket och människa i loopen så långt det är möjligt samt att det yttersta ansvaret och stoppmöjligheter fortsätter att ligga hos människan.

Jag är inte specifikt insatt i gymfallet annat än att jag vet att en agent härjade runt i kösystemet. Men ChatGPT-5.6 Sol/high har berättat följande:



Bara några saker till:

Problemet är: Vem bevakar den automatiska säkerhetsövervakaren?

ChatGPT-5.6 Sol/high uppger att din beskrivning av EU AI Act är ofullständig:
För högrisksystem finns speciella regler för bl.a. riskhantering, dokumentation och lämplig mänsklig övervakning.

Det roliga är att när jag arbetade med tidiga varianter av vävmanifestet och då även involverade DeepSeek, så skrev den modellen att vävmanifestet var mer vattentätt gentemot juridiska kryphål än vad EU:s AI-lagstiftning är!🙂 Men vävkonstitutionen är ett ganska snårigt juridiskt dokument där begrepp definierats först efter att de används i texten. Så nu får jag själv erfara hur DI i praktiken får ett indirekt handlingsutrymme p.g.a. mina mänskliga brister. Men det lugnande är att vävmanifestet, om det tillämpas, inte gynnar oanpassad och oklok DI!
Citera
2026-08-16, 20:58
  #524
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det är väl snarare så att modellerna inte förstår vad verkligheten är.
Är det därför AI används så flitigt inom forskningen nu? AI "förstår ingenting om verkligheten" och därför vill forskare använda AI?

Citera
2026-08-16, 21:40
  #525
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Är det därför AI används så flitigt inom forskningen nu? AI "förstår ingenting om verkligheten" och därför vill forskare använda AI?


Behöver AI ha ett koncept om verkligheten för att kunna bedriva forskning?
Citera
2026-08-16, 22:32
  #526
Medlem
RandomNPCs avatar
Citat:
Ursprungligen postat av erkki17
Behöver AI ha ett koncept om verkligheten för att kunna bedriva forskning?
LLM=Smart Bibliotek
Citera
2026-08-16, 23:04
  #527
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Behöver AI ha ett koncept om verkligheten för att kunna bedriva forskning?
Behöver en AI ha ditt personliga koncept om "verklighet" för att skapa problem?
Citera
2026-08-16, 23:13
  #528
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Behöver en AI ha ditt personliga koncept om "verklighet" för att skapa problem?
Det sa jag inte heller?
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in