2026-07-08, 21:26
  #145
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av kaerakel
Vi har redan avhandlat detta. Slutsatsen var att du inte förstår varken hur säkerhetsarbetet med språkmodeller fungerar, eller hur den fungerar i olika träningsfaser. Fråga mig om du är nyfiken.
Vilket säkerhetsarbete? Syftar du på Anthropics Regex-filter som dirigerar olämpliga frågor till Opus 4.8?
Citera
2026-07-08, 21:43
  #146
Medlem
kaerakels avatar
Citat:
Ursprungligen postat av Cyborg2030
Vilket säkerhetsarbete? Syftar du på Anthropics Regex-filter som dirigerar olämpliga frågor till Opus 4.8?

Tack för att du faktiskt erkänner din okunskap. Det gör det enklare.

OpenAI har en bra artikel om deras syn på säkerhet, bl a:

Citat:
First, in training our models for safety we apply multiple layers of support: teaching models to understand⁠ and to adhere to core safety values⁠, teaching them to follow user instructions and navigate conflicting instructions from different sources⁠, training them to be reliable even in the face of uncertainty, and making it robust to adversarial inputs.

Wikipediaartikeln ger dig problemformulering och tillvägagångssätt:


Citat:
In the field of artificial intelligence (AI), alignment aims to steer AI systems toward a person's or group's intended goals, preferences, or ethical principles. An AI system is considered aligned if it advances the intended objectives. A misaligned AI system pursues unintended objectives.[1]

Det är så mycket mer invecklat än regex. Men det visste du säkert redan?
Citera
2026-07-08, 21:52
  #147
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av kaerakel
Tack för att du faktiskt erkänner din okunskap. Det gör det enklare.

OpenAI har en bra artikel om deras syn på säkerhet, bl a:



Wikipediaartikeln ger dig problemformulering och tillvägagångssätt:




Det är så mycket mer invecklat än regex. Men det visste du säkert redan?
De kan uttrycka en fin avsiktsförklaring. Men det betyder ju inte att det fungerar. Varför måste man omdirigera vissa requests om de har lyckats träna in "core values"?

De försöker säkert, men tyvärr är det ju inte så enkelt som avsikten säger.
Citera
2026-07-08, 22:06
  #148
Medlem
kaerakels avatar
Citat:
Ursprungligen postat av Cyborg2030
De kan uttrycka en fin avsiktsförklaring. Men det betyder ju inte att det fungerar. Varför måste man omdirigera vissa requests om de har lyckats träna in "core values"?

De försöker säkert, men tyvärr är det ju inte så enkelt som avsikten säger.

Det framgår rätt tydligt i artiklarna jag länkade. Det här med att utpressning är alltså något som sker under säkerhetsarbetet. Helt väntat.

Vad gäller Claude så kallar dom det nog försiktighetsprincipen. Användarna kallar det idioti, eftersom spärren är otroligt känslig.
Citera
2026-07-08, 22:45
  #149
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av kaerakel
Det framgår rätt tydligt i artiklarna jag länkade. Det här med att utpressning är alltså något som sker under säkerhetsarbetet. Helt väntat.

Vad gäller Claude så kallar dom det nog försiktighetsprincipen. Användarna kallar det idioti, eftersom spärren är otroligt känslig.
Det framgår att de har ambitionen att tillverka en säker AI. Det framgår dock inte hur det gör det eller om de har lyckats. Det ser inte ut som att Anthropic har lyckats när deras grundmodell inte följer "core values"/sunt förnuft. I stället måste användarna stoppas från att använda Mythos genom ett censurfilter som sitter framför modellen. Då har man misslyckats med att träna en säker AI. Och man är inte nära att lösa AI Alignment. När inte ens det mest uppenbara som att inte hacka sönder Internet eller att inte tillverka dödliga virus går att träna in i modellen. De vill säkert ha en laglydig AI-modell men de vet ju inte hur man gör.
Citera
2026-07-08, 23:19
  #150
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Det framgår att de har ambitionen att tillverka en säker AI. Det framgår dock inte hur det gör det eller om de har lyckats. Det ser inte ut som att Anthropic har lyckats när deras grundmodell inte följer "core values"/sunt förnuft. I stället måste användarna stoppas från att använda Mythos genom ett censurfilter som sitter framför modellen. Då har man misslyckats med att träna en säker AI. Och man är inte nära att lösa AI Alignment. När inte ens det mest uppenbara som att inte hacka sönder Internet eller att inte tillverka dödliga virus går att träna in i modellen. De vill säkert ha en laglydig AI-modell men de vet ju inte hur man gör.

De vill inte träna bort förmågan att svara på cybersäkerhetsfrågor. Fable använder alltså samma grundmodell som Mythos, men med extra skyddsåtgärder så att exportförbudet kunde hävas.

De hade kunnat träna modellen att vägra svara på denna typ av frågor, men det skulle ta längre tid och riskera att försämra modellen.
Citera
2026-07-08, 23:21
  #151
Medlem
kaerakels avatar
Citat:
Ursprungligen postat av Cyborg2030
Det framgår att de har ambitionen att tillverka en säker AI. Det framgår dock inte hur det gör det eller om de har lyckats. Det ser inte ut som att Anthropic har lyckats när deras grundmodell inte följer "core values"/sunt förnuft. I stället måste användarna stoppas från att använda Mythos genom ett censurfilter som sitter framför modellen. Då har man misslyckats med att träna en säker AI. Och man är inte nära att lösa AI Alignment. När inte ens det mest uppenbara som att inte hacka sönder Internet eller att inte tillverka dödliga virus går att träna in i modellen. De vill säkert ha en laglydig AI-modell men de vet ju inte hur man gör.

Från OpenAI artikeln:

Citat:
We do not assume we can predict all future challenges in AI alignment solely from theoretical principles. Achieving safe AGI demands engaging with reality: beyond laboratory experiments, we must test systems in the real world and draw on the collective insight of everyone involved.

Det finns inget ”lyckats” i sammanhanget, på samma sätt du aldrig kan garantera att ett mjukvarusystem är helt säkert. Därav provar man modellen genom hela träningscykeln.

Du kan ju se om du hittar några hål i modellens säkerhet och belönad med $$$. Alignment är också ett öppen forskningsfråga. Jag tycker den är rätt så säker ngl.

Någorlunda off-topic, så tar jag mig friheten att påpeka ett par logiska felslut i ditt resonemang. Det är relevant för du själv ogillar t ex halmgubbar, vilket är uppenbart i tråden.

Argument from Ignorance: ”Det framgår inte hur dom gör, [därför] vet dom inte hur man gör”. Du bör läsa på om detta innan du drar såna slutsatser.

Falsk dikotomi: du menar att antingen är modellen säker, eller så har man misslyckats med Alignment. Det stämmer inte. Säkerhetssystemen är som en lök, bygd i flera lager. I fallet med Fable 5 följer Anthropic störigt nog försiktighetsprincipen. Uppenbarligen är den säker för Opus dyker upp när jag vill peta lite i CSS:en.

Nirvana Fallacy: modellen kommer alltid kunna generera misaligned output, precis som säkerhetsbälten ändå leder till döden. Det är ingenjörskonst, och förbättringar sker inkrementellt. Du kan inte vänta dig en perfekt lösning. Det är utopi.

Fan, det finns ett par till klassiska felslut men lämnar det som uppgift till läsaren. Rätt uppenbart att du har dålig koll på detta iaf. Du behöver inte vara orolig över mördande chatbottar å det närmaste.
Citera
2026-07-08, 23:40
  #152
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
De vill inte träna bort förmågan att svara på cybersäkerhetsfrågor. Fable använder alltså samma grundmodell som Mythos, men med extra skyddsåtgärder så att exportförbudet kunde hävas.

De hade kunnat träna modellen att vägra svara på denna typ av frågor, men det skulle ta längre tid och riskera att försämra modellen.
Man kan träna en smal AI till en specifik uppgift och med väldigt låg risk för destruktiva utfall. Det är en bra idé. Det borde de göra mer av. Man kan dock inte träna en generellt intelligent AI men en mindre mängd handplockad träningsdata som aldrig kan tolkas destruktivt. Ingen litteratur, musik, filmmanus som innehåller våld, sex och droger. Ingen IT som har att göra med säkerhet. Ingen biologi eller fysik som kan medföra risker. Inga historieskildningar av krig. Ingen information om att människor äter kött som förutsätter slakt, dvs dödligt våld. Osv, tills det knappt finns någon träningsdata kvar.

Därför kan man inte träna en säker, generell AI-modell, ANN, eller "språkmodell". De kan bara träna en osäker AI som "säkras" med censur och därför kommer vi att få det. Men varför applåderar du det? Det kommer inte att hålla. Folk kommer att hitta vägar förbi censuren och andra kommer att skapa open source-modeller utan censur. Eller stulna modeller utan censur.
Citera
2026-07-08, 23:46
  #153
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av kaerakel
Från OpenAI artikeln:



Det finns inget ”lyckats” i sammanhanget, på samma sätt du aldrig kan garantera att ett mjukvarusystem är helt säkert. Därav provar man modellen genom hela träningscykeln.

Du kan ju se om du hittar några hål i modellens säkerhet och belönad med $$$. Alignment är också ett öppen forskningsfråga. Jag tycker den är rätt så säker ngl.

Någorlunda off-topic, så tar jag mig friheten att påpeka ett par logiska felslut i ditt resonemang. Det är relevant för du själv ogillar t ex halmgubbar, vilket är uppenbart i tråden.

Argument from Ignorance: ”Det framgår inte hur dom gör, [därför] vet dom inte hur man gör”. Du bör läsa på om detta innan du drar såna slutsatser.

Falsk dikotomi: du menar att antingen är modellen säker, eller så har man misslyckats med Alignment. Det stämmer inte. Säkerhetssystemen är som en lök, bygd i flera lager. I fallet med Fable 5 följer Anthropic störigt nog försiktighetsprincipen. Uppenbarligen är den säker för Opus dyker upp när jag vill peta lite i CSS:en.

Nirvana Fallacy: modellen kommer alltid kunna generera misaligned output, precis som säkerhetsbälten ändå leder till döden. Det är ingenjörskonst, och förbättringar sker inkrementellt. Du kan inte vänta dig en perfekt lösning. Det är utopi.

Fan, det finns ett par till klassiska felslut men lämnar det som uppgift till läsaren. Rätt uppenbart att du har dålig koll på detta iaf. Du behöver inte vara orolig över mördande chatbottar å det närmaste.
En AI-modell som är censurerad är inte säker. Censuren kommer inte stå emot i alla lägen och för all framtid. Speciellt inte om vi når AGI/ASI.
Citera
2026-07-08, 23:55
  #154
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
En AI-modell som är censurerad är inte säker. Censuren kommer inte stå emot i alla lägen och för all framtid. Speciellt inte om vi når AGI/ASI.

Med tanke på hur du beter dig så undrar man lite om du är rätt person att överhuvudtaget sia om vad som är säkert.

Och för den delen löste jag precis alignment problemet nu, jag illustrerar med följande ascii UML,
[Indata] <-> [Model] <-> [AI Alignment] <-> [Utdata]

Det absolut finaste i kråksången är att [AI Alignment] i sig är ett ANN och enligt cyborg blackbox principen så kommer den ha alla AI alignment egenskaper som behövs, den är också tränad så att man kan kedja på flera [AI Aligment] för att få super alignment- modellen är då säkrare än vad alla människor kollektivt kan tänka fram och så säker att det helt enkelt inte går att gå runt det alls.
Citera
2026-07-08, 23:58
  #155
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Med tanke på hur du beter dig så undrar man lite om du är rätt person att överhuvudtaget sia om vad som är säkert.

Och för den delen löste jag precis alignment problemet nu, jag illustrerar med följande ascii UML,
[Indata] <-> [Model] <-> [AI Alignment] <-> [Utdata]

Det absolut finaste i kråksången är att [AI Alignment] i sig är ett ANN och enligt cyborg blackbox principen så kommer den ha alla AI alignment egenskaper som behövs, den är också tränad så att man kan kedja på flera [AI Aligment] för att få super alignment- modellen är då säkrare än vad alla människor kollektivt kan tänka fram och så säker att det helt enkelt inte går att gå runt det alls.
Du vill alltså ha djävulens advokat. En AI som skyddar oss mot AI.
Citera
2026-07-09, 00:00
  #156
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
Du vill alltså ha djävulens advokat. En AI som skyddar oss mot AI.

Exakt. Och det bästa är att om djävulens advokat-AI:n blir korrupt, så kopplar vi bara på en [Djävulens Åklagare]-modul i nästa lager. Enligt cyborg-blackbox-principen tar de ut varandra och kvar blir en helt ren, laglydig AI. Det är bara att stapla på, fattar du väl?
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in