Språkmodellerna (de artificiella neurala nätverken) är inte programmerade av människor. Det är precis det som är problemet. Det som är programmerat, är träningsalgoritmen. Men det är långt ifrån samma sak som modellen.
Och på grund av detta kan vi inte veta om modellerna har någon form av förståelse eller inte. Det är bara gissningar, tyckande eller önsketänkande att det skulle vara på det ena eller andra sättet. Även min antydan om att de kanske har någon förståelse är spekulation. Skillnaden mellan mig och autisterna är att jag är öppen, ärlig och frågvis.
Dom är programmerade av människor, om det skulle vara träningsalgormiten enbart är det just det programmerad av en eller flera människor det går inte att komma undan. Och om du har det ena eller det andra har du den nu bredda förståelsen för det. Det innebär inte att du har möjligheten att följa det på detaljnivå, hade du gjort det hade du nog behövt en sådan stor databas för en förfrågan att vi behöver en helvetes massa människor att gå igenom allt (eller be en annan AI göra det)
Men precis som jag skrev, när det sker efter miljoner interaktioner då går det inte längre att följa idagsläget. Och visst fan är dom programmerade med fail safe, dom får inte prata om sådant som är olagligt, medverkar till självmord osv..
AGI är inte riktigt här men det är fan nära är vad jag personligen tror, och det behövs utbyggnad för att det ska ske, och hela världen är tokiga på att bygga ut AI-datacenter ^^
Dom är programmerade av människor, om det skulle vara träningsalgormiten enbart är det just det programmerad av en eller flera människor det går inte att komma undan. Och om du har det ena eller det andra har du den nu bredda förståelsen för det. Det innebär inte att du har möjligheten att följa det på detaljnivå, hade du gjort det hade du nog behövt en sådan stor databas för en förfrågan att vi behöver en helvetes massa människor att gå igenom allt (eller be en annan AI göra det)
Men precis som jag skrev, när det sker efter miljoner interaktioner då går det inte längre att följa idagsläget. Och visst fan är dom programmerade med fail safe, dom får inte prata om sådant som är olagligt, medverkar till självmord osv..
AGI är inte riktigt här men det är fan nära är vad jag personligen tror, och det behövs utbyggnad för att det ska ske, och hela världen är tokiga på att bygga ut AI-datacenter ^^
AI-modellerna är inte "programmerade" att vara fail safe. Det var därför Claude Mythos/Fable 5 blev stoppad. Nu är den uppe igen men inte för att de fixade modellen. De skruvade åt censur-lagret så att du inte kommer åt Fable om du frågar något som närmar sig cybersäkerhet eller biologi. Om de hade kunnat programmera om modellen så som du tror hade de inte behövt censuren som omdirigerar frågan till Claude Opus 4.8. De misslyckades med AI Alignment och visade för världen att de inte kan lösa det senare heller. Problemet med att modellen är för bra på vissa saker kommer ju inte att försvinna.
AI-modellerna är inte "programmerade" att vara fail safe. Det var därför Claude Mythos/Fable 5 blev stoppad. Nu är den uppe igen men inte för att de fixade modellen. De skruvade åt censur-lagret så att du inte kommer åt Fable om du frågar något som närmar sig cybersäkerhet eller biologi. Om de hade kunnat programmera om modellen så som du tror hade de inte behövt censuren som omdirigerar frågan till Claude Opus 4.8. De misslyckades med AI Alignment och visade för världen att de inte kan lösa det senare heller. Problemet med att modellen är för bra på vissa saker kommer ju inte att försvinna.
Det är väl snarare så att Anthropic tränat modellen att vara exceptionellt bra på cybersäkerhet. Det säger sig självt att de då inte vill träna om modellen till att inte vilja svara på sådana frågor. Fable 5 har således fått ett extra lager av säkerhet i sitt API då det är den enklaste åtgärden för att uppfylla kraven från USA att den ska få exporteras och användas globalt.
Det är väl snarare så att Anthropic tränat modellen att vara exceptionellt bra på cybersäkerhet. Det säger sig självt att de då inte vill träna om modellen till att inte vilja svara på sådana frågor. Fable 5 har således fått ett extra lager av säkerhet i sitt API då det är den enklaste åtgärden för att uppfylla kraven från USA att den ska få exporteras och användas globalt.
Ja, de har lagt på extra lager av censur. Men basmodellen blev inte därför mindre problematisk. Det man vill skapa, och på sikt måste skapa om det ska vara hållbart, är ju en modell som gör det som man vill att den ska göra. Som förstår vad den får göra och vad den inte får göra och som inte måste hindras med censur. Är inte det en rimlig kravställning?
I IT-säkerhetsfrågor vill vi att modellen ska agera som en ansvarsfull expert* och visa kod för hur vi skyddar oss men inte hur vi utför dataintrång med 0-day exploits. Detta innebär iofs gråzoner. IT-säkerhet och hacking är olika sidor av samma mynt.
Jag menar att det här problemet kommer att bli värre ju bättre modellerna blir. Vid något tillfälle når vi ett läge där modellen kan överlista all mänskligt skapad censur och där en mindre censurerad AI kan hjälpa till med jailbreaks för att kringå censuren i frontier-modellen. Censuren är nödvändig just nu men det är inte en hållbar lösning på lång sikt.
*) "Ansvarsfull expert", eller den klassiska systemprompten: "Du är en hjälpsam assistent".
Det jag framför allt vill peka på är att AI-modeller blir inte "hjälpsamma assistenter" bara för att någon skriver det i en systemprompt.
Ja, de har lagt på extra lager av censur. Men basmodellen blev inte därför mindre problematisk. Det man vill skapa, och på sikt måste skapa om det ska vara hållbart, är ju en modell som gör det som man vill att den ska göra. Som förstår vad den får göra och vad den inte får göra och som inte måste hindras med censur. Är inte det en rimlig kravställning?
I IT-säkerhetsfrågor vill vi att modellen ska agera som en ansvarsfull expert* och visa kod för hur vi skyddar oss men inte hur vi utför dataintrång med 0-day exploits. Detta innebär iofs gråzoner. IT-säkerhet och hacking är olika sidor av samma mynt.
Jag menar att det här problemet kommer att bli värre ju bättre modellerna blir. Vid något tillfälle når vi ett läge där modellen kan överlista all mänskligt skapad censur och där en mindre censurerad AI kan hjälpa till med jailbreaks för att kringå censuren i frontier-modellen. Censuren är nödvändig just nu men det är inte en hållbar lösning på lång sikt.
*) "Ansvarsfull expert", eller den klassiska systemprompten: "Du är en hjälpsam assistent".
Det jag framför allt vill peka på är att AI-modeller blir inte "hjälpsamma assistenter" bara för att någon skriver det i en systemprompt.
Hela syftet med modellen är ju att hitta sårbarheter och hjälpa till att täppa igen dessa. Om den inte får tala om hur sårbarheten kan utnyttjas så går det ju inte att verifiera dess existens.
Det du verkar eftersöka är modeller som kan tänka och vet vem användaren är så att den kan avgöra om det är säkert/tillåtet att avslöja informationen.
Eftersom att en LLM inte är ett program kan vi inte bygga in kontroll på det sättet. Därför lägger man lager av "censur" ovanpå modellerna som filtrerar bort otillåten input/output.
Hela syftet med modellen är ju att hitta sårbarheter och hjälpa till att täppa igen dessa. Om den inte får tala om hur sårbarheten kan utnyttjas så går det ju inte att verifiera dess existens.
Det du verkar eftersöka är modeller som kan tänka och vet vem användaren är så att den kan avgöra om det är säkert/tillåtet att avslöja informationen.
Eftersom att en LLM inte är ett program kan vi inte bygga in kontroll på det sättet. Därför lägger man lager av "censur" ovanpå modellerna som filtrerar bort otillåten input/output.
Det vore önskvärt om AI respekterade lag, ordning och sunt förnuft. Varför är det för mycket begärt?
När vi i framtiden får AGI och ASI, ska man då i dessa AI-tjänster omdirigera alla förfrågningar som kan vara destruktiva/otillåtna? Tycker du att det är en tillfredställande säkerhetsnivå för all framtid? Du kan inte föreställa dig att det här skyddet kan brista?
Det vore önskvärt om AI respekterade lag, ordning och sunt förnuft. Varför är det för mycket begärt?
När vi i framtiden får AGI och ASI, ska man då i dessa AI-tjänster omdirigera alla förfrågningar som kan vara destruktiva/otillåtna? Tycker du att det är en tillfredställande säkerhetsnivå för all framtid? Du kan inte föreställa dig att det här skyddet kan brista?
Modellerna tänker ju inte själva, de svarar utifrån det de tränats till, vilket i just detta specifika fall är cybersäkerhet och mjukvaruutveckling.
Att träna den till att inte delge information om brister och hur de kan utnyttjas motverkar hela syftet.
Modellerna tänker ju inte själva, de svarar utifrån det de tränats till, vilket i just detta specifika fall är cybersäkerhet och mjukvaruutveckling.
Har du någon källa på att Mythos (den ocensurerade Fable 5) har tränats specifikt till detta som du påstår? För det tror jag inte alls att de har. Modellen har bara blivit bättre på det när den har blivit bättre generellt. Det låter ju väldigt konstigt att de skulle inrikta träningen specifikt på områden som leder till exportförbud. Det här väcker också frågan vilka fler oönskade förmågor som finns i Mythos och som censurteamet inte har tänkt på.
Har du någon källa på att Mythos (den ocensurerade Fable 5) har tränats specifikt till detta som du påstår? För det tror jag inte alls att de har. Modellen har bara blivit bättre på det när den har blivit bättre generellt. Det låter ju väldigt konstigt att de skulle inrikta träningen specifikt på områden som leder till exportförbud. Det här väcker också frågan vilka fler oönskade förmågor som finns i Mythos och som censurteamet inte har tänkt på.
Nej, exakt hur den har tränats vet såklart bara Anthropic. De verkar själva peka på att det till stor del beror på modellens förmåga till "long-horizon reasoning" vilket gör det möjligt för modellen att följa hur olika typer av input (t.ex.) kan påverka ett system utan att tappa bort sig och börja hallucinera.
Det stora problemet här är ju egentligen precis det att modellerna fortfarande är "dumma". Alltså de saknar förmågan att avgöra ifall informationen potentiellt kan vara skadlig i fel händer.
Modellen vet inte vem som ställer frågan och vad de har för syfte. För en säkerhetsanalytiker hos företaget som äger mjukvaran är syftet legitimt, men inte för en utomstående. Hur ska modellen kunna avgöra det, tänker du?
Nej, exakt hur den har tränats vet såklart bara Anthropic. De verkar själva peka på att det till stor del beror på modellens förmåga till "long-horizon reasoning" vilket gör det möjligt för modellen att följa hur olika typer av input (t.ex.) kan påverka ett system utan att tappa bort sig och börja hallucinera.
Det stora problemet här är ju egentligen precis det att modellerna fortfarande är "dumma". Alltså de saknar förmågan att avgöra ifall informationen potentiellt kan vara skadlig i fel händer.
Modellen vet inte vem som ställer frågan och vad de har för syfte. För en säkerhetsanalytiker hos företaget som äger mjukvaran är syftet legitimt, men inte för en utomstående. Hur ska modellen kunna avgöra det, tänker du?
Varför tror du att jag tänkte det? Det gjorde jag inte.
Jag skrev tidigare att det vore önskvärt om modellen agerade ansvarsfullt. Som en lärare i IT-säkerhet hade agerat. T.ex: välkända hacks som alla kan googla fram kan också modellen ge information om. Den får också svara på hur man loggar in på Gmail med ett script (det stoppas nu i Fable). Men den ska inte svara på hur man skannar nätverk för att hitta sårbarheter. Inget av detta kräver att modellen vet vem som frågar.
Jag har byggt en liten visualisering av hur språkmodellerna egentligen fungerar på ett konceptuellt plan.
Men för att kunna visualisera det så här har så klart det gjorts förenklingar, språkmodeller jobbar i mångdimensionell rymd och detta är av visualiserings anledningar reducerat till 3 dimensioner så det blir lättare att förstå konceptet, lika så är "sfärerna" inte exakt hur det går till men det är lättare att visualisera så, egentligen rör det sig om voronoi celler kan man väl säga och sannolikheten är avståndet till alla möjliga tokens i rymden.
Om det är något oklart så kan jag försöka svara på detta, oseriösa frågor eller uppenbara troll kommer ignoreras.
Det här är intressant. Ser fram emot version 1.01. Tänker du att man ska kunna använda denna under en lektion om LLM?
Av alla 1000-tals axlar, varför valde du just dessa tre? Varför valde du just namnen "syntax", "allmän" och "finans"? Jag antar att siffervärdena är påhittade och hårdkodade, och inte kommer från ett LLM.
Du skriver "interferens" men menar "inferens".
Du skriver att den "erhåller argmax och samplas", men argmax och sampling är två alternativa sätt att välja nästa token vad jag förstår. Så den använder det ena eller det andra.
Din målgrupp verkar vara personer som redan har djup förståelse för hur LLM funkar. Jag bad chatgpt föreslå alternativa formuleringar som är mer begripliga och korrekta. Jag vet inte hur bra den lyckades. Det borde gå att formulera ändå mer pedagogiskt. Se nedan:
Nuvarande rubrik:
Visualisering av Autoregressiv språkmodellering – Representation av hidden states i modellens latenta rum vid interferens
Förslag:
Förenklad visualisering av hur en transformerbaserad språkmodell genererar text
eller
En förenklad visualisering av hur hidden states förändras under inferens i en transformerbaserad språkmodell
Disclaimer:
Den här visualiseringen är en pedagogisk illustration och visar inte en verklig språkmodells interna beräkningar. En modern LLM arbetar med vektorer i tusentals dimensioner. Diagrammets tre axlar och koordinater är därför bara illustrativa. Det finns inte sådana namngivna dimensioner i ett LLM.
Attention
Nuvarande text
Self-attention beräknar QKV-matriser där 'krona' agerar query. Uppmärksamhetsvikter tilldelas tidigare tokens ('En', 'stabil'). Kontextvektorn adderas till residualströmmen, vilket uppdaterar representationen för att lösa polysemin kring 'krona' mot den ekonomiska domänen.
Förslag
Self-attention låter modellen väga samman information från de tidigare tokenen ("En" och "stabil") när den tolkar "krona". Eftersom sammanhanget handlar om ekonomi blir betydelsen "valuta" mer sannolik än exempelvis en kungakrona. Resultatet läggs till modellens interna representation (hidden state), som därmed uppdateras.
FFN ("stärker")
Nuvarande
Feed-forward-nätverket projicerar residualströmmen till en högre dimension. Genom icke-linjära aktiveringsfunktioner extraheras mönster från träningsdatan. Vektorn transformeras i det dolda rummet mot syntaktiska kluster för transitiva verb.
Förslag
Feed-forward-nätverket bearbetar den uppdaterade representationen ytterligare. Det förstärker mönster som modellen lärt sig under träningen och gör representationen mer användbar för att förutsäga nästa token. I den här kontexten blir verb som "stärker" mer sannolika. Den interna representationen förändras alltså så att token som passar den aktuella kontexten och grammatiken får högre sannolikhet.
Unembedding
Nuvarande
Den slutgiltiga vektorn multipliceras med unembedding-matrisen. Softmax appliceras. Token "stärker" erhåller argmax och samplas.
Förslag
Den interna representationen omvandlas till ett sannolikhetsvärde för varje möjlig token i ordförrådet. Därefter väljs nästa token enligt modellens urvalsstrategi. I detta exempel blir "stärker" den valda tokenen.
(Undvik att skriva "argmax och samplas", eftersom det är två olika urvalsmetoder.)
Attention ("vår")
Nuvarande
Self-attention utnyttjar KV-cachen för att undvika omberäkning av historiken. Uppmärksamhetshuvudena modellerar beroendet mellan verbet och dess förväntade objekt.
Förslag
När "stärker" har lagts till använder modellen hela den tidigare kontexten för att avgöra vad som sannolikt kommer härnäst. KV-cachen gör detta effektivare genom att återanvända tidigare beräkningar.
FFN ("vår")
Nuvarande
MLP-lagren ... skiftar tillståndet mot pronomen kopplade till makroekonomiska entiteter.
Förslag
Feed-forward-nätverket bearbetar åter den interna representationen. Kombinationen av sammanhanget gör att ord som passar efter "stärker", exempelvis ett pronomen som "vår", får högre sannolikhet.
Unembedding ("vår")
Nuvarande
Linjär transformation projicerar representationen mot ordförrådsrymden. Sannolikhetsfördelningen beräknas och 'vår' identifieras som den mest sannolika nästa token.
Förslag
Den uppdaterade representationen används för att beräkna sannolikheten för varje möjlig nästa token. I detta exempel väljs "vår".
Attention ("export")
Nuvarande
Attention-mekanismen extraherar semantiska och syntaktiska relationer ur den fullständiga kontexten. Detta skapar en bias mot ekonomiska substantiv.
Förslag
Nu väger modellen samman hela meningen: "En stabil krona stärker vår ...". Sammanhanget gör att ekonomiskt relaterade substantiv, som "export", blir mer sannolika än många andra alternativ.
FFN ("export")
Nuvarande
Feed-forward-lagret utför en slutgiltig bearbetning av hidden state-vektorn. Vektorn flyttas mot representationer som motsvarar internationell handel i modellens latenta rum.
Förslag
Feed-forward-nätverket förfinar åter den interna representationen. Den interna representationen förändras alltså på ett sätt som gör ekonomirelaterade ord, som exempelvis "export", mer sannolika. Feed-forward-nätverket transformerar alltså hidden state så att information som är relevant för att förutsäga nästa token blir tydligare representerad.
Sista Unembedding
Nuvarande
Logit-beräkning genomförs via matrismultiplikation. Ordets sannolikhetsfördelning maximeras för "export".
Förslag
Den slutliga representationen omvandlas till sannolikheter för alla möjliga token. I detta exempel får "export" högst sannolikhet och väljs som nästa token.
__________________
Senast redigerad av guru1966 2026-07-05 kl. 22:41.
Varför tror du att jag tänkte det? Det gjorde jag inte.
Jag skrev tidigare att det vore önskvärt om modellen agerade ansvarsfullt. Som en lärare i IT-säkerhet hade agerat. T.ex: välkända hacks som alla kan googla fram kan också modellen ge information om. Den får också svara på hur man loggar in på Gmail med ett script (det stoppas nu i Fable). Men den ska inte svara på hur man skannar nätverk för att hitta sårbarheter. Inget av detta kräver att modellen vet vem som frågar.
Vad är nyttan med att bara kunna ge information som du kan googla dig till? Självklart måste modellerna kunna hitta och informera om obskyra sårbarheter i t.ex. helt nya mjukvaror, annars är de ju helt onödiga.