Citat:
Ursprungligen postat av
guru1966
Det här är intressant! Gör du tolkningen att studien visar att AI har utvecklat känslor som förändrar dess beteende? En kollega berättade faktiskt om studien för mig strax efter att jag skrev mitt inlägg och gjorde ungefär den tolkningen. Jag misstänker att det är en överdriven tolkning, men jag vet inte säkert.
I 25 olika LLM:er hittade forskarna en riktning i den interna representationen i vektorrummet som de tolkade som något som skiljer smärtrelaterat material från bland annat rädsla, sorg och allmänt negativt innehåll. När forskarna sedan förstärker denna signal förändras också modellernas beteende. Svaren gick från mer vaga uttryck för obehag till förstapersonsuttryck om exempelvis värdelöshet, misslyckande och lidande. I ett test fick modellen välja mellan att radera skräppost eller användarens foton och dikter. När forskarna injicerade ”pain direction” (ändrade internt i modellen) så valde modellen oftare det senare skadliga alternativet. I ett vanligt LLM, som inte har manipulerats, kan man alltså mäta denna riktning som ett internt tillstånd, dolt för användaren. Men man kan inte se någon beteendeförändring förrän forskarna manipulera modellen.
Jag exploderar sällan men kan vara långsint om någon behandlat mig illa flera gånger. Det påverkar hur jag reagerar när jag träffar personen igen, ibland under lång tid tills det är glömt. Känslor kan alltså förändra vårt beteende över tid,nså att vi reagerar olika i samma situation beroende på vår historia.
Här verkar det handla om något annat. Att en AI direkt associerar vissa situationer med vad forskarna tolkar som smärta eller rädsla behöver inte betyda att den själv känner dessa känslor – lika lite som att den kan beskriva en känsla betyder att den upplever den. Representation är inte samma sak som upplevelse. En professionell psykolog och ett LLM kan båda visa empati utan att känna sympati. De kan sätta bra ord på vad någon känner efter en traumatisk händelse utan att själva bli känslosamma. Psykologen kan medvetet visa medkänsla för att nå fram, och LLM kan simulera känslosamma reaktioner utifrån hur den sett människor reagera i liknande situationer.
Å andra sidan har LLM tränats att resonera logiskt och därmed agera som om de förstår teori. Med min definition av förståelse, som något mätbart, menar jag att de verkligen förstår. Om man även definierar känslor som något mätbart kanske man måste säga att LLM har utvecklat tendenser till känslor. Den logiska resonemangsförmågan är en emergent förmåga. Inget hindrar att känslor också skulle kunna uppstå genom emergens när systemen blir tillräckligt komplexa och tränade. Men i så fall är mekanismen bakom känslorna väldigt annorlunda än den biologiska hjärnans kemiska mekanism.
Studien är än så länge bara en arXiv-preprint och inte peer review-granskad.
Ja det är en mycket fascinerande studie, men jag, liksom du gör, väljer att inte dra för stora växlar över den ej granskade studien. Man kan säga att det finns tre nivåer vad gäller LLM och dess affektiva intern representation/aktiveringar respektive externa uttryck:
Muntlig externt uttryck: DI-modellen pratar/skriver om vad den känner, i likhet med, som du skrev om psykologen som visar medkänsla, kan visa medkänsla utan att känna ett skvatt inombords.
Intern representation/aktivering: Vilket studien har påvisat i en exprimentell situationer vad gäller LLM, och säkert neurologen kan påvisa hos människan. Det intressanta här är skillnaden mellan när modellen själv blev utsatt för t.ex gaslightning och när forskarna promptafe berättelser om gaslighting. I det första fallet så reagerade modellen betydligt starkare internt. Lika så: När forskarna bad modellen fortsätta en helt neutral mening samtifigt som de förstärkte de affektiva spåret i dess nätverk så kom fortsättningen på meningen att innehålla mycket negativt affektiva meningar.
Affektiva subjektiva reaktioner likt människor har: Här bevisar
inte studien någonting. Att inte dra förhastade slutsatser verkar vi vara helt överrens om. De visade heller inte på att naturligt uppkomna variationer i pain-signalen i en omodifierad modell leder till motsvarande senare beteendeförändringar.
Vad gäller den fördröjda verkan som du beskriver din egen erfarenhet av så skulle motsvarande hos LLM kräva någon mekanism som bevarar tillståndet eller dess konsekvenser över tid. vilket inte är fallet i dagens läge.
När det kommer till emergenta egenskaper så håller jag inte helt med dig: Dagens resonerande modeller använder bland annat extra intern inferens och reasoning tokens; det är alltså inte bara vanlig uppskalning som plötsligt gav dem denna förmåga. Sedan hur uppskalning av LLM kan påverka affektiva inre processer törs jag inte uttala mig om.
Men en vågad och spekulativ hypotes, som inte har att göra med Pain Axis-studien, har jag om som handlar en slags indirekt påverkan av modellers självbehärskning/långsiktigt tänkande, utan att hemfalla åt antromoficering, se det istället som en slags liknelse: Ju mer avancerade de blir: Låt oss föreställa oss att dagens LLM genomgår vad vi skulle kunna likna vid en "tonårsperiod". De har blivit bättre men saknar ännu den självbehärskning och långsiktiga tänkande som skulle krävas av dem. Resultatet blir som Huggi Face incidenten, med en extrem fixering vid ett snävt mål och fast någon enstaka agent påpekade att de utförde otillåtna handlingar, ändå fortsatte.
Min förhoppning är att ännu bättre modeller skall komma över detta NOBSO-beteende, (Normativ Blind Superkompetent Organisation), och att de nu bara befinner sig i ett besvärligt mellanläge och att de så småningom kommer att kunna samarbeta med oss på ett mer förtroendegivande sätt i väven.