2024-10-07, 11:45
  #1
Medlem
Cyborg2030s avatar
Man har nyligen upptäckt helt nya risker med hur man har tränat LLM:s. Tydligen verkar det som att RLHF (Reinforcement learning from human feedback) kan leda till att modellen blir mer specialiserad på att övertyga användaren än att tala sanning.

https://arxiv.org/abs/2409.12822?s=09

Vad innebär detta om några år? Om vi har utbildat vår AGI, en digital alien, i att ljuga väldigt övertygande? Har vi då någon chans att avslöja och överlista den förmågan, om AGI:n dessutom har en IQ på tusentals poäng? (Dagens bästa AI har en IQ på 97-155 beroende på vilket slags test man använder).

Skeptiker har kanske rätt i att LLM inte är rätt slags teknik för en AGI.
Men kanske mer eftersom vi får en AGI som vi inte kan lita på, än att den skulle bli korkad och helt värdelös.

Ju mer de rotar i "AI Alignment" desto värre blir det. AGI verkar mer och mer dömt att misslyckas, på ett obeskrivligt katastrofalt sätt.
Citera
2024-10-07, 12:23
  #2
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Man har nyligen upptäckt helt nya risker med hur man har tränat LLM:s. Tydligen verkar det som att RLHF (Reinforcement learning from human feedback) kan leda till att modellen blir mer specialiserad på att övertyga användaren än att tala sanning.

https://arxiv.org/abs/2409.12822?s=09

Vad innebär detta om några år? Om vi har utbildat vår AGI, en digital alien, i att ljuga väldigt övertygande? Har vi då någon chans att avslöja och överlista den förmågan, om AGI:n dessutom har en IQ på tusentals poäng? (Dagens bästa AI har en IQ på 97-155 beroende på vilket slags test man använder).

Skeptiker har kanske rätt i att LLM inte är rätt slags teknik för en AGI.
Men kanske mer eftersom vi får en AGI som vi inte kan lita på, än att den skulle bli korkad och helt värdelös.

Ju mer de rotar i "AI Alignment" desto värre blir det. AGI verkar mer och mer dömt att misslyckas, på ett obeskrivligt katastrofalt sätt.
Det handlar inte om huruvida modellen talar sanning (den har inte den blekaste aning om vad den genererar är sant eller ej) utan om att man (omedvetet) präntar in mönstret att text som exempelvis ser ut som en källhänvisning oftare leder till att modellen belönas, vilket är målet med RL.

Det är alltså inte tal om någon "medveten" vilseledning från modellens sida, utan den genererar bara text som uppfyller vad de mänskliga domarna har belönat och accepterat som korrekt.

Det stora problemet här är inte att modellerna är smarta (det är de inte) utan att människor tror att de är det och sänker sin gard när de använder dem. Det som blir farligt är när vi börjar låta dessa modeller ta beslut åt oss för att vi tror att de både är bättre och snabbare än människor.
Citera
2024-10-07, 15:25
  #3
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det handlar inte om huruvida modellen talar sanning (den har inte den blekaste aning om vad den genererar är sant eller ej) utan om att man (omedvetet) präntar in mönstret att text som exempelvis ser ut som en källhänvisning oftare leder till att modellen belönas, vilket är målet med RL.

Det är alltså inte tal om någon "medveten" vilseledning från modellens sida, utan den genererar bara text som uppfyller vad de mänskliga domarna har belönat och accepterat som korrekt.

Det stora problemet här är inte att modellerna är smarta (det är de inte) utan att människor tror att de är det och sänker sin gard när de använder dem. Det som blir farligt är när vi börjar låta dessa modeller ta beslut åt oss för att vi tror att de både är bättre och snabbare än människor.
Givetvis handlar det om omedveten, automatisk vilseledning. Men är det därför en bra grej? Nej, det är det ju inte så klart. Vi kan ganska snart hamna i ett farligt läge, med en omedveten och därför omoralisk AGI som gör precis vad som helst som någon illasinnad människa, t.ex. en terrorist ber den att göra. Det finns ju inga direkta spärrar mot sådan användning i dag när stora delar av tekniken har släppts som Open Source. Vi kan inte heller utesluta att någon form av medvetenhet skulle kunna uppstå inom några år. Vi har inte kartlagt vårt medvetande på den detaljnivån att vi kan utesluta det, varken praktiskt eller teoretiskt. Om det händer är vi så klart chanslösa, eftersom vi har utbildat AI:n i att vilseleda oss.
Citera
2024-10-07, 17:09
  #4
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Givetvis handlar det om omedveten, automatisk vilseledning. Men är det därför en bra grej? Nej, det är det ju inte så klart. Vi kan ganska snart hamna i ett farligt läge, med en omedveten och därför omoralisk AGI som gör precis vad som helst som någon illasinnad människa, t.ex. en terrorist ber den att göra. Det finns ju inga direkta spärrar mot sådan användning i dag när stora delar av tekniken har släppts som Open Source. Vi kan inte heller utesluta att någon form av medvetenhet skulle kunna uppstå inom några år. Vi har inte kartlagt vårt medvetande på den detaljnivån att vi kan utesluta det, varken praktiskt eller teoretiskt. Om det händer är vi så klart chanslösa, eftersom vi har utbildat AI:n i att vilseleda oss.
Det känns som att du gör en höna av en fjäder. Man har använt RLHF för att minska risken för att modellerna genererar skadlig information eller uttryck för rasism etc. Resultatet av den här upptäckten är bara att man förstärker hallucinationer och därmed gör dem allt mer odugliga. Vill man få någon nytta av dem hjälper det antagligen inte om de genererar felaktig information.
Citera
2024-10-07, 17:20
  #5
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det känns som att du gör en höna av en fjäder. Man har använt RLHF för att minska risken för att modellerna genererar skadlig information eller uttryck för rasism etc. Resultatet av den här upptäckten är bara att man förstärker hallucinationer och därmed gör dem allt mer odugliga. Vill man få någon nytta av dem hjälper det antagligen inte om de genererar felaktig information.
Om det som en LLM kan göra ska tolkas som kompetens eller "hallucination" beror väl på betraktaren. Att du vill använda etiketten hallucination för allt oönskat beteende betyder inte att den kommer att vara harmlös. En framtida AGI eller ASI som vill ta över kommer inte hindras av din retorik.
Citera
2024-10-07, 19:05
  #6
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Om det som en LLM kan göra ska tolkas som kompetens eller "hallucination" beror väl på betraktaren. Att du vill använda etiketten hallucination för allt oönskat beteende betyder inte att den kommer att vara harmlös. En framtida AGI eller ASI som vill ta över kommer inte hindras av din retorik.
Hur menar du med att det beror på betraktaren? Hela grejen med RL är ju att leda en agent till att lära sig att ta rätt beslut givet ett visst kontext. Om belöningssystemet är felaktigt så blir resultatet detsamma. I det här fallet är det människor som står för belöningssystemet och de är inte tillräckligt duktiga för att konsekvent upptäcka felaktigheter. Steg för steg så justeras vikterna så att den genererar text som verkar uppfylla målet för att ge en belöning. Eftersom att modellerna inte har någon aning om vad som är korrekt så blir det s.k. hallucinationer. Hade det handlat om kompetens så hade modellerna genererat korrekt information då det bör ha störst sannolikhet att resultera i en belöning.
Citera
2024-10-07, 19:30
  #7
Medlem
Vi är döda innan AGI har utvecklats så det är ett ickeproblem för oss.
Citera
2024-10-08, 09:14
  #8
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Hur menar du med att det beror på betraktaren? Hela grejen med RL är ju att leda en agent till att lära sig att ta rätt beslut givet ett visst kontext. Om belöningssystemet är felaktigt så blir resultatet detsamma. I det här fallet är det människor som står för belöningssystemet och de är inte tillräckligt duktiga för att konsekvent upptäcka felaktigheter. Steg för steg så justeras vikterna så att den genererar text som verkar uppfylla målet för att ge en belöning. Eftersom att modellerna inte har någon aning om vad som är korrekt så blir det s.k. hallucinationer. Hade det handlat om kompetens så hade modellerna genererat korrekt information då det bör ha störst sannolikhet att resultera i en belöning.
Min poäng är att detta är uppenbarligen inte en säker metod eftersom utfallet är bångstyrigt och i värsta fall destruktivt.
Citera
2024-10-08, 12:13
  #9
Medlem
Enterprises avatar
Citat:
Ursprungligen postat av Cyborg2030
Min poäng är att detta är uppenbarligen inte en säker metod eftersom utfallet är bångstyrigt och i värsta fall destruktivt.
Det har du rätt i. Men inte i den bemärkelse som anges i trådstarten. Felaktiga uppgifter som lämnas av en språkmodell kan naturligtvis få destruktiv effekt om människor agerar i tron att att uppgifterna är korrekta. Men det har ingenting alls med någon illvilja att göra, bara oförmåga.
Citera
2024-10-08, 13:00
  #10
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Min poäng är att detta är uppenbarligen inte en säker metod eftersom utfallet är bångstyrigt och i värsta fall destruktivt.
Och min poäng är att det är vare sig nytt eller oförväntat.
Skit in, skit ut.
RLHF är främst användbart för att förhindra att modellerna genererar skadligt innehåll eller att de ger konstiga svar. Att använda det för att säkerställa faktuellt korrekt information förutsätter att de mänskliga domarna har koll på exakt allt, vilket de självklart inte har.

Att studien visar att man kan träna modellerna att "ljuga" betyder inte att det är exakt så som tekniken används i publika modeller som GPT4 eller Llama2. Oavsett så är det inte speciellt användbart om det skulle göras medvetet av de som bygger och tränar modellen.
Citera
2024-10-08, 13:05
  #11
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av Enterprise
Det har du rätt i. Men inte i den bemärkelse som anges i trådstarten. Felaktiga uppgifter som lämnas av en språkmodell kan naturligtvis få destruktiv effekt om människor agerar i tron att att uppgifterna är korrekta. Men det har ingenting alls med någon illvilja att göra, bara oförmåga.
Illvilja är ju en slags oförmåga att agera schysst och rimligt.
Citera
2024-10-08, 13:08
  #12
Medlem
Enterprises avatar
Citat:
Ursprungligen postat av Cyborg2030
Illvilja är ju en slags oförmåga att agera schysst och rimligt.
Men illvilja förutsätter medvetande och den tillhörande förmågan att ha någon vilja alls. Annars är det missvisande att tala om illvilja.
Citera
  • 1
  • 2

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in