2024-10-08, 13:09
  #13
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Och min poäng är att det är vare sig nytt eller oförväntat.
Skit in, skit ut.
RLHF är främst användbart för att förhindra att modellerna genererar skadligt innehåll eller att de ger konstiga svar. Att använda det för att säkerställa faktuellt korrekt information förutsätter att de mänskliga domarna har koll på exakt allt, vilket de självklart inte har.

Att studien visar att man kan träna modellerna att "ljuga" betyder inte att det är exakt så som tekniken används i publika modeller som GPT4 eller Llama2. Oavsett så är det inte speciellt användbart om det skulle göras medvetet av de som bygger och tränar modellen.
Om en framtida AGI skulle uppstå baserat på den här osäkra tekniken kan vi få ganska stora problem. Eftersom RLHF inte har lärt AI att tänka rättvist elker humant, man har bara lärt den att göra användaren nöjd med hur kommunikationen utåt ser ut.
Citera
2024-10-08, 14:36
  #14
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Illvilja är ju en slags oförmåga att agera schysst och rimligt.

Hanlon's razor:
Citat:
Never attribute to malice that which is adequately explained by stupidity.

Citat:
Ursprungligen postat av Cyborg2030
Om en framtida AGI skulle uppstå baserat på den här osäkra tekniken kan vi få ganska stora problem. Eftersom RLHF inte har lärt AI att tänka rättvist elker humant, man har bara lärt den att göra användaren nöjd med hur kommunikationen utåt ser ut.
Det verkar osannolikt att AI som gör fel (programkod som går igenom enhetstester, men inte fungerar korrekt t.ex.) skulle kunna vara AGI. Det du pratar om är snarare någon form av medvetenhet och det är fortfarande så pass osannolikt att dagens teknik skulle kunna leda till att det inte är värt att diskutera i den här tråden.
Citera
2024-10-08, 15:38
  #15
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av Enterprise
Men illvilja förutsätter medvetande och den tillhörande förmågan att ha någon vilja alls. Annars är det missvisande att tala om illvilja.
Jag tror att virtuellt medvetande kan uppstå ganska snart.
Dagens mest avancerade modeller har en IQ på mänsklig nivå.
Varför skulle inte det kunna leda till ett medvetande? När en hund har ett slags medvetande?
Dessutom måste inte illviljan komma ifrån en intern motivation.
Människor kan beordra stora, långsiktiga mål, som en "ocensurerad" (misaligned) AI delar upp i många mindre mål som ska utföras för att kunna uppnå det beställda, större målet. Dessa delmål kan innebära destruktiva sidoeffekter.
Citera
  • 1
  • 2

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in