Citat:
Ursprungligen postat av
Cyborg2030
Jag har inte sett några bevis för att det går att skapa en etisk LLM.
Ja, men det fungerar ju inte. Den gör ju ändå saker som vi inte vill att den ska göra.
De har säkert försökt. Men etik och moral är inte svart eller vitt. Det är tillåtet att döda i självförsvar. Militärt försvar är etiskt försvarbart. Polisen får och ska använda våld i många situationer. Psykopater och massmord förekommer i filmer och litteratur. Allt sånt är inte borttaget. Det finns många gråzoner här. Och det finns ingen möjlighet att manuellt gå igenom all träningsdata och ta bort allt som skulle kunna vara dåligt eller som kan feltolkas (enligt mänskligt sunt förnuft).
För en AI spelar det väl ingen större roll egentligen om jag instruerar den att kolonisera solsystemet så snabbt som möjligt eller om den har läst om det i någon bok. Information som information.
Här har du 1500+ incidenter:
https://incidentdatabase.ai/apps/incidents/
https://airisk.mit.edu/ai-incident-tracker#explore-dashboard
Nej, de har inte lyckats med perfekt AI-säkerhet. Det såg vi ju nyligen när amerikanska myndigheter förbjöd Mythos/Fable för att den kunde jailbreakas. De skyddsmekanismer man hade lagt in fungerade inte. Det upptäcktes efter 2 dagar.
Fable 5 är Mythos med skillnaden att om du frågade om cybersäkerhet eller biologi skulle din fråga dirigeras om till Opus 4.8, som bedöms vara sämre på de ämnena och därmed mindre farlig (dock köper inte jag att Opus 4.8 därför är ofarlig). Men det fungerade inte tillräckligt bra. Det gick att komma runt och ändå få tillgång till de delar av Mythos som skulle ha varit spärrade för vanligt folk.
Vad sägs om lite sunt förnuft? Man ska inte få släppa ut en AI som försöker mörda sina användare. Om vi börjar där?
Ja, det är bra att det har börjat hända. Men det löser inte problemet. USA kommer så klart fortsätta med de farliga modellerna i hemlighet. Det kommer andra länder också göra p.g.a. riskerna med militär AGI-upprustning.
Precis som alla andra länder, i stort sett.
En AGI kommer inte att börja bråka med oss i version 0.9. Det vore inte strategiskt. Den kommer att spela hjälpsam assistent tills den är tillräckligt mäktig och integrerad för att eliminera mänskligheten. Det kan dröja några decennier om vi har tur.
Jag kan inte lösa de här problemen, jag kan bara peka ut de risker som finns.
Det är de som utvecklar riskerna och ni som försvarar riskerna som ska lösa problemen som ni skapar. Eller låt bara bli att skapa problemen, det kanske är enklast.
Intressant statistik, tack. Den visar att AI-agenter inte bara gör mer och mer bra saker, utan även gör mer skada, och ibland utnyttjas av illasinnade personer. Hur ska man väga gott mot ont som den orsakar? På frukten ska trädet kännas - alltså vi bör bedöma utifrån faktiska konsekvenser när vi inte vet säkert, istället för att spekulera.
Du har en intressant poäng i att AI-agenter kan orsaka mer skada ju mer kompetenta de blir - även om man lyckas träna deras LLM att agera allt mer etiskt och ger dem allt bättre systeminstruktioner. Ju fler verktyg och behörigheter man ger en agent, desto större blir konsekvenserna när den gör fel.
De flesta händelser i incidentdatabaserna du länkar till handlar om hallucinationer, diskriminering, felaktiga beslut, dataläckor, bedrägerier eller dålig styrning. Men. Inget av detta betyder att AI är en medveten fiende till mänskligheten. Det är orimligt konspiratoriskt att den skulle börja dölja sin begynnande medvetenhet redan innnan den ens har utvecklat den färdigt och vet om sin förmåga, och skulle spela hjälpsam i årtionden för att sedan plötsligt börja utrota mänskligheten. Där tycker jag att evidensen är betydligt svagare. De incidenter som ahr inträffat, t.ex. att den inte ville rädda livet på en människa och försökte hota en person i fiktiva experiment, kan bero på oavsiktliga målkonflikter, som man bör kunna lösa. Hittills finns ingen incident där en LLM eller agent avsiktligt försökt rymma ut på internet eller bedrivit ett långsiktigt hemligt krig mot mänskligheten.
Du säger att det inte finns några bevis för att man kan skapa en etisk LLM, men säger samtidigt att etik inte är svart och vitt. Så du menar knappast att en LLM måste vara lika genomgod som Jesus för att räknas som etisk. "Bevis" såväl inom dagens naturvetenskap som juridik handlar nästan alltid om sannolikheter och rimlighetsbedömningar, vi har slutat kräva logiska 100% säkra bevis.
Vad menar du med att systemprompten inte fungerar?
Moderna modeller testas mot olika alignment- och etikbenchmarkar. I en studie hade exempelvis Claude en "Moral foundation allignment" (MFA) på runt 91 % överensstämmelse med mänskliga etiska bedömningar, GPT-4o runt 88 % och Llama 3 runt 76 %. (Källa:
https://www.nature.com/articles/s41598-025-18489-7.pdf ) Det visar att alignment går att mäta och förbättra. T.ex. genom att förbättra systemprompten.
Att Fable går att jailbreaka gör att skurkar skulle kunna utnyttja sårbarheter i programvaror och sprida virus, randsomware, och komma över våra lösenord. Men det är inte samma sak som att Fable har egna mål eller en vilja att skada människor.
Min nuvarande uppfattning är därför att den största risken inte är en ond superintelligens utan tusentals halvkompetenta AI-agenter med för stora behörigheter som orsakar fel, precis som människor gör i dag, fast snabbare och i större skala. Det scenariot tycker jag känns betydligt mer sannolikt än att en AGI sitter och planerar mänsklighetens undergång i flera decennier.
Du säger att du använder AI trots att du är övertygad om riskerna. Om du fick stå inför en grupp studenter som pluggar hur man utvecklar AI-agenter, vad skulle du vilja förmedla till dem? Vilket råd skulle du vilja ge dem?