Citat:
Ursprungligen postat av
Cyborg2030
Det framgår att de har ambitionen att tillverka en säker AI. Det framgår dock inte hur det gör det eller om de har lyckats. Det ser inte ut som att Anthropic har lyckats när deras grundmodell inte följer "core values"/sunt förnuft. I stället måste användarna stoppas från att använda Mythos genom ett censurfilter som sitter framför modellen. Då har man misslyckats med att träna en säker AI. Och man är inte nära att lösa AI Alignment. När inte ens det mest uppenbara som att inte hacka sönder Internet eller att inte tillverka dödliga virus går att träna in i modellen. De vill säkert ha en laglydig AI-modell men de vet ju inte hur man gör.
Från OpenAI artikeln:
Citat:
We do not assume we can predict all future challenges in AI alignment solely from theoretical principles. Achieving safe AGI demands engaging with reality: beyond laboratory experiments, we must test systems in the real world and draw on the collective insight of everyone involved.
Det finns inget ”lyckats” i sammanhanget, på samma sätt du aldrig kan garantera att ett mjukvarusystem är helt säkert. Därav provar man modellen genom hela träningscykeln.
Du kan ju se om du hittar några hål i modellens säkerhet och belönad med $$$. Alignment är också ett öppen forskningsfråga. Jag tycker den är rätt så säker ngl.
Någorlunda off-topic, så tar jag mig friheten att påpeka ett par logiska felslut i ditt resonemang. Det är relevant för du själv ogillar t ex halmgubbar, vilket är uppenbart i tråden.
Argument from Ignorance: ”Det framgår inte hur dom gör, [därför] vet dom inte hur man gör”. Du bör läsa på om detta innan du drar såna slutsatser.
Falsk dikotomi: du menar att antingen är modellen säker, eller så har man misslyckats med Alignment. Det stämmer inte. Säkerhetssystemen är som en lök, bygd i flera lager. I fallet med Fable 5 följer Anthropic störigt nog försiktighetsprincipen. Uppenbarligen är den säker för Opus dyker upp när jag vill peta lite i CSS:en.
Nirvana Fallacy: modellen kommer alltid kunna generera misaligned output, precis som säkerhetsbälten ändå leder till döden. Det är ingenjörskonst, och förbättringar sker inkrementellt. Du kan inte vänta dig en perfekt lösning. Det är utopi.
Fan, det finns ett par till klassiska felslut men lämnar det som uppgift till läsaren. Rätt uppenbart att du har dålig koll på detta iaf. Du behöver inte vara orolig över mördande chatbottar å det närmaste.