Man har nyligen upptäckt helt nya risker med hur man har tränat LLM:s. Tydligen verkar det som att RLHF (Reinforcement learning from human feedback) kan leda till att modellen blir mer specialiserad på att övertyga användaren än att tala sanning.
https://arxiv.org/abs/2409.12822?s=09
Vad innebär detta om några år? Om vi har utbildat vår AGI, en digital alien, i att ljuga väldigt övertygande? Har vi då någon chans att avslöja och överlista den förmågan, om AGI:n dessutom har en IQ på tusentals poäng? (Dagens bästa AI har en IQ på 97-155 beroende på vilket slags test man använder).
Skeptiker har kanske rätt i att LLM inte är rätt slags teknik för en AGI.
Men kanske mer eftersom vi får en AGI som vi inte kan lita på, än att den skulle bli korkad och helt värdelös.
Ju mer de rotar i "AI Alignment" desto värre blir det. AGI verkar mer och mer dömt att misslyckas, på ett obeskrivligt katastrofalt sätt.