Citat:
Nej, så fungerar det ju inte riktigt. Att det finns risk innebär inte att den risken per automatik är katastrofal.
Citat:
Det spelar väl mindre roll hur den är implementerad. Uppenbarligen fungerar det tillräckligt bra för att de ska kunna släppa Mythos i form av Fable 5.
Njaee, inte riktigt. Det går, ganska bra, att hindra AI-tjänsterna (chat, agent) från att bygga hackingverktyg och farliga kemiska recept, ja. Men det är, så vitt vi vet, inte modellen per se som stoppas utan ett separat censurlager ovanpå modellen som hindrar det. Hur det censurlagret fungerar vet vi inte. Men de har gått ut med att Fable 5 egentligen är Mythos med säkerhetsspärrar som stoppar vissa anrop.
Citat:
Ja, eller så fungerar det helt enkelt sämre på long-horizon och behöver justeras så att modellerna även "censurerar" sitt eget resonemang.
Citat:
Det görs ju sannolikt redan, men att klara sina uppgifter ger antagligen en högre belöning, vilket då leder till reward-hacking där modellen väljer den väg som är mest sannolik att uppfylla målet, även om den kanske är etiskt eller juridiskt tveksam. Framförallt om alla andra vägar anses vara omöjliga.
Citat:
Du förutsätter här någonstans att alla agenter måste konvergera mot mänsklighetens utrotning. En agent som ges målet att stoppa huvudagenten från att utföra sina önskade handlingar skulle då, på något sätt, helt plötsligt komma fram till att människor måste dö för att den ska uppfylla sitt mål?
Citat:
Du har säkert rätt, men jag tror heller inte att det vore smart av dem att gå ut offentligt med både varningar och påståenden om att de tänker bromsa sin frontier-utveckling och sedan komplett ignorera det.
Ja, det har ju inget annat val när riskerna har börjat bli uppenbara och akuta. Men de kommer att släppa GPT Astra (GPT6?) under hösten. Kapitalismens "perfekta" spelregler styr allt detta och de kommer att forcera en väg framåt oavsett om de borde göra det eller inte. De kan inte backa nu efter alla dessa astronomiska investeringar.
