Citat:
Ursprungligen postat av
Cyborg2030
En definition av säkerhetsarbete innebär inte att vi får AI-säkerhet.
Ingen har påstått att en definition i sig skapar AI-säkerhet. Poängen var vad begreppet "säkerhetsarbete" betyder, inte att det garanterar ett visst resultat.
Citat:
Ursprungligen postat av
Cyborg2030
Säkerhetsarbetet på Anthropic har misslyckats när de måste omdirigera requests till Opus 4.8.
Det följer inte logiskt. Att använda routing eller flera säkerhetslager är i sig en del av säkerhetsarbetet. Det visar att systemet har skyddsmekanismer, inte att de per definition har misslyckats. Sluta med den här förbaskade villfarelsen.
Citat:
Ursprungligen postat av
Cyborg2030
1. De kan bevisligen inte träna en modell att uppföra sig acceptabelt.
"Bevisligen" kräver ett faktiskt bevis. Att en modell ibland beter sig oönskat visar inte att den inte kan uppföra sig acceptabelt i allmänhet.
Citat:
Ursprungligen postat av
Cyborg2030
Träningen av ANN på stora textvolymer verkar leda till misaligned AI by default.
Det är din cuck-hypotes. Det finns inget stöd för att neurala nät per automatik blir "misaligned" bara för att de tränas på stora textmängder. Du hittar på och drar märkligheter ur röva. Sluta med det.
Citat:
Ursprungligen postat av
Cyborg2030
De har inte skapat en "språkmodell". De har skapat en psykopat.
Att tillskriva en språkmodell mänskliga psykiatriska diagnoser bidrar inte till en saklig analys. Det visar på ett stort tekniskt gap mellan dig och fenomenet du analyserar.
Oavsett hur lite du gillar det så är Mythos formellt en språkmodell. Sluta fåna dig med apostrofer, du gör oss löjliga.
Citat:
Ursprungligen postat av
Cyborg2030
2. Vi vet att deras filter för omdirigering blir jailbreakade förr eller senare.
Att skydd kan kringgås innebär inte att de saknar värde. Samma resonemang skulle annars göra alla säkerhetssystem meningslösa eftersom inget skydd är perfekt. Sluta gärna upp med det här felslutet.
Citat:
Ursprungligen postat av
Cyborg2030
Ja, det finns ett säkerhetsarbete men det fungerar ju inte.
Det är en betydligt starkare slutsats än vad premisserna visar. Att ett säkerhetssystem har begränsningar innebär inte att det "inte fungerar". Frågan är hur väl det minskar riskerna, inte om riskerna blir exakt noll.
Hur tycker du det går för dig att hitta på egna definitioner och regler? Får du mycket medhåll?