Citat:
Ursprungligen postat av
FBerntsson
De fuskar inte. De löser uppgiften så som den presenteras för dem. Målet är att få en så bra poäng som möjligt när de utvärderas.
Målet är egentligen inte att presentera en lösning på uppgiften de fått. Du kan heller inte få den att ta hänsyn till lagar och moral. Detta eftersom du endast kan bestraffa detta om det upptäcks och det är långt ifrån säkert. Alltså ligger det implicit i träningen att lagbrott är ok så länge det inte upptäcks.
Innebär lagbrott en väg till en högre poäng på utvädering så är det som kommer att användas. Näst intill ofelbart.
Just i dessa tester (CyberGym och ExploitGym) stämmer det att målet är att få så hög poäng som möjligt. Men det stämmer inte för alla uppgifter.
Det går heller inte att påstå att lagbrott och fusk automatiskt är det modellerna kommer att vända sig till.
I detta fall har uppgiften visat sig vara omöjlig, de hittar en väg ut på Internet tack vare andra agenters dokumenterade upptäckter, resonerar att svaren på uppgiften skulle kunna finnas hos Hugging Face, hittar ett lovande dataset som visar sig vara låst bakom auth, letar efter ett sätt att bli auktoriserad, hittar sårbarhet och nyttjar den.
Problemet tycks vara att de stegvis hittar nya delmål som leder till slutmålet och att de kanske är för specifika för att fångas upp som olagliga. Det ska också nämnas att de hade skruvat ned de mekanismer som annars är till för att stoppa agenterna om de försöker begå cyberattacker (eftersom det var precis det testet gick ut på).