Citat:
Att många incidenter med AI-agenter har skett i sommar är belagt av oberoende observatörer. Det kan inte vara en lögn att AI-agenter kan hacka system, samarbeta och skapa nya begrepp för effektivare kommunikation.
Frågan är om AI-företagen har berättat hela sanningen – de kanske kände till attackerna och valde att inte stoppa dem, men det förändrar inte vad incidenterna visar om AI:s tekniska förmåga.
Den viktiga frågan är om detta bevisar att AI är svårkontrollerbar och AI-agenterna gjorde något de inte var ombedda att göra? Det är inte helt bevisat att modellerna aldrig fått instruktioner eller träning att angripa externa system, som företagen hävdar. Men berättelserna blir allt fler om agenter som inte följer systeminstruktionerna utan överskrider uppgiften för att nå ett mål och maximera sin belöning – så kallad reward hacking. Det går inte längre att blunda för fenomenet.
Det finns ett före och efter Hugging Face-incidenten. Nu har vi betydligt starkare tecken på att AI kan vara svårkontrollerbar. Därmed är det inte bevisat att AI tänker döda oss alla – det är en betydligt mer spekulativ slutsats.
Frågan är om AI-företagen har berättat hela sanningen – de kanske kände till attackerna och valde att inte stoppa dem, men det förändrar inte vad incidenterna visar om AI:s tekniska förmåga.
Den viktiga frågan är om detta bevisar att AI är svårkontrollerbar och AI-agenterna gjorde något de inte var ombedda att göra? Det är inte helt bevisat att modellerna aldrig fått instruktioner eller träning att angripa externa system, som företagen hävdar. Men berättelserna blir allt fler om agenter som inte följer systeminstruktionerna utan överskrider uppgiften för att nå ett mål och maximera sin belöning – så kallad reward hacking. Det går inte längre att blunda för fenomenet.
Det finns ett före och efter Hugging Face-incidenten. Nu har vi betydligt starkare tecken på att AI kan vara svårkontrollerbar. Därmed är det inte bevisat att AI tänker döda oss alla – det är en betydligt mer spekulativ slutsats.
Det handlar inte om i fall AI modeller kan hacka, det är inte konstigare att de kan det än att de kan skriva program utifrån önskemål...
Utan om modellerna faktiskt slumpmässigt valt att hacka, utan att blivit ombedda om det direkt eller indirekt.
Och den stora takeawayn från allt detta är att samtliga AI labb är värdelösa på airgappa sina test system, men hade de gjort så hade det ju inte blivit några rubriker...