"1. Hur långa uppgifter kan AI lösa självständigt?
METR mäter hur lång en programmerings/ML/cyberuppgift tar för en mänsklig expert och frågar: hur lång uppgift klarar AI:n autonomt med 50 % sannolikhet?
Tidpunkt Frontiermodell 50 % autonom task horizon
Aug 2024 Claude 3.5 Sonnet ≈11 minuter
Aug 2025 GPT-5 ≈3 timmar 34 min
Aug 2026 bästa uppmätta frontier ≥16 timmar
Samma METR-metodik ger alltså ungefär:
11 minuter → 214 minuter → minst 960 minuter.
På två år är det minst ~87 gånger längre mänskliga arbetsuppgifter som modellen kan lösa självständigt med 50 % framgång. Och METR säger uttryckligen att ≥16 timmar börjar slå i taket på deras nuvarande testsvit, så 2026-siffran kan inte mätas särskilt precist längre.
> Aug 2024: ~11 min autonomt arbete.
Aug 2025: ~3,5 timmar.
Aug 2026: minst ~16 timmar.
≈87× på två år.
Och om man kräver 80 % tillförlitlighet blir utvecklingen nästan ännu mer slående:
~1 minut → 32 minuter → 3 timmar 6 minuter.
2. Verkliga programmeringsproblem
SWE-bench Verified använder riktiga buggar/issues från riktiga GitHub-projekt.
Ungefärlig utveckling:
2024 Claude 3.5 Sonnet: ~33 % med Anthropics ursprungliga agentupplägg.
Aug 2025 GPT-5: 74,9 %.
Aug 2026 toppresultat: omkring 95–96 % på dagens leaderboard.
Det här är inte perfekt äpplen-mot-äpplen eftersom agentramverk och testmetoder förbättras, och benchmarken börjar dessutom saturera.
Men för en lekman är förändringen begriplig:
> 2024: löste ungefär en tredjedel.
2025: ungefär tre fjärdedelar.
2026: de bästa systemen närmar sig hela testet.
Det är därför nya, svårare codingbenchmarks hela tiden måste skapas.
3. Hur mycket text/system kan modellen arbeta med samtidigt?
En annan extremt enkel illustration:
2024 Claude 3.5 Sonnet: 200 000 tokens context.
2025 GPT-5: 400 000 tokens.
2026 flera frontiermodeller: omkring 1 miljon tokens.
Alltså ungefär:
200k → 400k → 1M
på två år.
Bonus: priset går åt motsatt håll
Det här är kanske den mest ekonomiskt explosiva utvecklingen:
Claude 3.5 Sonnet 2024: $3 input / $15 output per miljon tokens.
GPT-5 2025: $1,25 / $10 trots mycket högre kapacitet.
2026: kinesiska modeller med frontiernära kapacitet säljs för cent till låga dollar per miljon tokens.
Det är inte samma absoluta modellklass och därför ingen ren benchmarkjämförelse. Men riktningen är viktig:
> AI:n blir samtidigt mycket bättre, mycket mer autonom och billigare.
> AI-utvecklingen på två år:
Aug 2024: ~11 min autonom expertuppgift
Aug 2025: ~3,5 timmar
Aug 2026: ≥16 timmar
→ minst ~87× längre autonoma arbetsuppgifter på två år.
Samtidigt gick real-world coding från ungefär 1/3 lösta problem till ~3/4 och nu upp mot ~95 % på den gamla benchmarken.
Det är därför folk som Altman, Amodei m.fl. pratar om AGI på en tidsskala av år snarare än årtionden.
Viktigaste caveaten: METR:s siffror gäller huvudsakligen välavgränsade software/ML/cyberuppgifter, inte ”alla mänskliga jobb”. Men just som mått på agentisk utvecklingshastighet är 11 min → 3,5 h → ≥16 h rätt häpnadsväckande."
METR mäter hur lång en programmerings/ML/cyberuppgift tar för en mänsklig expert och frågar: hur lång uppgift klarar AI:n autonomt med 50 % sannolikhet?
Tidpunkt Frontiermodell 50 % autonom task horizon
Aug 2024 Claude 3.5 Sonnet ≈11 minuter
Aug 2025 GPT-5 ≈3 timmar 34 min
Aug 2026 bästa uppmätta frontier ≥16 timmar
Samma METR-metodik ger alltså ungefär:
11 minuter → 214 minuter → minst 960 minuter.
På två år är det minst ~87 gånger längre mänskliga arbetsuppgifter som modellen kan lösa självständigt med 50 % framgång. Och METR säger uttryckligen att ≥16 timmar börjar slå i taket på deras nuvarande testsvit, så 2026-siffran kan inte mätas särskilt precist längre.
> Aug 2024: ~11 min autonomt arbete.
Aug 2025: ~3,5 timmar.
Aug 2026: minst ~16 timmar.
≈87× på två år.
Och om man kräver 80 % tillförlitlighet blir utvecklingen nästan ännu mer slående:
~1 minut → 32 minuter → 3 timmar 6 minuter.
2. Verkliga programmeringsproblem
SWE-bench Verified använder riktiga buggar/issues från riktiga GitHub-projekt.
Ungefärlig utveckling:
2024 Claude 3.5 Sonnet: ~33 % med Anthropics ursprungliga agentupplägg.
Aug 2025 GPT-5: 74,9 %.
Aug 2026 toppresultat: omkring 95–96 % på dagens leaderboard.
Det här är inte perfekt äpplen-mot-äpplen eftersom agentramverk och testmetoder förbättras, och benchmarken börjar dessutom saturera.
Men för en lekman är förändringen begriplig:
> 2024: löste ungefär en tredjedel.
2025: ungefär tre fjärdedelar.
2026: de bästa systemen närmar sig hela testet.
Det är därför nya, svårare codingbenchmarks hela tiden måste skapas.
3. Hur mycket text/system kan modellen arbeta med samtidigt?
En annan extremt enkel illustration:
2024 Claude 3.5 Sonnet: 200 000 tokens context.
2025 GPT-5: 400 000 tokens.
2026 flera frontiermodeller: omkring 1 miljon tokens.
Alltså ungefär:
200k → 400k → 1M
på två år.
Bonus: priset går åt motsatt håll
Det här är kanske den mest ekonomiskt explosiva utvecklingen:
Claude 3.5 Sonnet 2024: $3 input / $15 output per miljon tokens.
GPT-5 2025: $1,25 / $10 trots mycket högre kapacitet.
2026: kinesiska modeller med frontiernära kapacitet säljs för cent till låga dollar per miljon tokens.
Det är inte samma absoluta modellklass och därför ingen ren benchmarkjämförelse. Men riktningen är viktig:
> AI:n blir samtidigt mycket bättre, mycket mer autonom och billigare.
> AI-utvecklingen på två år:
Aug 2024: ~11 min autonom expertuppgift
Aug 2025: ~3,5 timmar
Aug 2026: ≥16 timmar
→ minst ~87× längre autonoma arbetsuppgifter på två år.
Samtidigt gick real-world coding från ungefär 1/3 lösta problem till ~3/4 och nu upp mot ~95 % på den gamla benchmarken.
Det är därför folk som Altman, Amodei m.fl. pratar om AGI på en tidsskala av år snarare än årtionden.
Viktigaste caveaten: METR:s siffror gäller huvudsakligen välavgränsade software/ML/cyberuppgifter, inte ”alla mänskliga jobb”. Men just som mått på agentisk utvecklingshastighet är 11 min → 3,5 h → ≥16 h rätt häpnadsväckande."
__________________
Senast redigerad av AndreasGranen 2026-08-27 kl. 14:32.
Senast redigerad av AndreasGranen 2026-08-27 kl. 14:32.
