2026-06-16, 14:46
  #1
Medlem
dengo.dajordens avatar
Tecknade för ca 4 månader sedan 25 USD i månaden.

Använder det uteslutande till programmering. I början intensivt flera dagar i rad, morgon och kväll.

I princip dygnet runt. Bokstavligen.

Resultaten var förvånansvärt bra och de är bra fortfarande. När inte Claus pausar.

Första gången för drygt en månad sedan blev jag lite paff, "you have reached your usage limit". Vad?

Faktiskt vid dagar där jag använde det MINDRE intensivt. "Kom igen om 3 timmar". WTF?

Men det har blivit oftare och oftare, ibland 20 min ibland 3 timmars påtvingade pauser.

Mer och mer så till den grad att jag funderar på att byta till en annan leverantör.

Med Claude Sonnet har man tillgång till några tokens Claude Opus som konsumeras snabbt.

Nu vågar jag inte använda Claude Opus, det gjorde jag i starten ofta utan problem.

Har jag haft nybörjartur? Var det nyhetens behag? Ingen aning, men det blir sämre och sämre.

Som sagt, kvalité har jag inga klagomål på, det är bra. Men bara när det funkar. Och jag använder mode 'Claude Sonnet Low' för att inte slösa med tokens.

Någon som har upplevt något liknande? Det är riktigt frustrerande.
__________________
Senast redigerad av dengo.dajorden 2026-06-16 kl. 14:50.
Citera
2026-06-16, 15:08
  #2
Medlem
Klandalfs avatar
Är du ny på hela den där grejen med kapitalism?

Först får du ett smakprov, sen säljer de varan för en rimlig peng, sen försämrar de produkten avsevärt i syfte att sälja på dig dyrare alternativ när du vant dig vid bekvämligheten.

Knarklangare jobbar likadant.
Citera
2026-06-16, 15:11
  #3
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av dengo.dajorden
Någon som har upplevt något liknande? Det är riktigt frustrerande.
Om du har långa chattar och chatten får för sig att titta bakåt i historiken kan det bli många tokens som konsumeras. Du kan undvika det genom att starta nya chattar och ta bort de gamla om de blir några sidor långa. Du kan också skriva systeminstruktioner som begär korta och koncisa svar. Modellerna har en tendens att bli för pratiga, "Tack för din fråga, det här är ett komplext ämne, bla bla bla". Allt det orerandet tar det betalt för.
Citera
2026-06-16, 15:35
  #4
Medlem
Låter som att du gör mer och mer komplicerade tasks och blir förvånad över att det går åt mer tokens. Du påstår alltså att det är för dyrt att använda Sonnet i förhållande till det du får. Utan att veta resultatet eller vad du åstadkommit så tycker jag personligen att 25usd per månad är snorbilligt. Du får sätta det i relation till vad du får för pengarna.
Citera
2026-06-16, 15:45
  #5
Medlem
Enterprises avatar
Citat:
Ursprungligen postat av Cyborg2030
Om du har långa chattar och chatten får för sig att titta bakåt i historiken
För får sig? Är det inte snarare så en LLM är tekniskt uppbyggd att hela historiken (inom den aktuella sessionen) måste processas vid varje ny fråga inom samma session?
Citera
2026-06-16, 16:06
  #6
Medlem
SmurfSmurfs avatar
Citat:
Ursprungligen postat av Enterprise
För får sig? Är det inte snarare så en LLM är tekniskt uppbyggd att hela historiken (inom den aktuella sessionen) måste processas vid varje ny fråga inom samma session?

Länge chattar brukar komprimeras, men det blir ändå tungt.
Citera
2026-06-16, 17:26
  #7
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Enterprise
För får sig? Är det inte snarare så en LLM är tekniskt uppbyggd att hela historiken (inom den aktuella sessionen) måste processas vid varje ny fråga inom samma session?

Ja och nej, du har helt rätt att hela historiken måste finnas för att kunna förutsäga nästa token.
Men normalt används KV cache till detta, så vad som redan genererats inte behöver räknas om varje gång.
Förändrar du tidigare historik så blir cachen invalid och måste räknas om från grunden och det är tungt eftersom attention är O(n^2) utan KV cache. Med cache så blir det O(1) men i stället får du en enorm minnesbandbreddskostnad eftersom du behöver slå i cachen hela tiden.

Citat:
Ursprungligen postat av SmurfSmurf
Länge chattar brukar komprimeras, men det blir ändå tungt.

Problemet med långa kontext är inte primärt att de blir tunga, det finns massvis med tekniker för att hantera det (KV cache som nämnts ovan).
Det stora problemet är att modellen har svårt att hitta i långa kontext, det blir "blindspots" osv vilket gör att kvalitén sjunker drastiskt det är fortfarande ett olöst problem och är vad det verkar ett inneboende problem i attention, vikterna för uppmärksamhet tenderas att samlas i början och slutet av kontextfönstret vilket gör att precisionen i mitten sjunker markant.

Att komprimera (som i huvudsak handlar om att låta en modell summera vad som finns i kontextet och ersätta) var primärt något man gjorde i tidiga modeller där kontext fönstret bara var 8-16-32k eller så, idag när vi har kontext fönster som är 128k, 256k, 1M, 2M tokens osv finns det ingen vinst med detta, i stället är det vanliga att fönstret slidar och gammalt helt enkelt plockas bort. de mest avancerade systemet sparar ner historiken och använder RAG för att lyfta in relevant information till kontextet igen.

Men samtliga av dessa är bandaids, det kostar inget mer med långa kontext eller korta, du betalar inte ett öre för vad modellen i sig gör internt... dessutom går det inte ens mäta.

Det du blir fakturerad för är hur många tokens du skickar in till modellen och hur många tokens du får tillbaka.

Edit:

Det som bör tilläggas är att långa konversationer innebär massvis med mer input tokens (eftersom hela historiken skickas med till API anropet) så på det sättet blir det en högre kostnad för långa konversationer, men det har inget med vad modellen i sig gör/"eller tittar på" som en del verkar tro i den här tråden...
__________________
Senast redigerad av BeneathTheSurface 2026-06-16 kl. 17:29.
Citera
2026-06-16, 17:28
  #8
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av Enterprise
För får sig? Är det inte snarare så en LLM är tekniskt uppbyggd att hela historiken (inom den aktuella sessionen) måste processas vid varje ny fråga inom samma session?
I princip, ja, Men programmet som skickar historiken kan nog välja ut olika mycket historik vid olika tillfällen.
Citera
2026-06-16, 17:30
  #9
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
I princip, ja, Men programmet som skickar historiken kan nog välja ut olika mycket historik vid olika tillfällen.

Nej det kan det inte, varför tar du inte bara och läser på om hur det fungerar i stället för att gissa?
Citera
2026-06-16, 17:33
  #10
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Nej det kan det inte, varför tar du inte bara och läser på om hur det fungerar i stället för att gissa?
Hur vet du det?
Citera
2026-06-16, 17:34
  #11
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
Hur vet du det?

Vet vad?
Citera
2026-06-16, 17:37
  #12
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Vet vad?
Jag tolkar dig som att du inte vet hur alla chatklienter fungerar, du ville bara gnälla igen
Citera
  • 1
  • 2

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in