Citat:
Ursprungligen postat av
Enterprise
För får sig? Är det inte snarare så en LLM är tekniskt uppbyggd att hela historiken (inom den aktuella sessionen) måste processas vid varje ny fråga inom samma session?
Ja och nej, du har helt rätt att hela historiken måste finnas för att kunna förutsäga nästa token.
Men normalt används KV cache till detta, så vad som redan genererats inte behöver räknas om varje gång.
Förändrar du tidigare historik så blir cachen invalid och måste räknas om från grunden och det är tungt eftersom attention är O(n^2) utan KV cache. Med cache så blir det O(1) men i stället får du en enorm minnesbandbreddskostnad eftersom du behöver slå i cachen hela tiden.
Citat:
Ursprungligen postat av
SmurfSmurf
Länge chattar brukar komprimeras, men det blir ändå tungt.
Problemet med långa kontext är inte primärt att de blir tunga, det finns massvis med tekniker för att hantera det (KV cache som nämnts ovan).
Det stora problemet är att modellen har svårt att hitta i långa kontext, det blir "blindspots" osv vilket gör att kvalitén sjunker drastiskt det är fortfarande ett olöst problem och är vad det verkar ett inneboende problem i attention, vikterna för uppmärksamhet tenderas att samlas i början och slutet av kontextfönstret vilket gör att precisionen i mitten sjunker markant.
Att komprimera (som i huvudsak handlar om att låta en modell summera vad som finns i kontextet och ersätta) var primärt något man gjorde i tidiga modeller där kontext fönstret bara var 8-16-32k eller så, idag när vi har kontext fönster som är 128k, 256k, 1M, 2M tokens osv finns det ingen vinst med detta, i stället är det vanliga att fönstret slidar och gammalt helt enkelt plockas bort. de mest avancerade systemet sparar ner historiken och använder RAG för att lyfta in relevant information till kontextet igen.
Men samtliga av dessa är bandaids, det kostar inget mer med långa kontext eller korta, du betalar inte ett öre för vad modellen i sig gör internt... dessutom går det inte ens mäta.
Det du blir fakturerad för är hur många tokens du skickar in till modellen och hur många tokens du får tillbaka.
Edit:
Det som bör tilläggas är att långa konversationer innebär massvis med mer input tokens (eftersom hela historiken skickas med till API anropet) så på det sättet blir det en högre kostnad för långa konversationer, men det har inget med vad modellen i sig gör/"eller tittar på" som en del verkar tro i den här tråden...