Citat:
Det är inte antalet GPUer som gör någon skillnad, det är storleken på nätverket eftersom det kodar mycket mer information och mönster.
Men det är precis detta som är det som är så galet med LLMs, det behöver enorma mängder information för att fungera och med informationen får du kunskap "inbränd", det kanske är bra problemet är att kunskapen här är helt omöjlig att verifiera eller härleda till källan, det finns inga associativa minnen, inget kronologiskt eller något som helst logiskt koppel till minnet, det finns bara "intrampade stigar".
Det är just detta som är anledningen till att modellerna har jätteproblem med dubbel riktad information, det klassiska exemplet är "If Tom Cruise's mother is Mary Lee Pfeiffer, who is Mary Lee Pfeiffer's son?" en språkmodel bildar inte den reversibla kopplingen utan detta måste tränas in.
Det finns massvis med sådana här exempel som klart och tydligt illustrerar att de emergenta förmågor som man observerar inte är resultatet av en intelligent grundarkitektur utan att man med större nätverk tränar in fler och fler kända problem, så nästa uppdatering ser ut att klara det. Men det är en katt och råtta lek hela tiden, det är flera youtubers som gjort sig populära på att påvisa just sådant här banalt.
Man kanske kan fråga sig om det spelar någon som helst roll om det ändå "fixas" i nästa version? Ja det spelar en fantastisk roll eftersom det betyder att nätverken är totalt oförmögna att förstå grundläggande kausala relationer, ska du våga sätta dessa på något av värde så får du hoppas väldigt mycket att de blivit tränade med just din data och ditt mål tidigare för annars kan det bli vad som helst.
Det är också därför det var så fruktansvärt löjligt att se i en annan tråd, en post om en "forskare" som genuint frågade om han skulle publicera ett bevis som en LLM genererat, som han själv inte förstod. Det är precis det som nästan allt som är öppen för allmäna bidrag överflödas med nu, språkmodeller som används för att skapa patchar på open source projekt, som skrivit långa forskningsrapporter i olika ämnen och det är 99.9% skräp som en insatt person kan avfärda, men det kostar enorma mängder tid och investering, tidigare skickade inte klåpare in sina bidrag om de inte förstod dom, idag gör de det för de tror att AI gör rätt...