Den bästa förklaringen till hur det fungerar
i princip står erkki17 för.
Vad som dock inte kan redovisas av någon är ju precis den detaljerade funktionella nivån som jag efterfrågar. Hur gör faktiskt ett ANN när de tar fram ett svar på ett svårt problem i ett IQ-test (som den inte har tränats på).
Man vet
i princip hur det går till men man förstår inte det på någon detaljerad nivå. Detta bekräftas ju av flera av medlemmarna i tråden. Så varför är vissa av er så fruktansvärt uppjagade nu när det verkar som att vi ändå har nått konsensus om detta?
Citat:
Ursprungligen postat av
erkki17
Vi kan inte redogöra för exakt vad som händer inuti proprietära modeller. Det vi kan redogöra för är just principerna. Träning formar vikter, aktiveringar flödar igenom nätverket där attention heads pekar ut features (t.ex. detta token representerar en geometrisk figur), MLP:er transformerar token och attention till ett nytt state, vilket repeteras för varje token i context. Output från attention heads och MLP utgör olika beräkningskretsar (circuits) där en eller flera kretsar kan ses implementera algoritmer. Skalningslagarna ger att större modeller presterar bättre, vilket bl.a. beror på att de kan lagra mer precisa interna representationer och kan ha en större KV-cache som ger ett bättre "minne" mellan de olika aktiveringarna.
Det gör att Fable då skulle ha kunnat hitta bättre algoritmer som utför fler, mer specialiserade, beräkningar än en mindre modell.
Citat:
Ursprungligen postat av
kaerakel
Kruxet är att du är totalt ointresserad av forskningen, du vill mest härja på forumet.
Enlig dig kaerakel var ju detta en öppen forskningsfråga.
Ditt bästa inlägg har ju bekräftat det jag har påstått hela tiden.
Citat:
Ursprungligen postat av
RandomNPC
ANN saknar en formell, transparent kedja från input till output
Citat:
Ursprungligen postat av
Cooltrayne
Du har fått svar väldigt många ggr nu.
Den nivån av transparens i ett ANN som jag efterfrågar
är en öppen forskningsfråga, enligt mig, enligt
kaerakel, m.fl. Man vet alltså inte hur modellen fungerar på den detaljnivån som jag efterfrågar i TS. Ni vet inte. Forskningen vet inte. Det är en öppen forskningsfråga.
Ni ska ha ett stort tack allihopa. Snyggt teamwork!