2026-09-17, 22:07
  #157
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av erkki17
Det du beskriver är s.k. mixture-of-experts och är väl knappast någon hemlighet.
Jag skrev inte att det var en hemlighet. Det jag säger är att ordet "språkmodell" är fel begrepp.
Citera
2026-09-17, 22:10
  #158
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av erkki17
Det du beskriver är s.k. mixture-of-experts och är väl knappast någon hemlighet.

Mixture of experts är inte ens vad han beskriver, Mixture of experts är fortfarande en modell, men med routers i som selektivt involverar delar av lager.

Och ja det är nästan alla stora modeller idag helt enkelt för det går inte göra dense modeller som är 2-3 biljoner parametrar och köra inferens i realtid med någon som helst ekonomi eller för den delen någon användarupplevelse det.

Det är bara att räkna på liksom säg de största modellerna idag sägs ligga runt 3-4 biljoner parametrar alltså 3-4T eller 3000-4000b (miljarder).

De flesta tjänster ligger någonstans runt 60-120 tokens/sekund i generering, det blir alltså säg 3T skulle bli 3000*60 = 180000 GB/s eller 180 TB/s i minnesbandbredd, de absolut snabbaste riggarna nu kör Nvidia B200 som har en bandbredd på 8TB/s (teoretiskt max, men vi räknar på det) det skulle alltså krävas 23 B200 instanser för att hålla den hastigheten och detta enbart för en användare.

MoE däremot gör det ju mer rimligt säg 3T men med 70b aktiva experter så blir det i stället 70*60 = 4200 GB/s = 4,2 TB/s vilket lätt kan serveras från en enda maskin.
Citera
2026-09-17, 22:13
  #159
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Men det var väl inte vad frågan gällde, utan VAD man tränar på, det är det som gör om det är en språkmodell eller inte...
Ordet språkmodell är bara ett smeknamn för det man ville eller tror att man har tränat. Ordet innebär inte några begränsningar för vad en modell kan göra.
Citera
2026-09-17, 22:16
  #160
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
Ordet språkmodell är bara ett smeknamn för det man ville eller tror att man har tränat. Ordet innebär inte några begränsningar för vad en modell kan göra.

Ja lika mycket som "bensinmotor" är ett smeknamn för en motor som är gjord för att drivas på bensin.

Det är konstigt att du ska vräka ur dig saker i ämnen som du inte har minsta förståelse för, det liksom säger sig självt om du ens hade haft minsta förståelse för attention mekanismen att det modellerna lär sig är relationen mellan tokens, och tokens får de genom att tokenisera text.
Där av namnet språkmodell.

Ja de tränar på bilder, ljud och video också, men det är inte de lagren du interagerar med när du skriver "hur får jag ur fingret ur röven?"
Citera
2026-09-17, 22:40
  #161
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Ja lika mycket som "bensinmotor" är ett smeknamn för en motor som är gjord för att drivas på bensin.
Om vi döper om Claude Mythos till Claude Chess då blir det en schackdator som bara kan spela schack?
Citera
2026-09-17, 22:41
  #162
Medlem
BeneathTheSurfaces avatar
Citat:
Ursprungligen postat av Cyborg2030
Om vi döper om Claude Mythos till Claude Chess då blir det en schackdator som bara kan spela schack?

Nej, och det är ju precis det jag säger... det spelar ingen roll om du kallar det för Kriminella Neurala Nätverk eller dyl, det är språkmodeller...
Är du så dum så du tom argumenterar mot dig själv nu?
Citera
2026-09-17, 22:46
  #163
Medlem
Cyborg2030s avatar
Citat:
Ursprungligen postat av BeneathTheSurface
Nej, och det är ju precis det jag säger... det spelar ingen roll om du kallar det för Kriminella Neurala Nätverk eller dyl, det är språkmodeller...
Är du så dum så du tom argumenterar mot dig själv nu?
Kriminella Neurala Nätverk är ett betydligt mer rättvisande namn när vi de facto har ett neuralt nätverk som begår brott och som inte alls är begränsat till att hjälpa dig med dina särskrivningar.
Citera
2026-09-18, 08:23
  #164
Medlem
Är inte superinsatt i A.I. Hur stor risk är detta?

Såg även att VD:n för ett av världens största (?) A.I bolag också varnar för utvecklingen.

Vissa spekulerar att det är BS men vad säger ni?

Länken kommer här: https://www.aftonbladet.se/nyheter/a/M7G0kr/varnar-racker-inte-att-bromsa-ai-maste-stoppas
Citera
2026-09-18, 08:35
  #165
Medlem
Citat:
Ursprungligen postat av DazeHereToAmaze91
Är inte superinsatt i A.I. Hur stor risk är detta?

Såg även att VD:n för ett av världens största (?) A.I bolag också varnar för utvecklingen.

Vissa spekulerar att det är BS men vad säger ni?

Länken kommer här: https://www.aftonbladet.se/nyheter/a/M7G0kr/varnar-racker-inte-att-bromsa-ai-maste-stoppas
Risk att människor använder AI för brott och terrorism: medel-hög

Risk att AI förgör mänskligheten: mycket låg
Citera
2026-09-18, 08:40
  #166
Medlem
Citat:
Ursprungligen postat av Cyborg2030
Jag skrev inte att det var en hemlighet. Det jag säger är att ordet "språkmodell" är fel begrepp.
De tränas på språk, de svarar med språk, all input måste omvandlas till språk. Ergo: språkmodell.

Att agenter eller verktyg som ChatGPT inte enbart är språkmodeller är det nog ingen som har påstått. Kärnan i allt detta är ändå en LLM. Sedan finns det annat runtom som tool-calls, specialistmodeller, agentloop etc.
Citera
2026-09-18, 09:26
  #167
Medlem
Citat:
Ursprungligen postat av erkki17
Det du beskriver är s.k. mixture-of-experts och är väl knappast någon hemlighet.
För doomers måste allt vara mystiskt och hemligt.

Men utvecklingen är ju rimligt.
* Först en tolkare dispatcher som skickar delfrågor till AI-experter.
* Sedan ett gäng AI-experter som är specialister inom sina domäner.

Fördelar är att man då bara behöver träna om en AI-expert i taget för att kunna releasa en nyare bättre LLM.
Och bara behöver träna om dispatchern ifall man skapar en ny AI-expert.

Och vissa AI-experter behöver väl inte tränas om så ofta. För områden där inte mycket nytt händer, och inget nytt träningsdata uppstår.
Citera
2026-09-18, 09:27
  #168
Medlem
Citat:
Ursprungligen postat av DazeHereToAmaze91
Är inte superinsatt i A.I. Hur stor risk är detta?

Såg även att VD:n för ett av världens största (?) A.I bolag också varnar för utvecklingen.
Du kan läsa denna: https://www.linkedin.com/pulse/we-must-pace-prophecies-reply-dario-amodei-andreas-steno-larsen-jhuie/
Citera

Skapa ett konto eller logga in för att kommentera

Du måste vara medlem för att kunna kommentera

Skapa ett konto

Det är enkelt att registrera ett nytt konto

Bli medlem

Logga in

Har du redan ett konto? Logga in här

Logga in