Citat:
Ursprungligen postat av
erkki17
Det du beskriver är s.k. mixture-of-experts och är väl knappast någon hemlighet.
Mixture of experts är inte ens vad han beskriver, Mixture of experts är fortfarande en modell, men med routers i som selektivt involverar delar av lager.
Och ja det är nästan alla stora modeller idag helt enkelt för det går inte göra dense modeller som är 2-3 biljoner parametrar och köra inferens i realtid med någon som helst ekonomi eller för den delen någon användarupplevelse det.
Det är bara att räkna på liksom säg de största modellerna idag sägs ligga runt 3-4 biljoner parametrar alltså 3-4T eller 3000-4000b (miljarder).
De flesta tjänster ligger någonstans runt 60-120 tokens/sekund i generering, det blir alltså säg 3T skulle bli 3000*60 = 180000 GB/s eller 180 TB/s i minnesbandbredd, de absolut snabbaste riggarna nu kör Nvidia B200 som har en bandbredd på 8TB/s (teoretiskt max, men vi räknar på det) det skulle alltså krävas 23 B200 instanser för att hålla den hastigheten och detta enbart för en användare.
MoE däremot gör det ju mer rimligt säg 3T men med 70b aktiva experter så blir det i stället 70*60 = 4200 GB/s = 4,2 TB/s vilket lätt kan serveras från en enda maskin.