Citat:
Ursprungligen postat av
Tom.Of.Finland
Hur många TOPS på en NPU (Neural Processing Unit) bör man ha om man vill kunna köra lokala modeller?
TOPS är väl inte relevant när man ska köra en färdig lokal modell?
Det är VRAM och bandbredd på VRAM som spelar roll.
Hittade en sammanställning - vet inte om den stämmer men den ger iaf en slags förklaring:
3B (Tiny) - Llama 3.2 3B, Phi-3.5 Mini - 8GB - 16GB + 4-core CPU
7B (Small) Mistral 7B, Llama 3.2 7B 12GB 16GB + GPU (8GB)
13B (Medium) Llama 2 13B, Mixtral 8x7B 24GB 32GB + GPU (12GB)
34B (Large) CodeLlama 34B, Yi 34B 48GB 64GB + GPU (16GB)
70B+ (Huge) Llama 3.1 70B, Qwen 72B 96GB 128GB + GPU (24GB)
Vill du köra en 34B modell så rekommenderas alltså 48 Gb RAM och en GPU med 16GB VRAM.
Vill du köra en modell med 70B så rekommenderas 96 GB RAM och 24 GB VRAM.