Citat:
De som aldrig haft utrustning i den storleken förstår inte hur mycket som krävs.
Det låter enkelt ”köp en server plugga in i väggen” men då har man inte förstått detta är utrustning som ensamt drar ström som en mindre villa, behöver 3-fas, sannolikt helt omdragen elektronik, storskalig vattenkylning och klimatkontrollerad miljö.
Det är ett mångmiljonprojekt, hade det varit så jäkla lätt och billigt hade det aldrig ens gått konkurrera med cloud providers, de höjer inte sina priser för att jävlas utan för de blöder pengar och då pratar jag inte om de företag som själva tränar modeller, det finns massvis som bara har som affärsidé att hosta och tillhandahålla ”open source” modeller.
Men som sagt låt dom stå som fån inför företagsledningen när de lägger fram förslagen och inte gjort minsta research innan.
Det låter enkelt ”köp en server plugga in i väggen” men då har man inte förstått detta är utrustning som ensamt drar ström som en mindre villa, behöver 3-fas, sannolikt helt omdragen elektronik, storskalig vattenkylning och klimatkontrollerad miljö.
Det är ett mångmiljonprojekt, hade det varit så jäkla lätt och billigt hade det aldrig ens gått konkurrera med cloud providers, de höjer inte sina priser för att jävlas utan för de blöder pengar och då pratar jag inte om de företag som själva tränar modeller, det finns massvis som bara har som affärsidé att hosta och tillhandahålla ”open source” modeller.
Men som sagt låt dom stå som fån inför företagsledningen när de lägger fram förslagen och inte gjort minsta research innan.
Så är det – åtminstone delvis.
Men för oss som är lite äldre, byggde våra egna datorer som barn och senare har byggt och driftat servrar i yrkeslivet, blir det här snarare en rolig utmaning. Äntligen något där man inte redan kan exakt allt från början. Förutsatt att ekonomin finns, förstås.
I min lokala utvecklingsserver kör jag exempelvis fyra RTX 5070 Ti, alltså totalt 64 GB VRAM, över vanliga PCIe x8-anslutningar tillsammans med en Threadripper 3970X. Det fungerar utmärkt och är nästan överdimensionerat för vårt nuvarande behov. Vid fyra parallella jobb levererar den upp till omkring 500 tokens per sekund totalt.
Startupbolaget jag arbetar för köpte dessutom i princip allting begagnat eller refurbished. Jag plockade ihop delarna från bland annat Amazon och eBay, och slutkostnaden blev förvånansvärt rimlig. Nu, ungefär ett år senare, har investeringen sannolikt redan nått break-even med tanke på hur hårt servern har arbetat och vilka API-kostnader den har ersatt.
För tillfället kör jag Qwen3.6-35B-A3B och dessförinnan körde jag Qwen 3.5 A3B. Nu när Kimi verkar vara på gång med öppna vikter funderar jag på att sälja nuvarande server och försöka få tag på ett antal Intel Arc Pro B70 med 32 GB minne vardera. Kombinerat med ett vettigt moderkort som erbjuder minst PCIe 4.0 och x8 till åtta kort hade det varit ett enormt roligt bygge – förutsatt att mellanskillnaden inte blir alltför stor.
Så nej, jag underskattar absolut inte hur snabbt det blir komplicerat och dyrt när man skalar upp till riktigt stora installationer. Men det finns också ett ganska stort spann mellan ”köp en server och sätt den i vägguttaget” och ett mångmiljonprojekt med egen hall, vattenkylning och ombyggd elförsörjning. För utveckling och inferens med öppna modeller går det att komma väldigt långt med relativt vanlig, om än entusiastbetonad, hårdvara.
Jag arbetar och experimenterar med sådant här dagligen och har gjort det i flera år. Trots att jag tycker att jag har en ganska god förståelse för hur tekniken fungerar blir jag fortfarande kontinuerligt imponerad av hur bra de öppna modellerna faktiskt har blivit.
Tänk om man dessutom hade fått en vettig lön för det man tycker är så roligt …
Var det inte någon som sade att man bara behövde hänga med i utvecklingen och lära sig AI för att vara helt säker inför framtiden? Jag väntar fortfarande på stålarna. 🙂