Ja, nu har jag kört en lokal AI-agent i ett par veckor och en sak är säker – den käkar tokens som en smålänning på en kinabuffé. Att bara experimentera och rigga upp agenten själv har i stort sett tuggat i sig närmare 2000kr i OpenRouter-tokens. En dyr historia.
Jämfört med enkla AI-verktyg eller automationer, så kräver en agent mycket mer tankekraft eftersom den även funderar och resonerar kring problemet som ska lösas. Det kan såklart vara en fördel att den kan dra sina egna slutsatser, men det kommer på bekostnad av ens ekonomi.
Att optimera sin AI-agent (som Hermes som jag just nu använder) för att sluka färre tokens är en metod som hjälper en bit på vägen, men ska du få maskinen att göra något riktigt användbart så räkna med att tömma plånboken. Därför har jag nu bestämt mig för att gräva djupare i lokala språkmodeller som körs på en vanlig PC med ett vasst grafikkort. En prisvärd äldre dator och ett begagnat Nvidia Tesla M10 för 1800kr har införskaffats till ett första lågprisförsök, för de mer kompetenta grafikkorten kan idag kosta runt 100 000 kronor. Vilket är lite utanför Danacos budget i dagsläget.
Nvidia Tesla M10 är på 32GB VRAM. Teoretiskt ska det klara rätt stora modeller på cirka 20-30B, men i praktiken är grafikkortet en gammal modell som i själva verket består av 4st 8GB GPUer, vilket kräver att modellen splittas upp (”sharding”) vilket troligtvis kräver en massa invecklad optimering och ger lägre hastigheter. Men det är värt ett försök.
Med en lokal språkmodell så behöver man aldrig betala någon annan (utöver elbolaget och datorhandeln) för att göra beräkningar. Då kan man sova gott och inte oroa sig över att vakna upp till dyra räkningar på morgonen.
Efter midsommar blir det till att rigga upp det hela och se om det går att köra en rimligt stor språkmodell utan att behöva spränga banken. Valet står mellan Gemma 4 och Qwen 3.5 som båda är kompetenta både på resonemang och programmering.

