NYFIR STUDIOS
Nyfir Studios Learn

Hur mycket RAM och VRAM behöver lokal AI?

Det finns inget enda minneskrav för lokal AI. Behovet beror på modellens viktfil, kvantisering, kontextlängd, programvara och om beräkningen sker i CPU, GPU eller båda. Därför är en mätbar startplan bättre än en magisk siffra.

RAM och VRAM har olika roller

RAM är datorns vanliga arbetsminne. VRAM sitter på ett diskret grafikkort och kan ge betydligt snabbare inferens när modellen eller delar av den ryms där. Integrerad grafik delar ofta systemminne, vilket gör att samma RAM ska räcka både till operativsystem och AI.

En modell kan köras helt på CPU och RAM, helt eller delvis på GPU, eller med lager fördelade mellan dem. Stöd och prestanda varierar mellan modellkörare, grafikdrivrutiner och hårdvara.

Varför modellnamnet inte räcker

Parametertal som 3B, 7B eller 14B beskriver ungefär hur många parametrar modellen har, men inte exakt minnesbehov. Kvantisering lagrar vikterna med färre bitar och minskar filen, ofta med en kvalitets- och kompatibilitetsavvägning.

Utöver vikterna behövs minne för kontext, cache, runtime och andra program. En mycket lång kontext kan därför göra en modell instabil trots att själva modellfilen verkar rymmas.

Praktiska startnivåer – inte garantier

På en dator med 8 GB RAM bör du hålla experimenten små och stänga annat; vissa små modeller kan fungera, men marginalen är begränsad. Med 16 GB finns mer utrymme för mindre och medelstora kvantiserade modeller. 32 GB ger större flexibilitet för kodverktyg, längre kontext och samtidiga program.

För GPU-körning är tillgängligt VRAM ofta viktigare än grafikkortets marknadsnamn. En modell som inte ryms kan fortfarande delas med RAM, men hastigheten kan falla tydligt. Kontrollera faktisk allokering i modellkörarens logg eller systemövervakning.

Så mäter du din dator

  1. Notera ledigt RAM och VRAM innan start.
  2. Ladda en liten kvantiserad modell.
  3. Kör samma korta testprompt tre gånger.
  4. Öka kontext eller modellstorlek en sak i taget.
  5. Avbryt om systemet börjar växla kraftigt till disk, frysa eller stänga program.

Spara modelltagg, programversion, tokens per sekund om verktyget visar det och högsta observerade minnesanvändning. Då bygger du en egen, reproducerbar kapacitetsbild.

Vanliga missförstånd

  • Ledigt diskutrymme är inte samma sak som arbetsminne.
  • Mer VRAM förbättrar inte en modell som programvaran inte kan använda på din GPU.
  • En större kontext gör inte svaret automatiskt bättre.
  • Att en modell startar betyder inte att den är bekväm att använda samtidigt som utvecklingsverktyg.

Planera för marginal. Ett stabilt arbetsflöde behöver plats för operativsystem, editor, webbläsare och testverktyg – inte bara modellen.