På en vanlig laptop med 16 GB minne kan qwen3.5:4b-q4_K_M redan skriva texter, förklara saker och besvara vardagliga frågor helt utan internet. Det är samma modell som i seriens andra del. Den är en bra allroundassistent, men ska inte också söka i dina filer eller ta hand om koduppgifter. Försöker du få en enda nedladdning att lösa allt får du en modell med för många uppgifter, i stället för tre små som var och en gör nytta.
Vill du ha kontroll över din lokala AI-installation behöver du välja modell, körmotor och licens – och bestämma vilka data som stannar var. Har du inte kontrollerat hur mycket RAM eller VRAM din laptop har? Börja med guiden om hur mycket RAM din laptop behöver för lokal AI. Om Ollama inte är installerat hjälper guiden om hur du sätter upp din första lokala AI-leverantör dig att komma igång. Här utgår vi från att du redan har kontrollerat minnet och installerat Ollama. Nu är frågan vilka modeller du ska välja – och hur du avgör om de är bra?
En användbar lokal AI-verktygslåda låter tre modeller sköta var sin uppgift, i stället för att en enda ska försöka klara allt.
En allroundassistent för vardagliga samtal, textutkast och snabba frågor är qwen3.5:4b-q4_K_M. Nedladdningen är på 3,4 GB, och taggen är densamma som i seriens andra del.
En liten specialist för exempelvis svar i ett bestämt format eller en avgränsad uppgift som kräver resonemang är granite4.2:3b. Den släpptes i augusti 2026, har Apache 2.0-licens och är 2,2 GB att ladda ned. I avsnitt 6 hittar du fler specialister för kod, matematik, bildförståelse och översättning, så att du kan välja modell efter uppgift.
En embeddingmodell för sökning i dina egna dokument är embeddinggemma:300m. Nedladdningen är på 622 MB. Det är ingen chattmodell: den omvandlar text till vektorer som ett sökprogram kan använda. I avsnitt 8 går vi igenom hur det fungerar.
De tre nedladdningarna tar tillsammans ungefär 6,2 GB på disken. Men det är bara deras sammanlagda filstorlek. Har du alla tre inlästa samtidigt kan de ändå kräva mer minne än laptopen har ledigt. Ladda in en modell i taget för den uppgift du ska göra, testa den på en verklig uppgift och ta bort modeller som inte gör nytta.
Skillnaden syns när du jämför tre varianter av samma modell hos Ollama: qwen3.5:9b-q4_K_M är 6,6 GB att ladda ned, qwen3.5:9b-q8_0 11 GB och qwen3.5:9b-bf16 19 GB. Modellvikterna är desamma, men lagras med tre olika precisioner och tar därför olika mycket plats.
Siffrorna i katalogen visar nedladdningsstorlekar, men säger inget säkert om hur mycket minne modellerna använder när de körs. Lägre precision ger mindre filer och kräver ofta mindre minne även under körning. Om svarskvaliteten påverkas, och i så fall hur mycket, beror på modellen, kvantiseringsmetoden och uppgiften. Ta inte för givet att svaren blir lika bra – minnesvinsten kan ha ett pris.
Inlästa modellvikter är inte allt som kräver minne. Kontextfönstret och dess KV-cache behöver också plats, liksom allt annat som körs på datorn. Även när kvantisering frigör minne är det inte säkert att en större modell får plats. Däremot blir den mer realistisk att prova än om du börjar med filen i full precision.
Två beteckningar i modellkatalogen är lätta att misstolka. I båda fallen riskerar du att ladda ned fel fil.
Första fallgropen. Google beskriver Gemma 4 E2B på sitt modellkort som en modell med 2,3 miljarder ”effektiva” språkparametrar. Det låter som en liten fil. Hos Ollama är den däremot 7,2 GB – nästan lika stor som Q4-varianten gemma4:12b på 7,6 GB. Utgå från nedladdningens storlek, inte antalet parametrar, när du bedömer vad din laptop har plats för.
Andra fallgropen. Om du inte anger variant kan du få en annan modell utan att märka det. Hämtar du bara granite4.2 får du 8B-modellen på 5,3 GB, inte 3B-varianten på 2,2 GB från avsnitt 2. Detsamma gäller qwen3-embedding: utan variant får du 8B-modellen på 4,7 GB, inte 0,6B-varianten på 639 MB som används i avsnitt 8.
Lösningen är densamma i båda fallen: hämta alltid den exakta, fullständiga taggen, aldrig bara modellfamiljens namn. Kontrollera också nedladdningens storlek innan du utgår från att du fått den variant du tänkt testa.
Ett maxvärde på exempelvis 128K eller 256K token i modellkatalogen anger vad modellen i princip kan ta emot. Det säger inte att din laptop med 16 GB minne har plats för en så lång kontext.
Ollama har ett standardvärde på 4 096 token för kontexten. Det går att höja, men både längre kontext och fler samtidiga förfrågningar kräver mer minne. Inställningen num_ctx: 4096 från seriens andra del är alltså samma försiktiga standardvärde, inte ett jämnt tal valt på måfå.
Börja med 4K–8K token när du testar en ny modell och kör en session åt gången. Håll koll på systemminnet under tiden. Öka kontexten först när du har sett att minnesanvändningen håller sig stabil, inte bara för att modellen enligt katalogen tekniskt klarar mer.
Ingen specialistmodell är bäst för alla uppgifter. Testa några små modeller på det du behöver hjälp med.
Kod: qwen2.5-coder:3b (1,9 GB) eller den större qwen2.5-coder:7b (4,7 GB). Båda har Apache 2.0-licens.
Avgränsade matematik- eller logikuppgifter: phi4-mini:3.8b (2,5 GB) från Microsoft.
Frågor om bilder och skärmbilder: gemma4:e2b (7,2 GB) eller gemma4:12b Q4 (7,6 GB). Båda har Apache 2.0-licens och anges kunna ta emot både text och bilder.
Skriva på flera språk eller översätta: aya-expanse:8b (5,1 GB), utvecklad för 23 språk.
Här är en viktig skillnad i licensvillkoren: Aya Expanse 8B har licensen CC-BY-NC-4.0 med ytterligare villkor för icke-kommersiell användning. Se den inte som ett alternativ utan licensbegränsningar till modellerna med Apache-licens ovan. Om ingen av de fyra modellerna passar är granite4.2:3b från avsnitt 2 fortfarande valet för mer allmänna uppgifter som kräver resonemang.
Testa varje modell på din egen uppgift innan du bestämmer dig. En specialist förtjänar sin plats på samma sätt som allroundassistenten: genom att hjälpa dig med det du vill få gjort, inte genom att toppa någon annans lista.
Fem korta tester säger mer om en modell än en sida i modellkatalogen. Prova varje modell du överväger med samma fem uppgifter och ditt eget material.
1. Sammanfatta med källstöd. Ge modellen en anteckning på 250 ord och be om tre åtgärdspunkter. Den ska ange vilken mening i anteckningen varje punkt bygger på. Markera allt i svaret som saknar stöd i texten.
2. Plocka ut uppgifter i ett bestämt format. Hitta på fem möten med namn och datum. Be modellen plocka ut uppgifterna som JSON med exakt de fält du anger. Stäm sedan av alla fem möten mot det du skrev.
3. Rätta kod. Ge modellen en liten funktion och ett test som funktionen inte klarar. Skriv upp om testet går igenom efter modellens ändring. Använd samma kodarkiv och kontext för varje modell du jämför.
4. Översätt mellan två språk. Låt någon som behärskar båda språken väl kontrollera att namn, siffror och nyanser i ett realistiskt textstycke bevaras i översättningen. Bedöm aldrig en modells förmåga att hantera flera språk utifrån enbart en prompt på engelska.
5. Besvara en fråga om en bild, endast för modeller som kan tolka bilder. Visa modellen ett diagram eller en skärmbild där svaret går att kontrollera. Kontrollera att själva bilden skickades med, inte bara filnamnet.
Skriv upp för varje körning: om svaret stämmer med ditt facit, om modellen följde instruktionerna, vad den eventuellt hittade på, hur lång tid det tog innan modellen visade något, den totala tiden, antalet token och om den kördes på CPU eller GPU. Bedöm nytta och hastighet var för sig: en modell som resonerar innan den svarar kan lägga tid på att generera token som du aldrig ser.
Embeddingmodellen från avsnitt 2 gör bara en sak: den omvandlar text till vektorer som ett sökprogram kan söka bland. Den besvarar inte frågor på egen hand.
Ordningen spelar roll. Först delas dina filer upp i textbitar. Embeddingmodellen omvandlar varje bit till en vektor, och vektorerna lagras lokalt. Sedan omvandlas din fråga till en vektor. Sökprogrammet hämtar de textbitar vars vektorer ligger närmast frågans vektor. Först därefter svarar en chattmodell med hjälp av de hämtade bitarna och anger vilka textställen den har använt.
Chattmodellen har aldrig tränats på dina dokument. Den ser bara det som söksteget hämtar åt den när du ställer frågan.
Du kan testa principen utan mycket förarbete: indexera fem anteckningar du redan har. Skriv två frågor: en som besvaras i en av anteckningarna och en vars svar inte finns i någon av dem. Om allt fungerar hittar systemet rätt textställe och hänvisar till det i svaret på den första frågan. För den andra medger det att underlag saknas i stället för att hitta på ett svar. Bedöm sökningen och slutsvaret var för sig.
Kontrollera hela taggen innan du laddar ned embeddingmodellen: embeddinggemma:300m eller qwen3-embedding:0.6b. Annars kan du råka hämta fel variant – samma risk som beskrivs i avsnitt 4.
En modell med en beteckning som ”26B A4B” aktiverar bara en del av sina parametrar för varje token den genererar. Alla 26 miljarder modellvikter måste ändå lagras eller strömmas någonstans. Färre aktiva parametrar innebär alltså inte automatiskt en mindre fil eller lägre minnesanvändning.
Verktygslådan innehåller inga nya, uppmätta benchmarkresultat. En siffra från någon annan behöver läsas i sitt sammanhang. En person har till exempel rapporterat cirka 18,5 token per sekund med en ovanlig 26B-konfiguration av typen mixture of experts, en äldre CPU och en GPU med 6 GB minne. Det är resultatet på just den personens hårdvara, inte en hastighet du generellt kan vänta dig av varje modell med samma beteckning.
Vi testade verktygslådan på två aktuella bärbara datorer: en instegsmodell med Apple Silicon och en Windows-arbetsstation med dedikerat grafikminne. Det är samma två datorer som i seriens andra del. Hos refurbed säljs båda rekonditionerade (professionellt testade, rengjorda och iordninggjorda) med 12 månaders garanti. De klarar också hela verktygslådan ovan med god marginal.
MacBook Air (2026) 13 tum med M5-chip har 16 GB enhetligt minne som standard och kan konfigureras med upp till 32 GB. Dell Precision 7730 har 32 GB systemminne och dessutom 6 GB dedikerat grafikminne från NVIDIA. Det är två separata minnesutrymmen, inte ett enda gemensamt.
Vi tar inte upp datorerna för att sälja in dem. Vi har använt dem som måttstock när vi skrev guiden, så att du kan jämföra din egen laptop med något konkret i stället för att utgå från ett reklambetonat specifikationsblad.
Licensen gäller den exakta modellen, inte hela modellfamiljen. Qwen3.5 4B, Qwen2.5-Coder, Granite 4.2 3B och Gemma 4 E2B har alla Apache 2.0-licens. Aya Expanse 8B har licensen CC-BY-NC-4.0 med ytterligare villkor för icke-kommersiell användning, som vi tog upp i avsnitt 6. Att kunna ladda ned modellvikterna är en sak, att ha upphovsrättsligt tillstånd att använda dem en annan och att ”äga” själva modellen en tredje. Läs därför det aktuella modellkortet för just den variant du hämtar, inte bara för modellfamiljen.
Det räcker inte att välja rätt en gång om verktygslådan ska förbli liten. Du behöver fortsätta sålla. ollama rm tar bort en nedladdad modell som inte gör nytta. Du kan till exempel köra ollama rm aya-expanse:8b när du vet att du inte tänker använda den modellen. ollama ls visar vilka modeller som finns på disken och ollama ps vilka som är inlästa. Modellkatalogerna förändras, så se över din lista då och då i stället för att lita på ett val du gjorde för flera månader sedan.
Små modeller kan fortfarande hitta på ett textavsnitt, missa en nyans på ett annat språk eller skriva kod som ser rätt ut men inte klarar testet. Se varje rekommendation här som något du själv behöver prova, aldrig som ersättning för en sakkunnigs granskning när resultatet är viktigt.
Kan jag köra alla tre modellerna i verktygslådan samtidigt? På en laptop med 16 GB minne blir det troligen trångt. Ladda in en modell för uppgiften du har framför dig och byt sedan modell, i stället för att ha allroundassistenten, specialisten och embeddingmodellen i minnet samtidigt.
Behöver embeddingmodellen en GPU? Nej. embeddinggemma:300m är liten nog att testas enbart på CPU. Mät ändå hur lång tid körningen tar, i stället för att räkna med att den går på ett ögonblick.
Ger en större modell alltid bättre svar? Nej. Om en 4B- eller 9B-modell ger bäst svar beror på uppgiften. Därför får du i avsnitt 7 en metod med fem tester i stället för en enda siffra från en topplista.
Räcker det med en Q4-variant? Det beror på uppgiften. Om du har tillräckligt med minne för att köra båda, jämför en Q4-tagg med Q8-varianten av samma modell i tre egna tester, som i avsnitt 3.
Kan jag använda Aya Expanse i ett kommersiellt projekt? Inte utan vidare. Licensen CC-BY-NC-4.0 gäller icke-kommersiell användning och har ytterligare villkor. Kontrollera det aktuella modellkortet innan du utgår från att kommersiell användning är tillåten.
Behöver embeddingmodellen internet efter nedladdningen? Nej. När modellvikterna väl finns på disken kan embeddingmodellen köras offline, precis som alla andra modeller i verktygslådan.
Du bedömde vad din laptop klarar i del ett och gjorde den redo i del två. Installera nu 4B-assistenten och en specialistmodell som passar en uppgift du har. Gör en egen variant av testet i avsnitt 7 med tre frågor. Behåll den modell som hjälper dig och ta bort den andra med ollama rm. Överväg att köpa mer minne först när en verklig uppgift, inte ett specifikationsblad, visar att just minnet sätter gränsen.
Här sätter vi punkt för serien i tre delar. Om din laptop visade sig behöva mer utrymme innan du går vidare är kategorin bärbara datorer en rimlig utgångspunkt.
Anmäl dig till vårt nyhetsbrev för första gången och spara 200 kr!
Missa aldrig ett erbjudande igen.
Information om användningen av personuppgifter finns i vår Integritetspolicy.
Bekräfta registrering
Klicka på länken i bekräftelsemailet för att få din rabattkod. Den gäller på köp för över 3000 kr.