Först svarar din laptop på en fråga helt utan internet. Sedan får en annan app på samma dator svar på exakt samma fråga, utan att du ändrar något. Då blir datorn du redan använder din egen lilla AI-tjänst som andra appar och skript kan anropa.
Det handlar om att köra en nedladdad modell, inte om att träna en egen. Har du inte kollat om din laptop har tillräckligt med RAM eller VRAM för det här, läs först guiden om hur mycket RAM din laptop behöver för lokal AI. Vet du redan att den klarar det? Då är det bara att fortsätta.
En lokal AI-installation har fyra delar att hålla isär, även om den sista är valfri. När du vet vad de gör blir stegen nedan lättare att följa.
Modellvikterna finns i filen du laddar ner, till exempel en kvantiserad version av en liten modell på 3,4 GB. Det är nedladdningens storlek, inte mängden RAM modellen behöver när den körs.
Inferensmotorn är programmet som läser in modellvikterna och svarar på förfrågningar. Här använder vi Ollama, som kör sitt eget lokala HTTP-API och gör din laptop till en AI-tjänst för andra appar.
Klienten kan vara Ollamas inbyggda chatt, ett kort skript eller en separat app. Den skickar förfrågan och avgör om din fråga stannar på datorn eller skickas någon annanstans.
Ett valfritt dokumentindex gör att en chattmodell kan söka i dina egna filer. Det kräver en separat inbäddningsmodell och egen lagring. Indexet skapas inte automatiskt och ingår inte i den här guiden.
Kort sagt anropar en app eller ett skript Ollama på 127.0.0.1:11434. Programmet läser in modellen du laddat ner. Om du tar bort modellen finns klientens sparade chatthistorik kvar, eftersom den lagras på ett annat ställe.
Ta två minuter innan du installerar något och skriv upp datorns operativsystem och processor samt hur mycket RAM den har. Notera också om den har dedikerat grafikminne (VRAM) och hur mycket utrymme som är ledigt på SSD:n. Vill du veta hur mycket RAM och VRAM som behövs för lokal AI och varför? Läs guiden om hur mycket RAM din laptop behöver för lokal AI.
De två datorerna här nedanför finns just nu på refurbed. De har testats, rengjorts och rekonditionerats av fackfolk och omfattas av 12 månaders garanti. Den ena är en instegsmodell med Apple Silicon, den andra en Windows-dator med dedikerat grafikminne. Båda räcker för att genomföra alla steg längre fram i guiden.
Installera Ollamas officiella app på macOS eller Windows, eller följ Ollamas installationsanvisningar för Linux. Starta Ollama när installationen är klar. På Linux kör du ollama serve om tjänsten inte redan lyssnar efter anslutningar.
I den nuvarande appen kan du välja mellan lokala modeller och molnalternativ. Välj taggen för en nedladdad modell som körs lokalt. Du behöver inte logga in för att köra den.
För att följa guiden laddar du ner modellen med taggen qwen3.5:4b-q4_K_M. Nedladdningen är på 3,4 GB. Använd hela taggen: en generell tagg som ”latest” kan utan att du märker det peka på en betydligt större modell än den du har testat. De 3,4 GB avser filens storlek på disken, inte hur mycket RAM modellen behöver när den svarar på förfrågningar.
Två kommandon räcker för att börja chatta med en modell:
ollama pull qwen3.5:4b-q4_K_M
ollama run qwen3.5:4b-q4_K_M
Det första laddar ner modellen och det andra öppnar en interaktiv chatt med den. Ge modellen en liten, konkret uppgift i stället för att bara hälsa, till exempel: ”Skriv en att göra-lista utifrån de här tre mötesanteckningarna. Hitta inte på några datum.”
När du är klar skriver du /bye för att lämna chatten.
I terminalchatten sköter klienten kontakten med motorn. Nu anropar du den direkt, precis som en annan app skulle göra.
På macOS eller Linux:
curl http://localhost:11434/api/chat -H 'Content-Type: application/json' -d '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
I PowerShell på Windows:
Invoke-RestMethod -Uri 'http://localhost:11434/api/chat' -Method Post -ContentType 'application/json' -Body '{"model":"qwen3.5:4b-q4_K_M","messages":[{"role":"user","content":"In one sentence, define local inference."}],"stream":false,"options":{"num_ctx":4096}}'
Leta efter message.content i svaret. När stream är false får du hela svaret på en gång i stället för en del i taget. Med num_ctx: 4096 är kontextlängden i det första testet måttlig, långt under modellens angivna maxvärde.
Ollamas svar innehåller inte bara texten i message.content. Titta också på uppgifterna om tidsåtgång och antal token: load_duration, prompt_eval_count, prompt_eval_duration, eval_count och eval_duration.
Värdena visar hur lång tid det tar att läsa in modellen i minnet respektive generera svaret. Ett enda värde för ”token per sekund” skiljer inte på de två. Den första förfrågan efter att Ollama startat är vanligtvis långsammast eftersom modellen då måste läsas in. Vid nästa förfrågan behövs ingen ny inläsning.
De exakta siffrorna beror helt på din dator, så vi anger inga typiska värden här. Jämför i stället värdena från två körningar på samma laptop innan du litar på ett enstaka påstående om hastigheten.
Två kommandon ger dig överblick. Med det tredje tar du bort en modell du inte längre behöver.
ollama ps visar vilka modeller som är inlästa just nu och var de körs. I processorkolumnen står det 100 % GPU, 100 % CPU eller en fördelning mellan de två.
ollama ls listar alla modeller du har laddat ner.
ollama rm qwen3.5:4b-q4_K_M tar bort en nedladdad modell som du inte längre behöver.
Som standard laddar Ollama ur en modell från minnet efter fem minuters inaktivitet. Om ollama ps inte visar någon inläst modell, skicka en ny förfrågan innan du antar att något är fel.
Nu kan även en andra app få svar från din laptop. Ställ in appen så att den anropar samma dator i stället för en molntjänst.
De flesta appar som stöder en egen OpenAI-kompatibel API-anslutning ber om tre uppgifter: en bas-URL, ett modellnamn och en API-nyckel. Ange http://localhost:11434/v1/ som bas-URL och qwen3.5:4b-q4_K_M som modellnamn.
API-nyckelfältet kan ställa till det: vissa appar låter dig inte lämna det tomt. I sin dokumentation använder Ollama därför api_key='ollama' som platshållare och förklarar att den lokala servern kräver ett värde i fältet men inte kontrollerar vilket. Strängen fyller bara ut formulärfältet – den autentiserar ingenting och är inget lösenord.
Stödet omfattar dessutom bara delar av respektive API. Vill du skicka in bilder eller göra verktygsanrop, testa den funktionen i just din app i stället för att räkna med att allt fungerar.
Något kan fortfarande kontakta internet i bakgrunden, åtminstone i teorin. Så här utesluter du det.
När modellen har laddats ner stänger du av datorns Wi-Fi eller drar ur nätverkskabeln. Skicka sedan samma förfrågan som tidigare, i chatten eller via API:t. Får du ett svar när datorn är helt utan nätanslutning är det ett bevis på att modellen körs lokalt.
Följande är däremot inga bevis: att du bara får svar när du är uppkopplad, att något kommer från https://ollama.com i stället för localhost, eller att du använder en tagg för en molnmodell i stället för taggen för en nedladdad modell. Hos Ollama stannar en lokal förfrågan på din dator. De separata molnmodellerna körs i stället på en extern tjänst.
Det är ingen slump att den här installationen är privat. Därför är det värt att veta vad som skyddar dig – och vad som inte gör det.
Som standard lyssnar Ollama bara på 127.0.0.1:11434. Då kan bara program på din egen laptop ansluta. Behåll den inställningen. Ställ inte in OLLAMA_HOST=0.0.0.0 och vidarebefordra inte port 11434 så att den blir åtkomlig från internet. Platshållaren i API-nyckelfältet ger inget skydd, så om du exponerar porten lämnar du dörren öppen.
Du kan stänga av Ollamas egna molnfunktioner helt, men det är valfritt: med en nedladdad, lokal modelltagg kör du redan lokalt. Lägg till {"disable_ollama_cloud": true} i ~/.ollama/server.json eller ställ in OLLAMA_NO_CLOUD=1. Starta sedan om Ollama för att ändringen ska gälla.
Vill du nå installationen från ett annat rum eller en annan enhet är det en separat, mer avancerad fråga. Då krävs ett privat nätverk och en proxy med autentisering framför tjänsten. Det går vi inte igenom här. Att exponera porten direkt är inte rätt väg.
Här är några av de vanligaste problemen och vad du kan kontrollera först.
Anslutningen nekas. Kontrollera att Ollama-appen eller ollama serve är igång och försök igen.
Första svaret dröjer, men sedan går det snabbare. Fördröjningen beror på att modellen läses in, inte på hur snabbt den genererar text. Titta på svarsfälten vi gick igenom tidigare för att se skillnaden.
Allt känns mycket långsammare än väntat. Kör ollama ps och se om modellen körs enbart på CPU eller om arbetet fördelas mellan CPU och GPU. Kontrollera också vilket stöd som finns för ditt grafikkort och dess drivrutiner i ditt operativsystem.
Hög minnesbelastning eller krascher. Byt till en tagg för en mindre modell, sänk num_ctx och stäng andra minneskrävande appar innan du försöker igen.
Disken håller på att bli full. Kör ollama ls för att se vilka modeller du har laddat ner. Ta bort dem du inte använder med ollama rm.
Om upplägget inte passar dig, till exempel för att du vill bläddra bland modeller i ett grafiskt gränssnitt eller styra CPU och GPU mer i detalj, kan LM Studio och llama.cpp vara värda att titta på. Det är ett skäl att byta motor, inte att köra två installationer parallellt.
Behöver jag internet efter installationen? Nej. När modellen är nedladdad fungerar både chatten och API-anropen helt utan uppkoppling.
Skyddar platshållaren i API-nyckelfältet min lokala server? Nej. Ollamas lokala server godtar vilket värde som helst i fältet, bara det inte är tomt. Den kontrollerar inte värdet, så nyckeln som vissa appar frågar efter ger inget skydd.
Stannar min fråga på min laptop? Ja, om du väljer taggen för en modell som du har laddat ner och kör lokalt. Ollama har också separata molnmodeller som körs via en extern tjänst. Skillnaden ligger i vilken tagg du väljer, inte i någon dold standardinställning.
Behöver jag ett dedikerat grafikkort? Nej. En liten modell går att köra enbart på CPU, men det går vanligtvis långsammare. Med ollama ps ser du exakt hur en viss förfrågan hanterades.
Hur byter jag till en större eller annan modell? Kontrollera RAM och VRAM först. Byt sedan tagg i samma kommandon: ollama pull och ollama run. Guiden om hur mycket RAM din laptop behöver för lokal AI förklarar varför.
Kommer modellen att minnas mina dokument framöver? Nej. En chattmodell får inte automatiskt ett bestående minne av innehållet i en mapp. För att söka i dina filer behövs ett separat dokumentindex. Det är ett valfritt steg som vi inte tar upp här.
Välj en riktig uppgift och prova den i båda klienterna: den inbyggda chatten och appen du nyss anslöt. Du kan till exempel låta modellen sammanfatta en personlig anteckning, sortera en samling filer i namngivna grupper eller förklara en kort kodsnutt på enkel svenska.
Skriv ner vilken uppgift du valde, den exakta modelltaggen, motorversionen, kontextinställningen och URL:en. Då kan du eller någon annan göra om testet senare och få ett jämförbart resultat.
Om din laptop visar sig ha för lite RAM eller VRAM för det här kan det vara värt att byta till en dator med större marginaler. Nästa del i serien handlar om att sätta ihop en liten verktygslåda med modeller: en för chatt, en för kod och en för sökning.
Anmäl dig till vårt nyhetsbrev för första gången och spara 200 kr!
Missa aldrig ett erbjudande igen.
Information om användningen av personuppgifter finns i vår Integritetspolicy.
Bekräfta registrering
Klicka på länken i bekräftelsemailet för att få din rabattkod. Den gäller på köp för över 3000 kr.