Je wilt een stuk tekst door een AI laten verwerken, maar het gaat om vertrouwelijke informatie van een klant en je twijfelt of je die zomaar naar een externe server kunt sturen. Of je wilt simpelweg een taalmodel uitproberen zonder meteen een abonnement af te sluiten. Ollama is daarvoor een praktische oplossing: software waarmee je een AI-model volledig lokaal op je eigen laptop draait, zonder cloudverbinding en zonder dat jouw invoer ergens anders terechtkomt. In dit artikel ga je stap voor stap van een lege laptop naar een werkend lokaal AI-model, met de exacte commando’s die je nodig hebt.
Wat je nodig hebt voordat je begint
Ollama werkt op zowel Windows als macOS (en Linux, maar dat laten we hier buiten beschouwing). De minimale systeemvereisten zijn niet spectaculair streng, maar ze maken wel degelijk een verschil in hoe goed de ervaring is.
- RAM: minimaal 8 GB, maar 16 GB is echt de ondergrens voor een prettige ervaring. Met 32 GB of meer kun je ook grotere modellen draaien.
- Schijfruimte: reken op 4 tot 8 GB per model dat je wilt laden. Zorg dus dat je minimaal 10 tot 15 GB vrij hebt voordat je begint.
- GPU: niet verplicht, maar een grote bonus. Op een Mac met Apple Silicon (M1, M2, M3 of M4) gebruikt Ollama automatisch de geïntegreerde GPU, wat de snelheid fors verhoogt. Op Windows profiteert een NVIDIA-kaart ook direct van GPU-acceleratie via CUDA.
Heb je een oudere Windows-laptop zonder GPU en slechts 8 GB RAM? Dan werkt het nog steeds, maar bereid je voor op langzame responses. Denk aan 10 tot 30 seconden per antwoord in plaats van bijna direct.
Stap 1: Ollama downloaden en installeren
Ga naar ollama.com en klik op de downloadknop voor jouw platform.
Op macOS download je een.zip-bestand. Pak het uit en sleep de Ollama-app naar je Applications-map. Dubbelklik om te starten; je ziet een klein lama-icoontje verschijnen in de menubalk. Klaar.
Op Windows download je een installer (.exe). Voer die uit, accepteer de standaardinstellingen en Ollama installeert zichzelf als een achtergrondproces. Na installatie draait het automatisch als een service.
Stap 2: Controleer of Ollama correct draait
Open een terminal. Op macOS is dat Terminal of iTerm2, op Windows gebruik je PowerShell of de opdrachtprompt. Typ:
ollama --version
Zie je een versienummer? Dan is de installatie gelukt. Wil je controleren of de server actief is, typ dan:
ollama list
Dit commando toont alle modellen die al geïnstalleerd zijn. Op een verse installatie is die lijst leeg, en dat is prima.
Stap 3: Kies het juiste model voor jouw hardware
Dit is de stap waar veel mensen te snel doorheen gaan, met als gevolg dat hun laptop kreunt onder een model dat eigenlijk te groot is. Even goed nadenken loont hier.
| Model | Grootte | RAM nodig (ca.) | Geschikt voor |
|---|---|---|---|
| Phi-3 Mini | 3,8B | 4 tot 6 GB | Oudere laptops, 8 GB RAM |
| Mistral 7B | 7B | 8 tot 10 GB | Meest laptops met 16 GB RAM |
| Llama 3 8B | 8B | 8 tot 12 GB | Goede balans kwaliteit/snelheid |
| Llama 3 13B | 13B | 16 tot 20 GB | Krachtige laptops of desktops |
Heb je 16 GB RAM? Begin dan met Llama 3 8B of Mistral 7B. Heb je minder, ga dan voor Phi-3 Mini. Het is een kleiner model, maar verrassend capabel voor dagelijkse taken zoals samenvatten, vragen beantwoorden of code schrijven.
Stap 4: Je eerste model downloaden
Gebruik het commando ollama pull gevolgd door de modelnaam. Wil je Llama 3 8B downloaden, typ dan:
ollama pull llama3
Achter de schermen download Ollama het model in gecomprimeerde stukjes (zogenoemde GGUF-bestanden) en slaat ze op in een lokale modelmap. Je ziet een voortgangsbalk in de terminal. Afhankelijk van je internetverbinding duurt dit 5 tot 20 minuten voor een model van rond de 5 GB. Zit je thuis met glasvezel? Dan ben je in minder dan 10 minuten klaar.
Stap 5: Een gesprek starten in de terminal
Is het model binnen? Dan is het tijd voor het leuke deel. Typ:
ollama run llama3
Het model laadt in het geheugen (dat duurt de eerste keer 10 tot 30 seconden) en daarna verschijnt er een prompt. Je kunt gewoon beginnen te typen, alsof je een chatvenster hebt maar dan volledig in je terminal. Stel iets als:
“Schrijf een korte samenvatting van hoe fotosynthese werkt, voor een 12-jarige.”
Het antwoord verschijnt woord voor woord, precies zoals bij een online chatbot maar alles gebeurt lokaal op jouw machine. Geen data die de deur uit gaat.
Stap 6: Een chatinterface toevoegen met Open WebUI
De terminal is prima voor een snelle test, maar niet ideaal voor dagelijks gebruik. Open WebUI is een gratis, lokaal te draaien webinterface die eruitziet als ChatGPT maar op jouw eigen Ollama-installatie draait.
De makkelijkste manier om het te installeren is via Docker. Heb je Docker Desktop al draaien? Gebruik dan dit commando:
docker run -d -p 3000:8080 --add-host=host.docker.internal:host-gateway -v open-webui:/app/backend/data --name open-webui --restart always ghcr.io/open-webui/open-webui:main
Open daarna je browser en ga naar http://localhost:3000. Maak een lokaal account aan (je gegevens blijven lokaal) en je hebt een complete chatinterface die automatisch je Ollama-modellen herkent.
Veelvoorkomende foutmeldingen en hun oplossing
“Error: model not found”: Je hebt het model nog niet gedownload. Voer eerst ollama pull modelnaam uit voordat je ollama run gebruikt.
“Port 11434 already in use”: Ollama draait al op de achtergrond, of een ander programma gebruikt die poort. Start je computer opnieuw op of check via de taakbeheerder welk proces de poort bezet.
Model laadt niet of crasht direct: Grote kans dat je te weinig RAM hebt voor dit model. Verwijder het met ollama rm modelnaam en probeer een kleiner model zoals Phi-3 Mini.
Modellen up-to-date houden en schijfruimte beheren
Modellen worden regelmatig bijgewerkt. Om een model te vernieuwen voer je gewoon opnieuw ollama pull modelnaam uit. Ollama controleert automatisch of er een nieuwere versie beschikbaar is en download alleen wat nodig is.
Wil je een model verwijderen omdat het 5 GB schijfruimte inneemt die je liever anders gebruikt? Gebruik:
ollama rm modelnaam
Met ollama list zie je altijd een overzicht van alle geïnstalleerde modellen en hun grootte. Handig als je schijf een keer vol dreigt te lopen.
Met Ollama heb je in de meeste gevallen binnen een middagje een werkend lokaal AI-model draaien. Je data blijft op je eigen machine, je hebt geen API-sleutel nodig en de installatie is zonder veel moeite ongedaan te maken. Begin met een kleiner model zoals Mistral 7B of Phi-3 Mini als je laptop niet de krachtigste is, en kijk wat het doet. Combineer je het met Open WebUI, dan krijg je er ook een bruikbare chatinterface bij. Op een Mac met Apple Silicon is de snelheid soms ronduit verrassend.
