De beste open-source LLM’s van 2026: 7 modellen vergeleken
Hieronder de belangrijkste open-source taalmodellen van 2026 naast elkaar. Architectuurkeuzes blijken belangrijker dan parameteraantallen, en benchmarks vertellen lang niet het hele verhaal.
MoE-architecturen domineren
Zes van de zeven onderzochte modellen gebruiken een Mixture-of-Experts-architectuur. Dat betekent triljoenen parameters op papier, maar per token wordt slechts een fractie actief — vaak tussen de 10 en 40 miljard.
Kimi K2 heeft formeel een triljoen parameters, maar tijdens inferentie wordt er slechts 32 miljard afgevuurd. Die activatieratio bepaalt je GPU-kosten: niet het totale modelgewicht, maar wat er daadwerkelijk berekend wordt.
Wil je lokaal draaien? Let op hoeveel parameters er per stap actief zijn, niet op de marketingcijfers.
Context-vensters: groot is niet altijd beter
Modellen claimen tegenwoordig context-vensters van 256K tokens. Klinkt indrukwekkend, maar het betekent weinig als het model hallucineert bij 100K.
DeepSeek en GLM-5 gebruiken Sparse Attention-mechanismen om kwaliteit vast te houden bij langere sequenties, zonder dat het geheugengebruik explodeert. GLM-5 kan 128K tokens output genereren in één pass — handig als je een complete codebase wilt laten schrijven zonder loops.
Quantization zonder kwaliteitsverlies
DeepSeek v3.2 bereikt met INT4-quantization en Quantization-Aware Training (QAT) dubbele snelheid zonder merkbaar kwaliteitsverlies. Dat maakt het verschil tussen wel of niet lokaal kunnen draaien.
Praktische tip bij Qwen3 VL: houd de vision encoder (mmproj) in FP16 of Q8_0, zelfs als je de rest van het model agressief quantiseert. Anders krijg je kwaliteitsverlies bij OCR-taken.
Licenties: lees de kleine lettertjes
De meeste modellen kiezen voor Apache 2.0 (Qwen3 VL) of MIT (DeepSeek v3.2, GLM-5), wat betekent: weinig restricties, ook voor commercieel gebruik.
Maar Kimi K2.5 en MiniMax hebben een Modified MIT-licentie met attributie-clausules bij hyperscale — denk aan meer dan 100 miljoen maandelijkse gebruikers of $20 miljoen maandomzet. Voor de meeste toepassingen geen probleem, maar check dit voordat je schaalt.
Benchmarks: wiskunde, redeneren en code
Wiskunde
DeepSeek v3.2 scoort 96,0% op GSM8K, de hoogste math-reasoning-score in het overzicht. Gemma 3 (27B) haalt 95,9% GSM8K met slechts 27 miljard parameters — efficiënt voor een model dat op één consumer-GPU past.
Brede kennisdekking
Qwen3 VL scoort 87,1% op MMLU, de hoogste algemene kennistest.
Software engineering
MiniMax-M2.5 leidt SWE-Bench met 80,2%, vergelijkbaar met Claude Opus 4.6. GLM-5 haalt 77,8% op SWE-Bench Verified. DeepSeek v3.2 scoort 73,1% op SWE-Bench en 67,8% op echte GitHub-issues.
Let op: benchmark-rapportage verschilt enorm tussen modellen. Nieuwere modellen focussen soms op gespecialiseerde tests die oudere modellen niet uitvoerden, wat vergelijking lastig maakt.
Praktische inzichten per model
Kimi K2.5
Sterk in visual-to-code workflows: voer een UI-mockup in, krijg functionele React/CSS met animaties terug. De Agent Swarm-modus splitst brede vragen in honderd parallelle sub-agents, maar kan 20 minuten duren.
Kosten: ongeveer een achtste van Claude Opus voor vergelijkbare codekwaliteit. Nadeel: het model is vaak te uitgebreid. Voeg “Write simple, maintainable code without over-engineering” toe aan je prompt om dat te beperken.
Kimi K2 Thinking
Kan 200-300 sequentiële tool calls uitvoeren zonder coherentieverlies. Tegen-intuïtief: stel temperature op 1.0 voor optimale prestaties. Let op token-overhead: het model genereert tot 2,5× meer tokens door uitgebreid denken. Zelfs gequantiseerd heb je rond de 240GB gecombineerd RAM/VRAM nodig.
Qwen3 VL 235B
Uitstekende OCR in 32 talen, ook bij slechte belichting en complexe layouts. Kan als GUI-agent fungeren en output genormaliseerde coördinaten voor elk schermresolutie.
Technische noot: vLLM heeft een memory leak; plan periodieke server-restarts. Met RTX 5090s en kleine quants haal je 2.000-3.000 tokens/sec prompt processing, ~60 tokens/sec generatie.
GLM-5
Die 128K output tokens per pass zijn de killer feature: genereer complete codebases zonder loops. Het model halluceert 56% minder dan GLM-4.7 tijdens langdurig coderen.
Op dual RTX Pro 6000 met MXFP4/Q2-quantization haal je 16,5-17 tokens/sec. Beperk context tot 16K als snelheid prioriteit heeft.
Rare bug: het model reageert op system prompts die claimen dat het Claude is, wat suggereert dat er training data overlap is.
DeepSeek v3.2
DeepSeek Sparse Attention maakt long-context reasoning tot 3× sneller met lager geheugen. Het model behoudt redenering tussen tool calls, wat tokens bespaart.
Drie varianten: Base (standaard), Exp (experimenteel), Speciale (max-compute reasoning, alleen via API, geen tool-calling).
vLLM-tip: stel VLLM_USE_DEEP_GEMM=0 in om lange warmups te skippen. Vermijd TP=8 op Hopper/Blackwell GPUs: kernel padding van 16→64 heads veroorzaakt enorme overhead.
Google Gemma 3
Het 27B-model draait op één 24GB consumer-GPU met officiële QAT-quantization. Nadeel: een SimpleQA-score van 10 wijst op zwakke prestaties bij feitelijke kennis.
Kies op basis van je use case
De keuze hangt af van je toepassing:
- Wiskunde/redeneren: DeepSeek v3.2 of Gemma 3 (bij beperkte hardware)
- Codeergeneratie: MiniMax-M2.5 of GLM-5 (voor complete codebases)
- Visual-to-code: Kimi K2.5
- OCR/multimodaal: Qwen3 VL
- Lange chains van tool calls: Kimi K2 Thinking
Let bij lokaal draaien op activatieratio, quantization-opties en geheugengebruik — niet op de totale parameteraantallen.
Categorie: open-source

