ThinkTank

Modellen vergeleken

AI Leaderboard: prestatie vs. kost

Het beste model hangt af van je taak. Per categorie zetten we prestatie (0-100) naast outputprijs per miljoen tokens. Zo zie je meteen waar je het meeste haalt voor je budget.

Er is geen enkel beste AI-model voor alles.

De ranking verschilt per categorie. Wat goed scoort op tekst kan duur of zwak zijn op documenten. Vergelijk score én kost voor jouw taak, niet op hype.

Kost/score

Score en kost naast elkaar

Rechts = hogere score (tot 100). Onder = lagere outputprijs. Punten rechtsonder zijn de beste prijs/kwaliteit: sterk én goedkoop. Linksboven scoren modellen lager en kosten ze meer.

Tik of klik op een punt voor modelnaam, score, input- en outputprijs.

Vier categorieën

Waarvoor gebruik je AI in ThinkTank?

Elke categorie heeft een eigen ranking en prijsprofiel. Kies in de grafiek een categorie om score en kost te vergelijken.

Tekst

Mails, samenvattingen en klantantwoorden in je workspace.

Code

Programmeren, debuggen en automatiseren met agents.

Beeld

Illustraties, concepten en marketingvisuals uit tekst.

Document

Lange PDF's, rapporten en contracten doorzoeken.

Top 3 per categorie

Klik door de grafiek hierboven. Hieronder vind je per categorie meer context en onze top 3 richtingen: beste prijs/kwaliteit, voor zware taken, of scherpe prijs.

Tekst

Mails, samenvattingen, klantantwoorden: alledaags schrijfwerk in je workspace. De score komt uit blinde vergelijkingen op echte teksttaken, niet uit een testlab. In de grafiek zie je waar een hoog cijfer samenvalt met een lage prijs. Daar haal je het meeste uit je credits.

Onze default

Claude Sonnet 4.6

94

Score (0-100)

Input
$3 / 1M tokens
Output
$15 / 1M tokens

Beste prijs/kwaliteit

Gemma 4.31b

90.2

Score (0-100)

Input
$0.13 / 1M tokens
Output
$0.38 / 1M tokens

Voor zware taken

Claude Fable 5

100

Score (0-100)

Input
$10 / 1M tokens
Output
$50 / 1M tokens

Code

Programmeren, debuggen, automatiseren. Rankings op basis van echte code-opdrachten. Handig als je agents scripts bouwen of workflows draaien: een sterk model tegen een aanvaardbare prijs betekent minder opnieuw beginnen en minder credits verspild.

Beste prijs/kwaliteit

Mimo V2.5 Pro

71.1

Score (0-100)

Input
$0.44 / 1M tokens
Output
$0.87 / 1M tokens

Voor zware taken

Gpt 5.6 Sol Xhigh (Codex Harness)

100

Score (0-100)

Input
$1.25 / 1M tokens
Output
$10 / 1M tokens

Scherpe prijs

Mimo V2.5

62.7

Score (0-100)

Input
$0.11 / 1M tokens
Output
$0.28 / 1M tokens

Image

Beelden uit een tekstopdracht: illustraties, concepten, marketingvisuals. Gerangschikt op wat mensen in de praktijk verkiezen. Vergelijk score met prijs om een model te kiezen dat er goed uitziet en binnen budget blijft.

Beste prijs/kwaliteit

Gemini 3.1 Flash Lite Image (Nano Banana 2 Lite)

72.3

Score (0-100)

Input
$0.25 / 1M tokens
Output
$1.5 / 1M tokens

Voor zware taken

Gpt Image 2 (Medium)

100

Score (0-100)

Input
$8 / 1M tokens
Output
$15 / 1M tokens

Sterk alternatief

Reve 2.1

83

Score (0-100)

Input
$1 / 1M tokens
Output
$4 / 1M tokens

Document

Lange PDF's, rapporten, contracten en spreadsheets waar het model over veel pagina's moet redeneren. Belangrijk bij factuurverwerking, beleidscontrole of grote bestandsanalyse. Een hoge score tegen lage kost bespaart credits op zware leestaken.

Beste prijs/kwaliteit

Claude Sonnet 4.6

79.4

Score (0-100)

Input
$3 / 1M tokens
Output
$15 / 1M tokens

Voor zware taken

Claude Opus 4.6 Thinking

100

Score (0-100)

Input
$5 / 1M tokens
Output
$25 / 1M tokens

Scherpe prijs

Kimi K2.6

44.9

Score (0-100)

Input
$0.66 / 1M tokens
Output
$3.41 / 1M tokens

Methodologie

Scores: blind geteste rankings per categorie, op schaal 0-100 (min-max over alle modellen met een bekend tarief op deze pagina).

Kost: input- en outputprijs in USD per miljoen tokens, op basis van actuele modeltarieven. De grafiek toont de outputprijs; bij selectie en in de picks zie je beide.

Picks: drie richtingen per categorie, slimste prijs/kwaliteit, hoogste score voor zware taken, en het goedkoopste model boven de mediane score. Geen pick is altijd de beste.

Veelgestelde vragen

Waar komen de scores vandaan?

Per categorie gebruiken we blind geteste prestatierankings op echte taken. Die scores schalen we naar 0-100 binnen elke categorie, over alle modellen met een bekend tarief op deze pagina.

Hoe worden de kosten berekend?

Input- en outputprijs in USD per miljoen tokens komen uit actuele publieke modeltarieven. De grafiek toont de outputprijs; bij selectie en in de top 3 zie je beide.

Hoe kiest ThinkTank welk model ik krijg?

ThinkTank is LLM-agnostisch: per taak schakelen we automatisch het beste model in. Jij hoeft niet zelf te vergelijken, wij volgen kwaliteit, kost en geschiktheid voor je opdracht.

Wordt deze pagina regelmatig bijgewerkt?

Ja. Scores en tarieven worden periodiek ververst op basis van actuele prestatierankings en modeltarieven. Onderaan de grafiek zie je de laatste updatedatum.

ThinkTank kiest het juiste model voor je taak

Geen keuzestress: wij schakelen automatisch het beste model per taak. Start meteen of plan een demo.