ThinkTank

AI Technology

Inference

Inference is het moment waarop een getraind AI-model effectief een voorspelling of antwoord genereert op basis van nieuwe input. Met andere woorden: dit is het echte gebruik van het model, in tegenstelling tot het trainen ervan.

INFER · Ook bekend als: modeluitvoering, inference run

Van getraind model naar echte output

Training is het langste deel van het AI-leven, maar inference is wat je als gebruiker voelt. Elke keer dat je een prompt indient en een antwoord krijgt, voert het model een inferentiestap uit: het past zijn geleerde gewichten toe op jouw input en berekent de meest waarschijnlijke volgende tokens.

Snelheid en kosten bepalen de keuze

Inference-prestaties meten we in twee dimensies: latency (hoe snel het eerste antwoord verschijnt) en throughput (hoeveel aanvragen tegelijk verwerkt worden). Cloudproviders rekenen per token, dus efficiënte prompts zijn ook goedkopere prompts.

Lokaal versus cloud

Sommige KMO's verkiezen on-premise inference voor gevoelige data. Kleinere modellen kunnen lokaal draaien, maar leveren minder kwaliteit dan cloud-API's van OpenAI of Anthropic. De juiste keuze hangt af van je beveiligingsvereisten en je tolerantie voor lagere nauwkeurigheid.

Wat betekent Inference?

Inference is het moment waarop een getraind AI-model effectief een voorspelling of antwoord genereert op basis van nieuwe input. Met andere woorden: dit is het echte gebruik van het model, in tegenstelling tot het trainen ervan.

Praktisch verder

Zet AI veilig in met ThinkTank, afgestemd op jouw bedrijf.