# Wat een AI-feature écht kost om te draaien

> Schat de kosten per call als tokens in plus tokens uit tegen het tarief van de provider, en vermenigvuldig met het maandvolume. Voor een grounded vraag-antwoordfeature in 2026 reken je op ongeveer €0,002 tot €0,02 per call. 50.000 calls per maand landt daarmee tussen €100 en €1.000. De opgehaalde context, niet het antwoord, is meestal het grootste deel van de rekening.

"Wat kost het om te draaien?" wordt meestal gevraagd nadat een feature gebouwd is, en dat is de verkeerde kant. Het antwoord is vooraf te weten tot op een factor twee, en dat weten verandert ontwerpbeslissingen die duur zijn om later te herzien.

## De formule

Providers factureren per token, apart geprijsd voor wat je stuurt en wat je terugkrijgt. Een token is grofweg vier tekens Engels, dus 750 woorden is ongeveer 1.000 tokens.

Kosten per call is dus:

```
(input tokens × input rate) + (output tokens × output rate)
```

Neem een supportantwoordfeature. De systeeminstructies zijn 300 tokens. Je haalt vijf passages van ongeveer 400 tokens elk op, dus 2.000. De vraag van de gebruiker is 50. Dat is 2.350 tokens in. Het antwoord komt terug rond de 250 tokens uit.

Bij middenklasse 2026-prijzen voor een capabel model (orde van €2,50 per miljoen inputtokens en €10 per miljoen output) is dat grofweg €0,006 plus €0,0025, dus ongeveer €0,0085 per call. Vijftigduizend calls per maand is rond de €425.

Het getal om te zien is dat retrieval 85% van de input uitmaakte. Dat is typisch, en daar zit de hefboom.

## Waar het geld écht naartoe gaat

**Opgehaalde context, eerst en met afstand.** Vijf passages in plaats van tien halveert je inputkosten, in de meeste gevallen zonder meetbaar verlies van nauwkeurigheid. Teams halen te veel op omdat het veiliger voelt; het is de moeite waard om te meten in plaats van aan te nemen.

**Retries.** Een call die validatie faalt en opnieuw loopt, kost twee keer. Bouw een retrybudget expliciet in, en log hoe vaak het afgaat. Een onbekeken retrylus is de meest voorkomende oorzaak van een rekening die drie keer groter binnenkomt dan de schatting.

**Ketens met meerdere stappen.** Een agent die plant, twee tools aanroept en samenvat is vier calls, die elk het opgebouwde gesprek meedragen. De kosten groeien sneller dan het aantal stappen, omdat de context meegroeit.

**Embeddings, een keer.** Je corpus indexeren is een eenmalige kostenpost, en een kleine: een miljoen tokens embedden kost centen. Opnieuw embedden bij elke deploy omdat de pipeline geen changedetectie heeft is niet klein, en het gebeurt.

## De vier wijzigingen die de rekening betrouwbaar omlaag brengen

**Haal minder op, beter.** De ranking verbeteren zodat drie passages tien verslaan is zowel goedkoper als nauwkeuriger: modellen zakken in als de relevante zin begraven zit in irrelevante context.

**Routeer op moeilijkheid.** De meeste vragen zijn makkelijk. Stuur die naar een klein model en escaleer alleen wat een goedkope classifier als lastig markeert. Een 70/30-splitsing tegen een model op een tiende van de prijs snijdt de rekening grofweg tot een derde.

**Orden de prompt voor caching.** Zet stabiele inhoud (instructies, gedeeld referentiemateriaal) vooraan en het variabele deel achteraan, zodat de promptcache van de provider korting kan geven op het herhaalde voorvoegsel.

**Beperk de outputlengte.** Als je twee zinnen nodig hebt, zeg dat en zet een maximum. Outputtokens hebben de hoogste eenheidsprijs, en een model zonder plafond vult de ruimte die het krijgt.

## Wat je in de praktijk begroot

Voor één grounded feature op matig volume (een paar tienduizend calls per maand) ligt de modelrekening meestal ergens tussen €100 en €1.000. Dat is bijna altijd klein naast de engineeringkosten om hem te bouwen, en klein naast de arbeid die hij vervangt.

De kosten die mensen verrassen zitten ergens anders: de vector store als je te vroeg voor een managed variant grijpt, het logvolume als je elke prompt en response oneindig bewaart, en de persoon die elke maand naar de evalresultaten moet kijken. Begroot die laatste. Een feature die niemand meet, zakt stilletjes weg als de data eromheen verandert.

## Het ene getal dat je nodig hebt voordat je bouwt

Kosten per call, op een bierviltje, met je echte verwachte contextgrootte. Het kost tien minuten en het bepaalt of de feature het waard is om te bouwen, rond welk modelniveau je ontwerpt, en of je vanaf dag één routing nodig hebt of die later kunt toevoegen.

Het alternatief is het in de tweede maand ontdekken, als de architectuur die het goedkoop had gefixt de architectuur is die je al hebt geshipt.

---

Gepubliceerd door Vuewer. AI-functies en webapplicaties, tot in productie.
Canonieke versie: https://vuewer.com/nl/blog/wat-een-ai-feature-kost-om-te-draaien