AI agent kosten

Wat kost een AI-agent voor je bedrijf, en waarom dat anders werkt dan bij een chatbot

Written by Ruben Lucas Groothuis ·

De prijs per token daalt, maar een agent gebruikt er per taak veel meer van. Gartner voorspelt tot 2028 ruim vijf keer hogere inferencekosten per agentic workflow. Dit zijn de kostenposten en zo houd je ze beheersbaar.

De kosten van een AI-agent bestaan uit vier delen: het bouwen van de agent (ontwerp, koppelingen, tools en tests), de inferencekosten per uitgevoerde taak, de integratie met je bestaande systemen en het doorlopende beheer met monitoring en evaluatie. Het verschil met een chatbot zit vooral in de inference: een agent redeneert, plant, roept tools en andere agents aan en werkt op de achtergrond door. Gartner voorspelde in augustus 2026 dat de inferencekosten per agentic workflow tot 2028 meer dan vervijfvoudigen, terwijl de prijs per token juist met zo'n 95 procent daalt richting 2030. Wie de kosten wil beheersen, richt de agent zo in dat elke stap naar het goedkoopste model gaat dat de taak aankan.

Bekijk cases

Goedkopere tokens, duurdere agents

Veel kostenramingen voor AI-agents rekenen met de prijs per token, en die daalt al jaren hard. Toch stijgt de rekening bij bedrijven die agents in productie hebben. Gartner noemt dat de inference-paradox: elke nieuwe generatie agents zet meer tokens in per taak, vaak op een duurder model, sneller dan de prijs per token omlaag gaat. Wie een AI-agent laat bouwen moet dus niet alleen naar de bouwkosten kijken, maar vooral naar wat een taak straks per keer kost en hoe vaak die taak draait. In dit artikel zetten we de kostenposten op een rij, leggen we uit waarom een agent fundamenteel anders rekent dan een chatbot en laten we zien welke ontwerpkeuzes het verschil maken tussen een beheersbare en een onbegrensde rekening.

Why AI agent kosten with Score Agency?

Vier kostenposten

Bouw, inference, integratie en beheer. Wie alleen de eerste begroot, komt in productie voor verrassingen te staan.

Inference is de variabele

Een agent kost per taak minstens vijf keer zoveel inference als een chatbot, en meer naarmate de taak complexer wordt.

Inference tiering

Route elke stap naar het goedkoopste model dat de taak aankan en blokkeer standaard het zwaarste model voor eenvoudige stappen.

Meten per uitkomst

Koppel uitgaven aan afgeronde taken, dossiers of orders in plaats van aan tokens, zodat je weet wat een agent oplevert.

Lokale modellen als plafond

Voor veelvoorkomende, voorspelbare stappen kan een lokaal model de variabele kosten naar vrijwel nul brengen.

Waarom een agent anders rekent dan een chatbot

Een chatbot beantwoordt één vraag met één antwoord: één aanroep van het model, een voorspelbaar aantal tokens. Een AI-agent doet meer. Hij leest een opdracht, maakt een plan, roept tools aan (een database, een API, een e-mailsysteem), beoordeelt het resultaat, past het plan aan en herhaalt dat tot de taak klaar is. Elke stap is een nieuwe aanroep van het model, en bij elke aanroep gaat de hele context opnieuw mee.

Gartner rekende in augustus 2026 voor dat het routeren van een taak naar een redenerend agentmodel de inferencekosten minstens vijf keer hoger maakt dan een eenvoudige chatbotinteractie, en vaak veel meer naarmate de taak complexer wordt. De voorspelling die daarbij hoort: de inferencekosten per agentic workflow stijgen tot 2028 meer dan vijfvoudig, terwijl de prijs per token richting 2030 met ongeveer 95 procent daalt. Beide zijn tegelijk waar. De markt kijkt naar de dalende tokenprijs en onderschat hoeveel tokens een agent per taak verbruikt.

Voor je begroting betekent dit: de bouwkosten zijn eenmalig en overzichtelijk, maar de inferencekosten schalen mee met het aantal taken en met de complexiteit per taak. Dat is de post die je vooraf moet doorrekenen.

De vier kostenposten van een AI-agent

Een realistische begroting voor agentic AI bevat deze onderdelen:

- Bouw: het ontwerpen van de workflow, het definiëren van de tools die de agent mag gebruiken, de prompts en instructies, de goedkeuringsstappen en het testen tegen echte cases. Dit is een eenmalig project, vergelijkbaar met een maatwerk softwaretraject.
- Inference: wat elke uitgevoerde taak kost aan modelaanroepen. Dit is de variabele post en wordt bepaald door het aantal stappen per taak, de grootte van de context en het gekozen model per stap.
- Integratie: de koppelingen met de systemen waar de agent in werkt, zoals je ERP, CRM of klantportaal. Wat zo een API-koppeling kost hangt af van de kwaliteit van de bestaande API en het aantal systemen.
- Beheer: monitoring, logging, evaluatie van de kwaliteit, het bijwerken van prompts als een model verandert en het periodiek herbeoordelen van welk model welke stap uitvoert.

De verhouding tussen die vier verschuift met de tijd. In het eerste half jaar domineren bouw en integratie. Daarna bepalen inference en beheer de rekening, en dat zijn precies de posten waar in de meeste offertes niets over staat.

Waar de kosten uit de hand lopen

Gartner voorspelde al eerder dat meer dan 40 procent van de agentic AI-projecten voor eind 2027 wordt gestopt, onder meer door oplopende kosten. We schreven daar over in ons artikel over agentic AI trends in 2026. De patronen die we daarbij het vaakst zien:

- Standaard het zwaarste model gebruiken voor elke stap, ook voor het classificeren van een e-mail of het ophalen van een adres
- Agents die elkaar aanroepen zonder plafond, waardoor een eenvoudige taak tientallen modelaanroepen kost
- Een context die bij elke stap groeit omdat alle eerdere output wordt meegestuurd
- Agents die op de achtergrond doorwerken (monitoren, controleren, opnieuw proberen) zonder dat iemand de frequentie heeft vastgesteld
- Geen koppeling tussen uitgaven en uitkomsten, waardoor niemand kan zeggen of een taak van 40 cent of 4 euro nog rendabel is

Gartner waarschuwt dat wie standaard kiest voor generieke autonome intelligentie, kosten krijgt die ordes van grootte hoger liggen dan nodig. De oplossing zit niet in minder agents, maar in bewuster ontwerp.

Inference tiering: het goedkoopste model dat de taak aankan

De belangrijkste aanbeveling van Gartner heet inference tiering: bouw de agent zo dat elke stap wordt gerouteerd naar het meest kostenefficiënte model dat die stap goed kan uitvoeren, en blokkeer standaard dat de agent voor eenvoudige stappen het duurste model inzet. In de praktijk betekent dat een gelaagde opzet:

- Eenvoudige stappen zoals classificeren, extraheren van velden of het opstellen van een standaardbericht gaan naar een klein, snel model of een lokaal model
- Stappen die redeneren vereisen, zoals het beoordelen van een uitzondering of het plannen van een meerstapstaak, gaan naar een middenklasse model
- Alleen stappen waar de kwaliteit echt het verschil maakt gaan naar het zwaarste model, en die stappen zijn vooraf benoemd

Daarbij hoort een orchestratielaag die de routering regelt, de context per stap beperkt tot wat nodig is en een plafond zet op het aantal aanroepen per taak. Gartner adviseert bovendien om nieuwe modelreleases te behandelen als afschrijvingsmomenten: elk half jaar opnieuw beoordelen of een stap naar een goedkoper model kan, omdat de kleinere modellen snel beter worden.

Zo bouwen wij AI-agents ook: met een expliciete modelkeuze per stap, een budget per taak en logging waaruit je per taak kunt aflezen wat hij heeft gekost.

Lokale modellen en de rol van je eigen infrastructuur

Voor stappen die vaak voorkomen en voorspelbaar zijn, is een lokaal draaiend model vaak de goedkoopste laag. De variabele kosten per aanroep zijn dan vrijwel nul; je betaalt voor de hardware en het beheer. Dat maakt de rekening voorspelbaar, wat voor een controller prettiger is dan een tokenfactuur die met het gebruik meebeweegt.

Een lokale opzet heeft nog twee voordelen. Je data verlaat je eigen omgeving niet, wat de compliance eenvoudiger maakt onder de AVG en de AI Act. En je bent minder afhankelijk van de prijswijzigingen van één leverancier. Hoe zo een omgeving eruitziet, laten we zien in onze case over IntraGPT, een lokale AI-oplossing.

De afweging is niet lokaal of cloud, maar welke stap waar draait. Een goed ontworpen agent combineert een lokaal model voor het volumewerk met een cloudmodel voor de stappen waar de kwaliteit van het zwaarste model echt nodig is.

Zo begroot je een AI-agent realistisch

Een offerte voor een AI-agent hoort antwoord te geven op vijf vragen. Ontbreekt er één, vraag er dan naar:

- Wat kost de bouw, inclusief integraties en testen tegen echte cases uit je organisatie
- Wat kost één uitgevoerde taak aan inference, gemeten in een pilot en niet geschat
- Hoeveel taken per maand verwacht je, en wat is dan de maandelijkse inferencepost
- Welke stappen draaien op welk model, en hoe wordt dat periodiek herbeoordeeld
- Hoe wordt gemeten wat de agent oplevert: afgehandelde tickets, verwerkte orders, bespaarde uren

Gartner adviseert om AI-uitgaven altijd te koppelen aan zulke uitkomstmaten en om een agent voor livegang te stresstesten tegen schommelingen in tokenprijzen. Wij doen dat door elke agent eerst een paar weken in schaduwmodus te draaien: hij voert de taak uit, een mens keurt goed, en je ziet precies wat een taak kost en oplevert voordat hij zelfstandig mag werken.

Wil je weten wat een agent voor een concreet proces in jouw organisatie kost, plan dan een kostenverkenning. We brengen het proces in kaart, bepalen welke stappen automatiseerbaar zijn en rekenen de bouw en de inference per taak voor je door. Meer over onze bredere aanpak lees je bij AI-oplossingen.

15+ years as your partner in digital transformation

Score Agency is a full-service digital agency that has been helping businesses with their digital transformation for over 15 years. From our expertise in software development, web design and AI solutions, we build solutions that truly make an impact.

We believe in transparency, quality and long-term partnerships. No hidden costs, no unrealistic promises, just honest advice and solutions that work.

150+
Projects delivered
15+
Years experience

Results-driven

We measure success by your results

All about ai agent kosten

Dat hangt af van vier posten: de bouw (ontwerp, tools, tests), de inference per uitgevoerde taak, de integratie met je systemen en het beheer. De bouw is eenmalig; de inference schaalt mee met het aantal taken en de complexiteit. Een betrouwbare raming komt uit een pilot waarin je de kosten per taak meet.
Omdat een agent per taak veel meer tokens gebruikt dan een chatbot: hij plant, roept tools aan, controleert en herhaalt. Gartner voorspelt dat de inferencekosten per agentic workflow tot 2028 meer dan vijfvoudig stijgen, terwijl de prijs per token richting 2030 met ongeveer 95 procent daalt.
Het routeren van elke stap in een agent naar het goedkoopste model dat die stap goed kan uitvoeren. Eenvoudige stappen gaan naar een klein of lokaal model, alleen de stappen die het echt nodig hebben naar het zwaarste model. Gartner noemt dit de belangrijkste maatregel om agentkosten te beheersen.
Voor veelvoorkomende, voorspelbare stappen meestal wel: de variabele kosten per aanroep zijn vrijwel nul en je betaalt voor hardware en beheer. Voor complexe stappen die de kwaliteit van een groot model vereisen is een cloudmodel vaak beter. De beste opzet combineert beide.
Zet een plafond op het aantal modelaanroepen per taak, beperk de context per stap, kies per stap expliciet een model, log wat elke taak kost en koppel de uitgaven aan uitkomsten zoals afgehandelde tickets of orders. Draai de agent eerst in schaduwmodus om de kosten per taak te meten.
Gartner voorspelt dat meer dan 40 procent van de agentic AI-projecten voor eind 2027 wordt geannuleerd, door onduidelijke businesswaarde, oplopende kosten en zwakke governance. Projecten die wel doorgaan hebben vooraf een duidelijke uitkomstmaat en een begroting per taak.

Ready to get started with AI agent kosten?

Get in touch today and discover how we can help you with AI agent kosten. No obligations, just honest advice.

053-870 0020