Waarom niemand precies weet wat een AI-systeem kan, en waarom dat sinds dit jaar een bedrijfsrisico is. Van 445 onderzochte benchmarkartikelen rapporteert 16% een onzekerheidsmarge bij het cijfer, en de Europese wetgever stelde de regels voor hoogrisico-AI uit tot december 2027 omdat niemand op tijd had opgeschreven hoe je conformiteit meet.
Veelgestelde vragen
Waarom is het zo moeilijk om te meten wat een AI-systeem echt kan?+
Omdat de maatstaf zelf beweegt. De best gedocumenteerde maat toont dat de lengte van taken die een model aankan sinds 2024 ongeveer elke drie maanden verdubbelt — maar toen de organisatie achter die maat in januari 2026 haar takenreeks en testomgeving verving, verschoven de scores van dezelfde modellen met 57% naar beneden en 55% naar boven. Wat u meet, hangt dus sterk af van hóé u meet.
Wat betekent het dat AI-benchmarks instabiel zijn?+
Dat een cijfer op een ranglijst geen vast eigenschap van het model is, maar mee verschuift met de gekozen testset. Van 445 onderzochte benchmarkartikelen rapporteert slechts 16% enige onzekerheidsmarge bij het gepubliceerde cijfer. Een score zonder foutmarge oogt exact, maar zegt weinig over wat het model in uw context doet.
Waarom is het meten van AI-prestaties een bedrijfsrisico geworden?+
Omdat elk cijfer uiteindelijk een beslissing stuurt: een investering, een aanwerving, een contractclausule of een aanbesteding. Als dat cijfer niet stabiel is, staat de beslissing op los zand. De enige gerandomiseerde veldproef met echte ontwikkelaars vond zelfs een vertraging van 19% waar men tijdwinst verwachtte — het gemeten effect week af van het aangenomen effect.
Wat verandert de EU AI Act aan de conformiteit van hoogrisico-AI, en waarom is die uitgesteld?+
De hoogrisicoverplichtingen vereisen dat een systeem aantoonbaar aan meetbare criteria voldoet. De Europese wetgever liep tegen dezelfde muur als de sector — niemand had op tijd vastgelegd hoe je die conformiteit meet — en stelde de regels voor hoogrisico-AI uit tot december 2027.
Hoe kan een bedrijf de capaciteiten van een AI-systeem betrouwbaar beoordelen voor een aankoop?+
Door niet op één ranglijstcijfer te vertrouwen, maar te testen op uw eigen taken, in uw eigen omgeving, met een expliciete onzekerheidsmarge. Vraag naar de testomstandigheden achter elk cijfer, en behandel een score zonder foutmarge met wantrouwen. De vraag is niet of AI werkt, maar of ú kunt vaststellen dat ze werkt voor uw geval.