Data kwaliteit: waarom je AI-project faalt zonder schone data
80% van de AI-projecten faalt door slechte datakwaliteit. Leer hoe je datakwaliteit meet, verbetert en borgt.
Data kwaliteit bepaalt of je AI-systeem betrouwbare uitkomsten levert of gevaarlijke onzin produceert. Slechte data is de meest voorkomende reden waarom AI-projecten mislukken — niet het model, niet de architectuur, niet het budget. De oplossing is geen technisch wonder: het is een systematisch proces van meten, verbeteren en borgen.
Gartner schat dat organisaties jaarlijks gemiddeld 12,9 miljoen dollar verliezen door slechte datakwaliteit. IBM becijferde in 2022 dat slechte data de Amerikaanse economie 3,1 biljoen dollar per jaar kost. Toch is datakwaliteit in de meeste bedrijven geen structureel programma — het is een brandoefening die begint als een AI-project vastloopt.
Wat is datakwaliteit?
Datakwaliteit is de mate waarin data geschikt is voor het doel waarvoor het gebruikt wordt. Data die goed genoeg is voor een maandrapportage, kan onbruikbaar zijn voor een machine learning model dat op diezelfde data traint. Geschiktheid hangt altijd af van het gebruik.
Dit onderscheid is belangrijk. Er bestaat geen universeel 'schone data'. Een telefoonnummer zonder landcode is bruikbaar voor een salesmedewerker die alleen Nederland belt, maar waardeloos voor een model dat internationaal klantgedrag analyseert. De kwaliteitsnorm volgt het gebruik, niet een abstract ideaal.
In de context van AI-projecten is de lat hoog. Machine learning modellen versterken patronen in je data — inclusief de fouten. Een model dat traint op historische data met een systematische bias leert die bias en past hem op schaal toe. Dat is geen modelprobleem. Dat is een datakwaliteitsprobleem.
De 6 dimensies van datakwaliteit.
Datakwaliteit is geen enkelvoudig begrip. Het bestaat uit zes meetbare dimensies. Elk daarvan kan de oorzaak zijn van een mislukt AI-project.
| Dimensie | Wat het betekent | Voorbeeld van een probleem |
|---|---|---|
| Volledigheid | Zijn alle verwachte velden ingevuld? | 30% van de klantrecords mist een postcode |
| Nauwkeurigheid | Klopt de data met de werkelijkheid? | Omzetcijfers wijken af van het bronsysteem |
| Consistentie | Is de data hetzelfde in alle systemen? | CRM zegt 'klant actief', ERP zegt 'klant inactief' |
| Tijdigheid | Is de data actueel genoeg voor het gebruik? | Voorraaddata heeft een vertraging van 48 uur |
| Uniciteit | Zijn er geen duplicaten? | Dezelfde klant staat in 3 varianten in de database |
| Geldigheid | Voldoet de data aan de verwachte format of domein? | Datumveld bevat tekst zoals 'nvt' of 'onbekend' |
In de praktijk zijn volledigheid en consistentie de meest voorkomende problemen bij AI-projecten. Modellen die trainen op incomplete records leren patronen die niet representatief zijn voor de werkelijkheid. Inconsistentie tussen systemen maakt feature engineering tot een puzzel die nooit helemaal klopt.
Impact op AI-projecten.
Volgens onderzoek van VentureBeat mislukt 87% van de AI-projecten voordat ze productie halen. Datakwaliteit wordt consistent als een van de drie hoofdoorzaken aangewezen, samen met gebrek aan business alignment en tekort aan ML-talent. Maar van de drie is datakwaliteit het meest onderschatte probleem — omdat het pas zichtbaar wordt als het project al ver gevorderd is.
Hoe manifesteert slechte datakwaliteit zich in de praktijk?
- Het model presteert goed op testdata, maar slecht in productie — omdat de testdata schoner is dan de operationele data.
- Het model discrimineert systematisch op een demografisch kenmerk, omdat historische data een bestaande bias weerspiegelt.
- Voorspellingen worden onbetrouwbaar na een paar maanden — omdat de datapijplijn stilzwijgend kwaliteitsproblemen introduceert.
- Data scientists besteden 60-80% van hun tijd aan data cleaning in plaats van aan modellering.
- Het model kan niet worden uitgelegd aan stakeholders, omdat de featurewaarden niet overeenkomen met wat medewerkers herkennen als werkelijkheid.
Het laatste punt is onderschat. Als een medewerker een AI-aanbeveling niet herkent als logisch, vertrouwt hij het model niet. Dat adoptieprobleem begint bij de data, niet bij de interface.
Datakwaliteit meten.
Je kunt datakwaliteit niet verbeteren zonder het te meten. De meeste organisaties weten niet precies hoe slecht hun data is — totdat ze beginnen met een AI-project of een serieuze data audit.
Een praktisch startpunt is een datakwaliteitsaudit per domein. Kies een datadomein dat relevant is voor het geplande AI-project — klantdata, transactiedata, productdata — en meet per dimensie:
| Dimensie | Metriek | Acceptabele drempel (richtlijn) |
|---|---|---|
| Volledigheid | % ingevulde verplichte velden | > 95% |
| Nauwkeurigheid | % records geverifieerd correct via steekproef | > 98% |
| Consistentie | % records gelijk in twee bronsystemen | > 99% |
| Tijdigheid | Gemiddelde vertraging van data-update | < vereiste freshness voor use case |
| Uniciteit | % duplicate records | < 1% |
| Geldigheid | % records die domeinregels overtreden | < 0,5% |
Drempels zijn use case-afhankelijk. Een fraudedetectiemodel stelt hogere eisen aan nauwkeurigheid en tijdigheid dan een segmentatiemodel voor marketingcampagnes. Stel drempels altijd vast in samenspraak met de business eigenaar van het datadomein.
Voor continue monitoring zijn tools als Great Expectations, dbt tests, Monte Carlo of Soda Core gangbaar. Ze stellen je in staat datakwaliteitsregels te definiëren als code en ze automatisch te laten lopen als onderdeel van je datapijplijn.
Verbeterplan in 4 stappen.
Datakwaliteit verbeteren is geen eenmalig project. Het is een programma. Maar je moet ergens beginnen. Dit is de aanpak die wij hanteren bij organisaties die voor het eerst serieus werk maken van datakwaliteit.
- Breng het probleem in kaart. Voer een datakwaliteitsaudit uit op de datadomeinen die het meest kritisch zijn voor je AI-use case. Gebruik de zes dimensies als structuur. Documenteer niet alleen de scores, maar ook de oorzaken: is het een procesprobleem (data wordt niet correct ingevoerd), een systeemprobleem (twee systemen zijn niet gesynchroniseerd) of een definitieprobleem (hetzelfde concept heeft twee verschillende definities)?
- Wijs eigenaarschap toe. Elke datatafel heeft een business eigenaar nodig — iemand die verantwoordelijk is voor de kwaliteit en de bevoegdheid heeft om te sturen op verbetering. Zonder eigenaarschap lost niets zich op. Data governance en datakwaliteit zijn onlosmakelijk verbonden: je kunt geen kwaliteit borgen zonder de governance-structuur die verantwoordelijkheid belegt.
- Herstel de meest impactvolle problemen. Niet alles kan tegelijk. Prioriteer de problemen die de hoogste impact hebben op de geplande AI-use case. Begrijp dat sommige problemen technisch oplosbaar zijn (deduplicatie, standaardisatie van formaten), terwijl andere gedragsverandering vereisen (betere data-invoer aan de bron). Pak ze allebei aan, maar wees realistisch over doorlooptijd.
- Bouw structurele preventie. Herstellen zonder preventie is een bodemloze put. Stel data kwaliteitsregels in als geautomatiseerde checks in je datapijplijn. Implementeer alerts bij drempeloverschrijding. Maak kwaliteitsscores zichtbaar voor data-eigenaren via een eenvoudig dashboard. Bespreek kwaliteitsscores als vaste agendapost in data-overleggen.
Dit programma kost tijd. Afhankelijk van de omvang van je dataproblemen en de volwassenheid van je data-organisatie loop je van weken tot maanden. Maar het alternatief — een AI-project starten op slechte data — kost je meer tijd, meer geld en veel meer geloofwaardigheid.
“Data quality is not a technology problem. It's a process and accountability problem that technology can help enforce.”— Tom Redman, 'Data Driven'
Conclusie.
Data kwaliteit is de onzichtbare succesfactor van elk AI-project. Je kunt het beste model kiezen, de slimste architectuur bouwen en het meest ervaren team samenstellen — als de data niet klopt, klopt het resultaat niet. De organisaties die AI succesvol inzetten, hebben niet alleen geïnvesteerd in algoritmen. Ze hebben geïnvesteerd in de kwaliteit van hun data.
Begin met meten. Weet wat je hebt. Dan pas weet je wat je te verbeteren hebt.