Datasetkwaliteit OCR: dit bepaalt of je AI-uitvoer betrouwbaar is
Maak de uitvoer van AI betrouwbaar: meet de kwaliteit van je OCR dataset met CER/WER, per veld betrouwbaarheidscores en een handmatig gecontroleerde proefset.
Dataset kwaliteit OCR draait om twee dingen: hoeveel karakters en velden correct herkend worden, en of die herkenning het downstream proces daadwerkelijk voedt. Meet dit met een combinatie van CER/WER en een 4-level kwaliteitsscore per pagina, aangevuld met per-veld confidence scores. De eerste concrete stap is altijd hetzelfde: leg een representatieve ground-truth proefset aan, handmatig gecontroleerd, voordat je een OCR-engine of AI-agent op productievolumes loslaat.
Kort samengevat:
- Een hoge PCB-kwaliteit vereist niet alleen een goede OCR-engine, maar vooral ook optimale beeldkwaliteit en representativiteit van de dataset.
- Het gebruik van CER en WER is niet voldoende; menselijke 4-level score en veldconfidence scores zijn essentieel om bruikbare resultaten te bepalen.
- Extrinsieke evaluatie binnen de werkelijke processen, zoals veldextractie, biedt meer inzicht dan enkel statistieken over tekstnauwkeurigheid.
- Monitor confidence scores en definieer acceptatiedrempels om met human-in-the-loop controle de kwaliteit en betrouwbaarheid in logistieke workflows te vergroten.
Inhoudsopgave
- Wat maakt een OCR-dataset van hoge kwaliteit?
- Metrieken en scoringsmodellen voor OCR-kwaliteit
- Ground-truth maken en annotatiepraktijk
- Extrinsieke evaluatie: toetsen op downstream taken
- Voorbewerking en opnamepraktijken die datasetkwaliteit verbeteren
- Praktische checklist en voorbeeldprotocol voor dataset-evaluatie
- Perspectief: implementatie-ervaring uit logistieke projecten
- Logentic als praktische keuze voor logistieke documentworkflows
- Belangrijke datasets en papers om direct te raadplegen
- Bronnen
- Veelgestelde vragen
Wat maakt een OCR-dataset van hoge kwaliteit?
Beeldkwaliteit bepaalt meer dan de keuze van OCR-engine. Praktijkprojecten bij archieven laten zien dat DPI, belichting en documenthandling vaker de doorslag geven dan het onderliggende model, precies omdat een OCR-systeem niet kan herstellen wat de scan al heeft verloren, zoals 2dA illustreert met voorbeelden uit archiefdigitalisering.
Een goede dataset is bovendien representatief: hij bevat de documenttypes, talen en lay-outs die je in productie tegenkomt, niet alleen de nette scans uit een testomgeving. Metadata en annotatieniveau maken het verschil tussen een dataset die alleen “leesbaar” is en een dataset die operationeel bruikbaar is.
Bouwstenen die je in elke evaluatie moet meenemen:
- Beeldkwaliteit: DPI, belichting, compressieartefacten en scheefheid van de scan.
- Representativiteit: mix van documenttypes, talen, handschrift en gedrukte tekst.
- Annotatieniveau: onderscheid tussen karakterlabels en veldlabels.
- Domeinspecifieke ruis: stempels, watermerken en handgeschreven aanvullingen op formulieren.
Vrachtbrieven en CMR-documenten vragen extra aandacht omdat kritieke velden, zoals gewicht, referentienummer en geadresseerde, vaak in kleine lettertypes of handgeschreven vakjes staan. Een algemene CER-score verbergt dan precies de fouten die het meeste kosten.
Metrieken en scoringsmodellen voor OCR-kwaliteit
Character Error Rate (CER) en Word Error Rate (WER) blijven de basismaatstaven, maar ze hebben een blinde vlek: een score van 98% karakteraccuratesse zegt niets over of het factuurnummer correct is uitgelezen. Een dataset kan hoog scoren op CER en toch onbruikbaar zijn voor een concreet veld.
Het OCR-Quality-dataset van Hugging Face werkt daarom met een menselijk geannoteerde 4-level score op rond 1.000 pagina’s geannoteerd met kwaliteitsscores Excellent, Good, Fair en Poor. De verdeling in die set toont een substantieel aandeel matige kwaliteit. Dit laat zien dat zelfs een zorgvuldig samengestelde benchmark een substantieel aandeel matige kwaliteit bevat.
| Score | Betekenis | Actie |
|---|---|---|
| Excellent | Vrijwel foutloos, direct bruikbaar | Automatisch accepteren |
| Good | Kleine afwijkingen, geen impact op kernvelden | Accepteren met steekproefcontrole |
| Fair | Zichtbare fouten in secundaire tekst | Menselijke review aanraden |
| Poor | Fouten in kritieke velden of onleesbare passages | Verplichte handmatige correctie |
Koppel per-veld confidence scores aan deze schaal: een veld onder een vastgestelde drempel, bijvoorbeeld 90% zekerheid op een factuurbedrag, triggert automatisch een menselijke controle voordat data het TMS bereikt.
Ground-truth maken en annotatiepraktijk
Karakterannotatie en veldannotatie zijn twee verschillende disciplines. Karakterannotatie meet of losse tekens correct herkend zijn; veldannotatie meet of een specifiek bedrijfskritisch gegeven, zoals een MRN-nummer of laadgewicht, correct uit de tekst is geëxtraheerd. Voor operationele betrouwbaarheid telt vooral het laatste.

Professionele archiefprojecten werken daarbij vaak met 2.000 of meer handmatig gecorrigeerde pagina’s als benchmarkset, precies omdat kleinere steekproeven te veel ruis geven om een engine eerlijk te beoordelen.
Praktische aandachtspunten bij het opbouwen van zo’n set:
- Schrijf heldere annotatie-instructies per velddefinitie, niet alleen per tekenset.
- Laat een deel van de pagina’s door twee annotatoren onafhankelijk controleren (inter-annotator check).
- Sla data op in een gestructureerd formaat zoals Parquet met ingebedde beelddata, zodat metadata en scan gekoppeld blijven.
- Documenteer per pagina de brondocumentcategorie, zodat je later per documenttype kunt filteren.
Pro-tip: Begin met enkele honderden pagina’s uit je eigen meest voorkomende documenttype voordat je opschaalt naar grotere aantallen. Zo ontdek je annotatiefouten in je eigen richtlijnen vroeg, in plaats van ze te vermenigvuldigen over een hele benchmarkset.
Extrinsieke evaluatie: toetsen op downstream taken
Een dataset die goed scoort op CER kan alsnog falen zodra hij een echt proces moet voeden. Het KB-onderzoeksproject “Is your OCR good enough?” pleit daarom voor extrinsieke evaluatie: beoordeel OCR-kwaliteit op het effect binnen downstream taken zoals classificatie, clustering en veldextractie, niet alleen op een gemiddelde score.
In de praktijk werkt dat als volgt:
- Definieer de downstream taak concreet: veldextractie voor een TMS, classificatie van documenttype, of automatische invoer in een boekingsproces.
- Gebruik binaire acceptatiedrempels: markeer scores 1 en 2 als acceptabel en scores 3 en 4 als onacceptabel, en meet vervolgens precision en recall op de kritieke velden zoals de OCR-Quality paper voorstelt.
- Pas ranking-evaluatie toe met maatstaven zoals NDCG om te bepalen welke documenten voorrang krijgen bij handmatige rework.
- Test op echte fouttypes: een verwisseld cijfer in een factuurbedrag of een verkeerd gelezen HS-code heeft in een douaneproces een heel andere impact dan een typefout in een adresregel.
Bij factuur- en douaneverwerking is dit onderscheid geen theoretische nuance. Een fout op het factuurnummer breekt de koppeling met een bestaande zending in het transportmanagementsysteem, terwijl dezelfde foutmarge in een vrije-tekstveld vaak zonder gevolgen blijft.
Voorbewerking en opnamepraktijken die datasetkwaliteit verbeteren
Kwaliteit begint bij de scan, niet bij het model. Een dataset opgebouwd uit slecht gefotografeerde documenten blijft zwak, hoeveel preprocessing je er ook op toepast.
- Scan op minimaal 300 DPI en bewaar in een lossless formaat zoals TIFF of PNG voor de ground-truth set.
- Vermijd tegenlicht en schaduw bij het fotograferen van documenten met een smartphone in het veld.
- Pas deskewing toe op scheve scans voordat je de tekst laat herkennen, dit voorkomt systematische leesfouten aan regeluiteinden.
- Verbeter contrast en verwijder ruis (denoise) bij documenten met stempels, vlekken of doorschijnende inkt.
- Normaliseer de lay-out per documenttype, zodat schema-gebaseerde extractie een vaste structuur kan verwachten in plaats van elke keer opnieuw te moeten “raden” waar een veld staat.
Deze stappen verhogen niet alleen de ruwe OCR-score, maar ook de stabiliteit van veldextractie op vrachtbrieven en CMR-documenten, waar een klein verschil in scanresolutie kan bepalen of een handgeschreven referentienummer wel of niet leesbaar is.
Praktische checklist en voorbeeldprotocol voor dataset-evaluatie
Een herhaalbaar protocol voorkomt dat datasetkwaliteit een eenmalige exercitie blijft. De kern bestaat uit vijf stappen die je periodiek herhaalt:
- Steekproef: trek een representatieve set pagina’s uit recente productiedata, niet uit een oude testset.
- Annotatie: laat karakter- en veldlabels apart annoteren, met een tweede controle op een subset.
- Metriek: bereken CER/WER én de 4-level kwaliteitsscore per pagina.
- Downstream test: meet precision en recall op de kritieke velden binnen het echte proces.
- Beslisregels: stel drempels vast waarboven data automatisch wordt geaccepteerd en waaronder een mens moet ingrijpen.
Log confidence scores structureel en gebruik ze om human-in-the-loop momenten te bepalen. Een dalende trend in confidence op een specifiek veldtype is vaak een vroege waarschuwing dat een nieuw documentformaat is binnengekomen.
Pro-tip: Draai dit protocol elk kwartaal opnieuw op een verse steekproef. Documenttypes en lay-outs veranderen sneller dan de meeste teams beseffen, en een benchmark van vorig jaar zegt weinig over de scans van vandaag.
Perspectief: implementatie-ervaring uit logistieke projecten
Wat bij logistieke documentverwerking steeds terugkomt: een hoge gemiddelde CER stelt teams gerust, maar zegt weinig over het bedrag op regel drie of het referentienummer in de kop. Veldnauwkeurigheid verdient voorrang boven een mooi gemiddelde. Zonder monitoring en heldere acceptatiecriteria glijdt datasetkwaliteit ongemerkt terug, en zonder human-in-the-loop routing merk je dat te laat.
— Bogdan
Logentic als praktische keuze voor logistieke documentworkflows
De beschreven quality-gates zijn bedoeld om OCR-uitvoer te valideren: een AI-agent leest boekingsmails en documenten zoals B/L, CMR, Air Waybill en facturen, valideert de geëxtraheerde velden en routeert twijfelgevallen naar een medewerker in plaats van ze blind door te zetten.

Veel teams moeten zelf een ground-truth set en scoremodel opbouwen voordat ze OCR-uitvoer durven te vertrouwen. Confidence scores en menselijke controle kunnen ingebouwd worden in het proces, zonder dat daarvoor het bestaande TMS vervangen hoeft te worden. Voor vrachtbrieven en B/L-documenten betekent dit minder handmatige controle achteraf en sneller correcte invoer in systemen zoals CargoWise, Softpak, Descartes of Boltrics, zoals beschreven op de pagina over CMR-automatisering en B/L-verwerking. Voor teams die ook douaneaangiftes voorbereiden, sluit de voorbereiding van douanedocumenten op dezelfde manier aan op HS-code classificatie en audit-trail. Vraag de brochure aan of plan een intake om te bekijken hoe dit voor jouw documentstroom werkt.
Belangrijke datasets en papers om direct te raadplegen
Voor benchmarking is het OCR-Quality-dataset een directe startpunt met 1.000 menselijk gescoorde pagina’s. De KB ground-truthsets leveren archiefschaal referentiedata. Voor methodologie, inclusief evaluatieprotocollen en ranking-metrieken, raadpleeg de onderliggende arXiv-paper.
Bronnen
- KB: dataset / ground-truth voor historische kranten OCR
- OCR-Quality: A Human-Annotated Dataset for OCR Quality Assessment (arXiv)
Veelgestelde vragen
Wat is OCR?
OCR (optical character recognition) is de technologie die gedrukte of geschreven tekst in een gescand document omzet naar digitale, doorzoekbare tekst.
Wat betekent dataset kwaliteit OCR precies?
Het gaat om de combinatie van karakteraccuratesse (CER/WER), een menselijke kwaliteitsscore per pagina en de vraag of de herkende data een downstream proces, zoals veldextractie in een TMS, daadwerkelijk correct voedt.
Hoeveel pagina’s heb ik minimaal nodig voor een betrouwbare ground-truth set?
Begin met enkele honderden pagina’s uit je eigen documentstroom om annotatierichtlijnen te testen; professionele benchmarksets bij archiefprojecten gebruiken vaak 2.000 of meer handmatig gecorrigeerde pagina’s.
Wat is het verschil tussen CER en het 4-level scoremodel?
CER meet het percentage foute karakters op tekstniveau, terwijl het 4-level scoremodel (Excellent, Good, Fair, Poor) een menselijk oordeel geeft over de praktische bruikbaarheid van een hele pagina, inclusief lay-out en leesbaarheid van kritieke velden.
Kan een AI-agent OCR-kwaliteit zelf bewaken?
Sommige AI-oplossingen combineren AI-extractie met per-veld confidence scores en sturen twijfelgevallen automatisch naar een medewerker, wat de kans op onopgemerkte fouten in logistieke documenten verkleint.
Aanbevelingen
Wil je zien hoe Logentic dit werk automatiseert?
Plan een gesprek →