Home Kennisbank Blog Over Logentic Plan een gesprek
· ~8 min lezen

Datasetkwaliteit OCR: dit bepaalt of je AI-uitvoer betrouwbaar is

Maak de uitvoer van AI betrouwbaar: meet de kwaliteit van je OCR dataset met CER/WER, per veld betrouwbaarheidscores en een handmatig gecontroleerde proefset.

Datasetkwaliteit OCR: dit bepaalt of je AI-uitvoer betrouwbaar is

Dataset kwaliteit OCR draait om twee dingen: hoeveel karakters en velden correct herkend worden, en of die herkenning het downstream proces daadwerkelijk voedt. Meet dit met een combinatie van CER/WER en een 4-level kwaliteitsscore per pagina, aangevuld met per-veld confidence scores. De eerste concrete stap is altijd hetzelfde: leg een representatieve ground-truth proefset aan, handmatig gecontroleerd, voordat je een OCR-engine of AI-agent op productievolumes loslaat.


Kort samengevat:

  • Een hoge PCB-kwaliteit vereist niet alleen een goede OCR-engine, maar vooral ook optimale beeldkwaliteit en representativiteit van de dataset.
  • Het gebruik van CER en WER is niet voldoende; menselijke 4-level score en veldconfidence scores zijn essentieel om bruikbare resultaten te bepalen.
  • Extrinsieke evaluatie binnen de werkelijke processen, zoals veldextractie, biedt meer inzicht dan enkel statistieken over tekstnauwkeurigheid.
  • Monitor confidence scores en definieer acceptatiedrempels om met human-in-the-loop controle de kwaliteit en betrouwbaarheid in logistieke workflows te vergroten.

Logentic
Maak documentverwerking betrouwbaarder
Logentic leest logistieke e-mails, haalt relevante gegevens eruit en voert ze automatisch in je bestaande TMS in.
Ontdek Logentic

Inhoudsopgave

Wat maakt een OCR-dataset van hoge kwaliteit?

Beeldkwaliteit bepaalt meer dan de keuze van OCR-engine. Praktijkprojecten bij archieven laten zien dat DPI, belichting en documenthandling vaker de doorslag geven dan het onderliggende model, precies omdat een OCR-systeem niet kan herstellen wat de scan al heeft verloren, zoals 2dA illustreert met voorbeelden uit archiefdigitalisering.

Een goede dataset is bovendien representatief: hij bevat de documenttypes, talen en lay-outs die je in productie tegenkomt, niet alleen de nette scans uit een testomgeving. Metadata en annotatieniveau maken het verschil tussen een dataset die alleen “leesbaar” is en een dataset die operationeel bruikbaar is.

Bouwstenen die je in elke evaluatie moet meenemen:

Vrachtbrieven en CMR-documenten vragen extra aandacht omdat kritieke velden, zoals gewicht, referentienummer en geadresseerde, vaak in kleine lettertypes of handgeschreven vakjes staan. Een algemene CER-score verbergt dan precies de fouten die het meeste kosten.

Metrieken en scoringsmodellen voor OCR-kwaliteit

Character Error Rate (CER) en Word Error Rate (WER) blijven de basismaatstaven, maar ze hebben een blinde vlek: een score van 98% karakteraccuratesse zegt niets over of het factuurnummer correct is uitgelezen. Een dataset kan hoog scoren op CER en toch onbruikbaar zijn voor een concreet veld.

Het OCR-Quality-dataset van Hugging Face werkt daarom met een menselijk geannoteerde 4-level score op rond 1.000 pagina’s geannoteerd met kwaliteitsscores Excellent, Good, Fair en Poor. De verdeling in die set toont een substantieel aandeel matige kwaliteit. Dit laat zien dat zelfs een zorgvuldig samengestelde benchmark een substantieel aandeel matige kwaliteit bevat.

Score Betekenis Actie
Excellent Vrijwel foutloos, direct bruikbaar Automatisch accepteren
Good Kleine afwijkingen, geen impact op kernvelden Accepteren met steekproefcontrole
Fair Zichtbare fouten in secundaire tekst Menselijke review aanraden
Poor Fouten in kritieke velden of onleesbare passages Verplichte handmatige correctie

Koppel per-veld confidence scores aan deze schaal: een veld onder een vastgestelde drempel, bijvoorbeeld 90% zekerheid op een factuurbedrag, triggert automatisch een menselijke controle voordat data het TMS bereikt.

Ground-truth maken en annotatiepraktijk

Karakterannotatie en veldannotatie zijn twee verschillende disciplines. Karakterannotatie meet of losse tekens correct herkend zijn; veldannotatie meet of een specifiek bedrijfskritisch gegeven, zoals een MRN-nummer of laadgewicht, correct uit de tekst is geëxtraheerd. Voor operationele betrouwbaarheid telt vooral het laatste.

Voorbeeld van karakter- en veldannotatie

Professionele archiefprojecten werken daarbij vaak met 2.000 of meer handmatig gecorrigeerde pagina’s als benchmarkset, precies omdat kleinere steekproeven te veel ruis geven om een engine eerlijk te beoordelen.

Praktische aandachtspunten bij het opbouwen van zo’n set:

Pro-tip: Begin met enkele honderden pagina’s uit je eigen meest voorkomende documenttype voordat je opschaalt naar grotere aantallen. Zo ontdek je annotatiefouten in je eigen richtlijnen vroeg, in plaats van ze te vermenigvuldigen over een hele benchmarkset.

Extrinsieke evaluatie: toetsen op downstream taken

Een dataset die goed scoort op CER kan alsnog falen zodra hij een echt proces moet voeden. Het KB-onderzoeksproject “Is your OCR good enough?” pleit daarom voor extrinsieke evaluatie: beoordeel OCR-kwaliteit op het effect binnen downstream taken zoals classificatie, clustering en veldextractie, niet alleen op een gemiddelde score.

In de praktijk werkt dat als volgt:

  1. Definieer de downstream taak concreet: veldextractie voor een TMS, classificatie van documenttype, of automatische invoer in een boekingsproces.
  2. Gebruik binaire acceptatiedrempels: markeer scores 1 en 2 als acceptabel en scores 3 en 4 als onacceptabel, en meet vervolgens precision en recall op de kritieke velden zoals de OCR-Quality paper voorstelt.
  3. Pas ranking-evaluatie toe met maatstaven zoals NDCG om te bepalen welke documenten voorrang krijgen bij handmatige rework.
  4. Test op echte fouttypes: een verwisseld cijfer in een factuurbedrag of een verkeerd gelezen HS-code heeft in een douaneproces een heel andere impact dan een typefout in een adresregel.

Bij factuur- en douaneverwerking is dit onderscheid geen theoretische nuance. Een fout op het factuurnummer breekt de koppeling met een bestaande zending in het transportmanagementsysteem, terwijl dezelfde foutmarge in een vrije-tekstveld vaak zonder gevolgen blijft.

Voorbewerking en opnamepraktijken die datasetkwaliteit verbeteren

Kwaliteit begint bij de scan, niet bij het model. Een dataset opgebouwd uit slecht gefotografeerde documenten blijft zwak, hoeveel preprocessing je er ook op toepast.

Deze stappen verhogen niet alleen de ruwe OCR-score, maar ook de stabiliteit van veldextractie op vrachtbrieven en CMR-documenten, waar een klein verschil in scanresolutie kan bepalen of een handgeschreven referentienummer wel of niet leesbaar is.

Praktische checklist en voorbeeldprotocol voor dataset-evaluatie

Een herhaalbaar protocol voorkomt dat datasetkwaliteit een eenmalige exercitie blijft. De kern bestaat uit vijf stappen die je periodiek herhaalt:

  1. Steekproef: trek een representatieve set pagina’s uit recente productiedata, niet uit een oude testset.
  2. Annotatie: laat karakter- en veldlabels apart annoteren, met een tweede controle op een subset.
  3. Metriek: bereken CER/WER én de 4-level kwaliteitsscore per pagina.
  4. Downstream test: meet precision en recall op de kritieke velden binnen het echte proces.
  5. Beslisregels: stel drempels vast waarboven data automatisch wordt geaccepteerd en waaronder een mens moet ingrijpen.

Log confidence scores structureel en gebruik ze om human-in-the-loop momenten te bepalen. Een dalende trend in confidence op een specifiek veldtype is vaak een vroege waarschuwing dat een nieuw documentformaat is binnengekomen.

Pro-tip: Draai dit protocol elk kwartaal opnieuw op een verse steekproef. Documenttypes en lay-outs veranderen sneller dan de meeste teams beseffen, en een benchmark van vorig jaar zegt weinig over de scans van vandaag.

Perspectief: implementatie-ervaring uit logistieke projecten

Wat bij logistieke documentverwerking steeds terugkomt: een hoge gemiddelde CER stelt teams gerust, maar zegt weinig over het bedrag op regel drie of het referentienummer in de kop. Veldnauwkeurigheid verdient voorrang boven een mooi gemiddelde. Zonder monitoring en heldere acceptatiecriteria glijdt datasetkwaliteit ongemerkt terug, en zonder human-in-the-loop routing merk je dat te laat.

— Bogdan

Logentic als praktische keuze voor logistieke documentworkflows

De beschreven quality-gates zijn bedoeld om OCR-uitvoer te valideren: een AI-agent leest boekingsmails en documenten zoals B/L, CMR, Air Waybill en facturen, valideert de geëxtraheerde velden en routeert twijfelgevallen naar een medewerker in plaats van ze blind door te zetten.

Logentic

Veel teams moeten zelf een ground-truth set en scoremodel opbouwen voordat ze OCR-uitvoer durven te vertrouwen. Confidence scores en menselijke controle kunnen ingebouwd worden in het proces, zonder dat daarvoor het bestaande TMS vervangen hoeft te worden. Voor vrachtbrieven en B/L-documenten betekent dit minder handmatige controle achteraf en sneller correcte invoer in systemen zoals CargoWise, Softpak, Descartes of Boltrics, zoals beschreven op de pagina over CMR-automatisering en B/L-verwerking. Voor teams die ook douaneaangiftes voorbereiden, sluit de voorbereiding van douanedocumenten op dezelfde manier aan op HS-code classificatie en audit-trail. Vraag de brochure aan of plan een intake om te bekijken hoe dit voor jouw documentstroom werkt.

Belangrijke datasets en papers om direct te raadplegen

Voor benchmarking is het OCR-Quality-dataset een directe startpunt met 1.000 menselijk gescoorde pagina’s. De KB ground-truthsets leveren archiefschaal referentiedata. Voor methodologie, inclusief evaluatieprotocollen en ranking-metrieken, raadpleeg de onderliggende arXiv-paper.

Bronnen

Veelgestelde vragen

Wat is OCR?

OCR (optical character recognition) is de technologie die gedrukte of geschreven tekst in een gescand document omzet naar digitale, doorzoekbare tekst.

Wat betekent dataset kwaliteit OCR precies?

Het gaat om de combinatie van karakteraccuratesse (CER/WER), een menselijke kwaliteitsscore per pagina en de vraag of de herkende data een downstream proces, zoals veldextractie in een TMS, daadwerkelijk correct voedt.

Hoeveel pagina’s heb ik minimaal nodig voor een betrouwbare ground-truth set?

Begin met enkele honderden pagina’s uit je eigen documentstroom om annotatierichtlijnen te testen; professionele benchmarksets bij archiefprojecten gebruiken vaak 2.000 of meer handmatig gecorrigeerde pagina’s.

Wat is het verschil tussen CER en het 4-level scoremodel?

CER meet het percentage foute karakters op tekstniveau, terwijl het 4-level scoremodel (Excellent, Good, Fair, Poor) een menselijk oordeel geeft over de praktische bruikbaarheid van een hele pagina, inclusief lay-out en leesbaarheid van kritieke velden.

Kan een AI-agent OCR-kwaliteit zelf bewaken?

Sommige AI-oplossingen combineren AI-extractie met per-veld confidence scores en sturen twijfelgevallen automatisch naar een medewerker, wat de kans op onopgemerkte fouten in logistieke documenten verkleint.

Aanbevelingen

Wil je zien hoe Logentic dit werk automatiseert?

Plan een gesprek →

← Alle artikelen