Skip to content
KlantverhaalTarievenBeveiligingVergelijkingBlog

Europe

Americas

Oceania

Gids10 min leestijd

Verborgen tekstlaag PDF: hoe fraudeurs OCR-verificatie omzeilen

Hoe de verborgen tekstlaag in een PDF afwijkt van het zichtbare beeld, hoe fraudeurs dit misbruiken en hoe cross-validatie tussen beeld en tekst manipulatie blootlegt.

Het CheckFile-team
Het CheckFile-team·
Illustration for Verborgen tekstlaag PDF: hoe fraudeurs OCR-verificatie omzeilen — Gids

Dit artikel samenvatten met

Een PDF-bestand is zelden één ding. Onder het beeld dat een gebruiker op het scherm ziet, ligt vaak een volledig aparte tekstlaag — een reeks machineleesbare tekens die dient voor zoeken, kopiëren en, cruciaal voor compliance-teams, voor automatische verwerking door documentverificatiesystemen. Wanneer die twee lagen niet meer overeenkomen, ontstaat een blinde vlek die fraudeurs actief exploiteren.

Dit artikel wordt uitsluitend ter informatie verstrekt en vormt geen juridisch, financieel of regelgevend advies. De regelgevende verwijzingen zijn correct op de publicatiedatum.

Op fraude- en fintech-forums duiken met regelmaat vragen op als "kan een PDF er anders uitzien dan wat de tekst zegt" en "waarom accepteert een systeem een loonstrook die er bij nader inzien geknoeid uitziet". Dat wantrouwen is terecht: de architectuur van het PDF-formaat maakt deze discrepantie technisch mogelijk, en niet elke verificatiepijplijn controleert erop.

Wat is de verborgen tekstlaag van een PDF

De tekstlaag van een PDF is een intern, doorzoekbaar gegevensblok dat naast — en onafhankelijk van — de visuele rendering van de pagina bestaat. Wanneer een scanner of OCR-engine een gescand document verwerkt, genereert die niet alleen een afbeelding van de pagina, maar ook een set tekstobjecten met coördinaten die precies over de zichtbare glyphs worden gelegd.

Diezelfde structuur maakt het mogelijk om tekst te selecteren, te kopiëren of te doorzoeken in een PDF die in wezen een foto van een pagina is. Een groot deel van geautomatiseerde documentverwerkingssystemen — inclusief sommige KYC- en onboardingpijplijnen — leest bij voorkeur deze ingebedde tekstlaag in plaats van opnieuw OCR uit te voeren op het gerenderde beeld, simpelweg omdat dat sneller is en als betrouwbaarder wordt beschouwd.

Dat vertrouwen is het zwakke punt. De tekstlaag en de visuele rendering worden door de PDF-specificatie als twee onafhankelijke objecten behandeld: er is geen ingebouwd mechanisme dat garandeert dat ze identiek blijven na bewerking.

Hoe fraudeurs het gat tussen beeld en tekst misbruiken

De kern van de techniek is eenvoudig: verander het zichtbare bedrag, de naam of de datum op de afbeelding, maar laat de onderliggende tekstlaag ongewijzigd — of construeer juist een nieuwe, "schone" tekstlaag over een gemanipuleerd beeld. Een systeem dat alleen de tekstlaag uitleest, ziet de originele of gefabriceerde waarden en keurt goed wat een mens bij het bekijken van het beeld zou afkeuren.

Op de Nederlandse markt zijn loonstroken en bankafschriften de meest voorkomende doelwitten: het brutosalaris, het nettobedrag of de premie-inhoudingen worden aangepast met standaard PDF-editors om een hogere leencapaciteit voor te wenden. Sinds de brede beschikbaarheid van generatieve AI-tools kunnen fraudeurs bovendien volledig fictieve loonstroken produceren die visueel overtuigend ogen, terwijl alleen structurele analyse van het bestand de digitale herkomst verraadt.

Valsheid in geschrifte met een vervalste loonstrook of bankafschrift is in Nederland strafbaar onder artikel 225 van het Wetboek van Strafrecht, vaak in combinatie met artikel 326 Sr (oplichting) wanneer het document dient om een lening of contract te verkrijgen (bron: Meld.nl, Centraal Meldpunt Fraude). De juridische kwalificatie verandert echter niets aan het technische probleem: een pijplijn die alleen de tekstlaag vertrouwt, mist het bewijs dat in het beeld zichtbaar is, en een menselijke reviewer die alleen het beeld bekijkt, ziet nooit wat er in de tekstlaag verborgen zit.

Drie varianten van de techniek komen het meest voor:

Selectieve tekstoverschrijving: de visuele laag wordt gewijzigd met een beeldbewerkingstool, terwijl de originele OCR-tekstlaag intact blijft — een cross-check tussen beide onthult direct de discrepantie.

Tekstlaag-overlay: een nieuwe, gefabriceerde tekstlaag wordt over een ongewijzigd of licht aangepast beeld geplaatst, zodat kopiëren en zoeken andere waarden opleveren dan wat zichtbaar is.

Onbedoelde drift: bij herhaalde bewerkingscycli — scannen, bewerken, opnieuw opslaan — raken beeld en tekst geleidelijk uit sync zonder dat er kwade opzet in het spel is, wat vals-positieve en vals-negatieve signalen kan veroorzaken als een systeem geen onderscheid maakt tussen de twee scenario's.

Waarom dit een reëel, aangetoond risico is en geen theoretisch scenario

De onafhankelijkheid van zichtbare en ingebedde PDF-lagen is geen hypothese — ze heeft al tot geruchtmakende incidenten geleid buiten de fraudecontext. In januari 2019 bleek dat de zwart gemaakte passages in een gerechtelijk PDF-dossier van Paul Manaforts advocaten alleen visueel waren afgedekt: de onderliggende tekstlaag bevatte nog steeds de volledige, niet-geredigeerde tekst, die journalisten via eenvoudig kopiëren en plakken konden herstellen (bron: berichtgeving destijds, o.a. samengevat in latere forensische analyses van PDF-redactiefouten). Dit was geen fraudegeval maar een redactiefout — het illustreert niettemin dat de twee lagen daadwerkelijk kunnen divergeren en dat die divergentie praktische, aantoonbare gevolgen heeft.

Academisch onderzoek bevestigt dat dezelfde structurele eigenschap actief wordt misbruikt tegen geautomatiseerde ingestiepijplijnen. Het onderzoek "PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents" (2025) documenteert detectiemethoden voor verborgen of onzichtbare inhoud in PDF's die specifiek gericht zijn op geautomatiseerde verwerkingssystemen (bron: arXiv:2508.17884). Het open-source project "hidden-text-detector" bouwt hier praktisch op voort en detecteert wit-op-wit tekst, subvisuele lettergroottes, tekst buiten de zichtbare pagina, onzichtbare renderingmodi en verborgen Unicode-tekens in PDF- en DOCX-bestanden (bron: github.com/wppoland/hidden-text-detector).

Deze aanvalsklasse is bovendien formeel erkend in het Amerikaanse octrooirecht: het patent "Content masking attacks against information-based services and defenses thereto" (US11775749) beschrijft precies dit mechanisme — het manipuleren van verborgen of onderliggende inhoudslagen om geautomatiseerde extractie- en verificatiediensten te misleiden (bron: USPTO, US11775749). Er bestaat geen betrouwbaar gepubliceerd percentage over hoe vaak deze specifieke techniek wordt ingezet ten opzichte van andere vervalsingsmethoden — het is een erkende en gedocumenteerde aanvalsvector, geen gemeten trend.

Klaar om uw controles te automatiseren?

Gratis proefproject met uw eigen documenten. Resultaten binnen 48u.

Gratis proefproject aanvragen

Hoe cross-validatie tussen beeld en tekstlaag manipulatie detecteert

De kerntechniek is een diff: extraheer de ingebedde tekstlaag én voer onafhankelijk OCR uit op het gerenderde beeld, vergelijk vervolgens de twee resultaten veld voor veld. Een materiële afwijking tussen wat het bestand intern "zegt" en wat er visueel staat, is een sterk manipulatiesignaal — vooral op velden met financiële of identificerende waarde zoals bedragen, IBAN-nummers, namen en data.

Controlestap Wat het detecteert Typisch waarschuwingssignaal
OCR op gerenderd beeld vs. ingebedde tekstlaag Discrepantie tussen zichtbare en machineleesbare waarden Bedrag in tekstlaag wijkt af van bedrag op de afbeelding
Positionele overlap-analyse Tekstobjecten die niet precies over de bijbehorende glyphs liggen Tekstblok verschoven ten opzichte van de onderliggende afbeelding
Detectie van onzichtbare renderingmodi Tekst met renderingmodus 3 (onzichtbaar) of wit-op-wit Tekst aanwezig maar nooit zichtbaar bedoeld voor de lezer
Font- en coderingsconsistentie Tekstobjecten die niet overeenkomen met het lettertype van de rest van het document Ingevoegde tekst uit een ander bewerkingsproces
Combinatie met metadata- en revisiehistorie Aantal opslagcycli en producer-velden die op naverwerking wijzen Meerdere revisies na de vermeende originele generatiedatum

Geen van deze controles is op zichzelf sluitend. Een meerlaagse analyse die OCR op het gerenderde beeld, extractie van de ingebedde tekstlaag en metadata-consistentie combineert, vormt de kern van een robuuste detectiestrategie tegen zowel handmatige als AI-ondersteunde vervalsing. Voor een uitgebreide behandeling van de metadatakant van dit vraagstuk — aanmaakdatums, producer-velden en revisiegeschiedenis — verwijzen we naar onze gids over PDF-metadatamanipulatie detecteren, die als natuurlijk vervolg op deze cross-validatietechniek dient.

Structurele PDF-analyse — het tellen van incrementele revisies, het inspecteren van objectstromen — vult de tekstlaag-diff aan door te tonen wanneer en hoe vaak een bestand na de originele generatie is opgeslagen. Voor pixelniveau-forensica op de afbeelding zelf, bijvoorbeeld bij vermoedelijke retouches binnen een schijnbaar consistente tekstlaag, biedt Error Level Analysis een complementaire laag van bewijs.

Wat dit betekent voor compliance-teams in Nederland

Een verificatiepijplijn die uitsluitend op de ingebedde tekstlaag vertrouwt, mist per definitie elk visueel manipulatiesignaal — en omgekeerd. Volgens het ACFE 2024 Report to the Nations wordt gemiddeld 37 procent van fraudegevallen opgespoord via interne controles, met een gemiddelde ontdekkingsvertraging van 87 dagen (bron: ACFE 2024 Report to the Nations) — een vertraging die voor een groot deel te wijten is aan detectiemethoden die op één enkele laag van het document vertrouwen in plaats van op cross-validatie tussen lagen.

Voor Nederlandse financiële instellingen die onder toezicht van de AFM of DNB vallen, is een aantoonbaar, gedocumenteerd controleproces relevant bij een eventuele toetsing van de cliëntenonderzoeksprocedures. Een pijplijn die kan aantonen dat zowel de visuele rendering als de ingebedde tekstlaag systematisch worden gecontroleerd, is beter gepositioneerd om aan te tonen dat redelijke stappen zijn genomen om documentfraude te detecteren — ook al is geen enkele techniek sluitend.

Buiten de puur financiële sector groeit ook de dreiging van geavanceerdere, AI-ondersteunde manipulatie die verder gaat dan tekstlaagdrift alleen. Voor organisaties die naast documentfraude ook rekening houden met volledig gesynthetiseerde of gemanipuleerde media, biedt onze pagina over AI-gegenereerde documenten en deepfake-detectie aanvullende signalen — als aanvulling op uw bestaande controles, niet als vervanging ervan.

Praktische stappen om deze aanval te detecteren

Begin met het vergelijken van OCR-output op het gerenderde beeld tegen de ingebedde tekstlaag voor elk veld met financiële of identificerende waarde. Een discrepantie op een bedrag, een IBAN of een naam is voldoende reden om het document naar handmatige review te escaleren, ongeacht hoe overtuigend de rest van het bestand oogt.

Combineer dit met structurele analyse: een legitieme loonstrook of bankafschrift heeft doorgaans één enkele generatie-revisie, terwijl meerdere incrementele wijzigingen — zeker op tekst- of afbeeldingsobjecten — een sterke aanwijzing voor naverwerking vormen. Cross-documentvalidatie, waarbij gegevens uit meerdere ingediende documenten onderling worden vergeleken, vangt bovendien vervalsingen op die binnen een enkel document technisch consistent lijken; onze gids over cross-documentvalidatie voorbij OCR gaat dieper op deze aanpak in.

Voor teams die een volledig overzicht willen van beschikbare forensische tools — van open-source scripts tot commerciële platformen — biedt de vergelijking van documentforensicatools een praktisch startpunt. En voor wie de basis van documentverificatie nog wil opbouwen voordat geavanceerde technieken zoals tekstlaag-cross-validatie worden ingezet, is onze gids documentverificatie het aangewezen vertrekpunt.

CheckFile ondersteunt de extractie en cross-validatie van tekstlagen op meer dan 3.200 documenttypen in 24 OCR-talen, verdeeld over 32 rechtsgebieden, en integreert deze controle met metadata-analyse en cross-documentvalidatie binnen één KYC-verificatieoplossing voor de bancaire sector. Meer over de bredere beveiligingsarchitectuur is te vinden op onze beveiligingspagina, en tarieven staan overzichtelijk op de prijzenpagina.

Veelgestelde vragen

Kan een PDF er anders uitzien dan wat de ingebedde tekst zegt

Ja. De visuele rendering en de ingebedde tekstlaag zijn twee onafhankelijke objecten binnen het PDF-formaat, en niets in de specificatie garandeert dat ze na bewerking identiek blijven. Dit is precies het mechanisme dat deze fraudetechniek mogelijk maakt.

Hoe controleer ik zelf of de tekstlaag van een PDF afwijkt van het beeld

Selecteer en kopieer de tekst uit het document en vergelijk die letterlijk met wat zichtbaar op de pagina staat, vooral bij bedragen en namen. Voor een systematische controle is onafhankelijke OCR op het gerenderde beeld nodig, gecombineerd met extractie van de ingebedde tekst en een automatische diff tussen beide.

Is een afwijkende tekstlaag altijd bewijs van fraude

Niet per se. Herhaalde bewerkingscycli kunnen beeld en tekst onbedoeld laten afdrijven zonder kwade opzet; het is daarom een signaal dat nadere review rechtvaardigt, niet automatisch een bevestiging van fraude.

Welke documenten zijn in Nederland het vaakst doelwit van deze techniek

Loonstroken en bankafschriften zijn de meest voorkomende doelwitten, met name bij leningaanvragen waarbij het bruto- of nettosalaris wordt verhoogd om een grotere leencapaciteit te suggereren. Vervalsing van deze documenten valt in Nederland onder artikel 225 en artikel 326 van het Wetboek van Strafrecht.

Vervangt tekstlaag-cross-validatie andere forensische technieken zoals metadata-analyse

Nee, het is een aanvullende laag binnen een bredere strategie. Metadata-analyse, Error Level Analysis en structurele revisiecontrole detecteren elk andere sporen van manipulatie, en gecombineerd bieden ze een veel hogere detectiedekking dan één enkele techniek.

Blijf op de hoogte

Ontvang onze compliance-analyses en praktische gidsen rechtstreeks in uw inbox.

Klaar om uw controles te automatiseren?

Gratis proefproject met uw eigen documenten. Resultaten binnen 48u.