Skip to content
Leitfaden8 min Lesezeit

Adversariale Angriffe auf KI-Dokumentenbetrugserkennung

Adversariale Angriffe täuschen KI-Modelle zur Dokumentenprüfung. Angriffsarten, Pflichten nach der KI-Verordnung und warum mehrschichtige Erkennung standhält.

Das CheckFile-Team
Das CheckFile-Team·
Illustration for Adversariale Angriffe auf KI-Dokumentenbetrugserkennung — Leitfaden

Diesen Artikel zusammenfassen mit

Eine gefälschte Gehaltsabrechnung muss nicht pixelgenau sein, um eine automatisierte Prüfung zu bestehen: Ein sorgfältig kalibriertes Rauschmuster, für das menschliche Auge unsichtbar, kann genügen, damit ein Betrugsklassifikator sein Urteil von "verdächtig" auf "unauffällig" ändert. Das ist keine Spekulation, sondern der dokumentierte Mechanismus hinter adversarialen Beispielen — seit 2013 in der Forschung zum maschinellen Lernen bekannt und inzwischen als konkrete Cybersicherheitslücke benannt, die Anbieter von KI-Hochrisikosystemen nach EU-Recht adressieren müssen.

Dieser Artikel dient ausschließlich Informationszwecken und stellt keine Rechts-, Finanz- oder Regulierungsberatung dar. Regulatorische Verweise sind zum Veröffentlichungsdatum korrekt. Konsultieren Sie für eine auf Ihre Situation zugeschnittene Beratung eine qualifizierte Fachperson.

Ein adversarialer Angriff auf ein Dokumentenprüfsystem manipuliert gezielt ein Bild, eine Datei oder eine Abfolge von API-Anfragen, damit das zugrunde liegende KI-Modell eine falsche Entscheidung trifft — häufig ohne dass die Manipulation bei menschlicher Prüfung derselben Datei erkennbar wäre. Dieser Artikel erklärt die drei dokumentierten Angriffsfamilien gegen Computer-Vision- und Biometriesysteme, was die deutsche KI-Aufsicht und die europäische KI-Verordnung inzwischen von Hochrisikoanbietern verlangen, und warum einschichtige Erkennungsarchitekturen strukturell verwundbar bleiben.

Was ein adversarialer Angriff auf die Dokumentenprüfung tatsächlich ist

Ein adversarialer Angriff nutzt eine mathematische Schwäche aus, die neuronalen Netzen inhärent ist: Eine kleine, gezielte Störung der Eingabe, für Menschen unsichtbar oder kaum wahrnehmbar, kann die Modellausgabe in die vom Angreifer gewünschte Klasse kippen. Die im März 2025 aktualisierte Referenztaxonomie des NIST gliedert Angriffe auf prädiktive KI in drei Kategorien: Evasion-Angriffe zur Inferenzzeit, Poisoning-Angriffe auf Trainingsdaten und Angriffe auf die Modell-Vertraulichkeit, einschließlich Extraktion und Inversion (NIST AI 100-2e2025, Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations, März 2025, nist.gov).

Bereits 2019 zeigte die akademische Forschung, dass ein gedruckter physischer Patch auf oder neben einem Dokument oder Gesicht genügt, um ein produktives Gesichtserkennungssystem (ArcFace) unter realen Bedingungen zu täuschen, ohne dass der Angreifer Zugriff auf das zugrunde liegende Modell braucht (AdvHat, arXiv:1908.08705). Folgestudien fanden, dass sich solche Störungen teilweise zwischen unterschiedlichen Fingerabdruck-Lebenderkennungssystemen übertragen lassen, sodass ein Angreifer das exakte Zielmodell nicht kennen muss, um einen wirksamen Angriff zu konstruieren (Marrone & Sansone, Pattern Recognition Letters, 2021).

Drei Angriffsfamilien im Kontext der Dokumentenbetrugserkennung

Angriffsart Zielzeitpunkt Konkretes Beispiel gegen eine Dokumentenpipeline Wirksam, wenn...
Adversariales Beispiel (Evasion) Inferenz, zum Prüfzeitpunkt Kalibriertes Pixelrauschen auf dem Foto einer manipulierten Gehaltsabrechnung, damit der Echtheitsklassifikator sie als unauffällig bewertet Die Prüfung stützt sich auf ein einzelnes Modell ohne unabhängige Kreuzvalidierung
Poisoning Training oder fortlaufendes Nachtraining Schrittweises Einschleusen falscher "sauberer" Fälle in eine Nutzer-Feedbackschleife, die ein automatisiertes Nachtraining speist Die Nachtrainingspipeline verfolgt die Herkunft eingespeister Daten nicht
Modellextraktion (Model Stealing) Vertraulichkeit des Modells Wiederholte, unauffällig wirkende Anfragen an eine Prüf-API, um deren Verhalten zu rekonstruieren und einen Offline-Angriff zu kalibrieren Die API begrenzt Anfragen nicht und erkennt keine systematischen Abtastmuster

Was Bundesnetzagentur und KI-Verordnung von Hochrisikosystemen verlangen

Seit Inkrafttreten des KI-Durchführungsgesetzes (KI-MIG) am 29. Juli 2026 ist die Bundesnetzagentur die zentrale Marktüberwachungsbehörde für die KI-Verordnung in Deutschland und fungiert seit dem 2. August 2026 als zentrale Anlaufstelle für Beschwerden, soweit keine andere Behörde zuständig ist (Bundesnetzagentur, Marktüberwachung). Für Dokumentenprüfsysteme im KYC- oder Kreditkontext ist diese Zuständigkeit direkt relevant, da sie typischerweise unter Anhang III der Verordnung als Hochrisikosystem fallen.

Artikel 15 der Verordnung (EU) 2024/1689 verlangt von Hochrisiko-KI-Systemen ein angemessenes Maß an Genauigkeit, Robustheit und Cybersicherheit und nennt ausdrücklich "gegnerische Beispiele oder Modellumgehung" (adversariale Beispiele) unter den Schwachstellen, die Anbieter verhindern, erkennen und kontrollieren müssen (EUR-Lex, Verordnung (EU) 2024/1689, Art. 15). Der Zeitplan hat sich jedoch verschoben: die "Digital Omnibus"-Verordnung (EU) 2026/1744 verschob die Pflichten für Hochrisikosysteme nach Anhang III auf den 2. Dezember 2027 und für Anhang I auf den 2. August 2028 — ein längerer Umsetzungszeitraum als ursprünglich vorgesehen (Direction générale des Entreprises / DGCCRF, Pressemitteilung vom 9. September 2025). Eine verschobene Rechtsfrist ist nicht dasselbe wie eine verschobene Bedrohung: Die in diesem Artikel beschriebenen Angriffstechniken sind bereits heute dokumentiert und ausnutzbar, unabhängig davon, wann Artikel 15 gegenüber einem konkreten Anbieter formal durchsetzbar wird.

Neben der formalen Marktüberwachung durch die Bundesnetzagentur veröffentlicht das Bundesamt für Sicherheit in der Informationstechnik (BSI) technische Orientierungshilfen zur Absicherung von KI-Systemen, unter anderem zu Angriffsflächen wie Modellmanipulation und Eingabemanipulation (BSI, Themenseite Künstliche Intelligenz). Für ein Unternehmen, das ein Dokumentenprüfsystem betreibt, bedeutet das in der Praxis zwei getrennte Anlaufstellen: die Bundesnetzagentur für die rechtliche Konformität nach der KI-Verordnung, und das BSI für die technische Methodik, mit der sich Schwachstellen wie adversariale Beispiele überhaupt erst identifizieren lassen.

Was Compliance-Teams auf Fachforen tatsächlich fragen

Diskussionen unter Compliance- und IT-Sicherheitspraktikern kreisen immer wieder um zwei Punkte. Kann eine für das Auge unsichtbare Pixelstörung wirklich ein produktives Modell täuschen und nicht nur einen Laborprototyp? Ja — der physische Patch-Angriff von AdvHat wurde erfolgreich gegen ein tatsächlich produktiv eingesetztes Gesichtserkennungssystem getestet, nicht nur unter Laborbedingungen. Sollte man jedem Anbieter misstrauen, der adversariale Robustheit nicht explizit bewirbt? Nicht allein deswegen, aber das Fehlen jeder mehrschichtigen Architektur — ein einzelnes Modell, eine einzelne Entscheidung, keine unabhängige Gegenprüfung — ist ein deutlich verlässlicheres Warnsignal als eine fehlende Marketingaussage.

Warum mehrschichtige Architektur besser standhält als ein Einzelmodell

Ein adversarialer Angriff ist auf ein bestimmtes Modell für eine bestimmte Aufgabe zugeschnitten; er überträgt sich nicht automatisch auf heterogene Erkennungsschichten, die unterschiedliche Signale analysieren. Pixelrauschen, das kalibriert wurde, um eine gefälschte Gehaltsabrechnung an einem Bildklassifikator vorbeizuschleusen, hat keine Wirkung auf eine EXIF-Metadaten-Konsistenzprüfung, eine strukturelle Schriftart- und Ausrichtungsanalyse oder einen Abgleich deklarierter Beträge mit einem externen Register.

CheckFile analysiert Ihre Unterlagen und meldet Hinweise auf KI-generierte oder manipulierte Inhalte als Ergänzung zu Ihren bestehenden Kontrollen, aufbauend auf Erkennung basierend auf mehrschichtiger Analyse (strukturell, Metadaten, dokumentenübergreifende Konsistenz) statt auf der Ausgabe eines einzelnen Bildklassifikators. Konkret bedeutet das eine zusätzliche Schicht von KI-Generierungssignalen, die je nach Kundenkonfiguration eingesetzt wird, sowie KI-generierte forensische Analyse optional verfügbar, je nach sektoralem Risikoniveau — sodass ein gegen ein Signal wirksamer Angriff noch unabhängige Prüfungen überwinden muss, die nicht dieselbe mathematische Angriffsfläche teilen. CheckFile beansprucht nicht, jeden bekannten oder künftigen adversarialen Angriff zu neutralisieren; es ist eine Schicht unter mehreren, die ein Compliance-Team kombinieren sollte, über mehr als 3.200 Dokumenttypen und 32 Jurisdiktionen hinweg.

Manuelle Prüfung allein erkennt nur 37 % der betrügerischen Dokumente und benötigt im Schnitt 87 Tage, um ein bereits laufendes Schema zu identifizieren — eine Verzögerung, die einem Angreifer reichlich Zeit gibt, einen adversarialen Angriff gegen eine einschichtige Kontrolle zu kalibrieren und zu iterieren (ACFE, 2024 Report to the Nations). Genau diese Lücke ist der Grund, warum für Compliance-Workloads entwickelte KI-Techniken zur Dokumentenbetrugserkennung mehrere Signale kombinieren, statt eines gegen einen iterationsfähigen Angreifer zu isolieren.

Teams, die das größere Bild der Fälschungsherstellung verstehen wollen, finden die zugrunde liegenden Generierungstechniken — GANs, Diffusionsmodelle, LLM-verfasste Texte — im Artikel wie KI gefälschte Dokumente erzeugt, während C2PA und KI-Wasserzeichen stoppen keine gefälschten Dokumente erklärt, warum Provenienzstandards gegen genau diese Bedrohung ebenfalls versagen. Banken-KYC-Teams und Finanzierungs- und Leasinganbieter, die hohe Volumina eingereichter Dokumente verarbeiten, sind gegenüber dieser Art gezielter Umgehung als Erste exponiert.

Für die zugrunde liegende Prüfmethodik insgesamt siehe den vollständigen Leitfaden zur Dokumentenprüfung.

Bereit, Ihre Prüfungen zu automatisieren?

Kostenloses Pilotprojekt mit Ihren eigenen Dokumenten. Ergebnisse in 48h.

Kostenloses Pilotprojekt anfragen

Häufig gestellte Fragen

Kann ein adversarialer Angriff jedes KI-Dokumentenprüfsystem täuschen?

Nicht universell. Ein adversarialer Angriff ist auf ein bestimmtes Modell und eine bestimmte Aufgabe kalibriert und überträgt sich schlecht auf Erkennungsschichten, die andere Signale wie Metadaten, Struktur oder dokumentenübergreifende Konsistenz analysieren. Ein System, das sich auf einen einzelnen Bildklassifikator stützt, ist strukturell verwundbarer als eine mehrschichtige Architektur.

Verlangt die KI-Verordnung schon jetzt Schutz vor solchen Angriffen?

Artikel 15 der Verordnung (EU) 2024/1689 verpflichtet Hochrisiko-KI-Systeme dazu, aber die Digital-Omnibus-Verordnung (EU) 2026/1744 hat die Durchsetzung für Anhang-III-Systeme auf den 2. Dezember 2027 und für Anhang-I-Systeme auf den 2. August 2028 verschoben. Die Rechtspflicht besteht, ihr tatsächliches Durchsetzungsdatum hat sich jedoch verschoben.

Wer beaufsichtigt die Einhaltung der KI-Verordnung in Deutschland?

Die Bundesnetzagentur ist seit dem 2. August 2026 die zentrale Marktüberwachungsbehörde und Anlaufstelle für die KI-Verordnung, soweit keine andere Behörde zuständig ist, koordiniert nach dem KI-Durchführungsgesetz (KI-MIG) die zuständigen Fachbehörden.

Sollte ein Unternehmen bis 2027 warten, um sich gegen adversariale Angriffe zu schützen?

Nein. Der regulatorische Zeitplan setzt eine dokumentierte Compliance-Frist, keine Erlaubnis zu warten: Die in diesem Artikel beschriebenen Angriffstechniken sind bereits heute dokumentiert und ausnutzbar, unabhängig davon, wann Artikel 15 formal durchsetzbar wird.

Beseitigt mehrschichtige Erkennung das Risiko adversarialer Angriffe vollständig?

Nein, keine Kombination von Sicherheitskontrollen beseitigt ein Risiko vollständig. Mehrschichtigkeit verringert die Angriffsfläche, indem sie einen Angreifer zwingt, mehrere unabhängige Signale gleichzeitig zu täuschen statt eines einzelnen Klassifikators, was Kosten und Komplexität eines erfolgreichen Angriffs erheblich erhöht.

Welche Rolle spielt das BSI neben der Bundesnetzagentur?

Die Bundesnetzagentur ist die formale Marktüberwachungsbehörde nach der KI-Verordnung, während das BSI technische Orientierungshilfen zur Absicherung von KI-Systemen bereitstellt, etwa zu Angriffsflächen wie Modell- und Eingabemanipulation. Für Unternehmen sind beide Anlaufstellen relevant: die eine für die rechtliche Konformität, die andere für die technische Umsetzung von Schutzmaßnahmen.

Möchten Sie prüfen, wie Ihre Dokumentenkontrollen diesen Techniken standhalten? Sprechen Sie mit dem CheckFile-Team über eine auf Ihr Risikoprofil zugeschnittene Konfiguration, informieren Sie sich über unseren Sicherheitsansatz oder vergleichen Sie Pläne und Preise. Für einen gezielten Blick auf KI-Generierungssignale zeigt die Seite Deepfake- und KI-Dokumentenerkennung unseren Ansatz als Ergänzung zu Ihren bestehenden Kontrollen.

Bleiben Sie informiert

Erhalten Sie unsere Compliance-Analysen und Praxisleitfäden direkt in Ihr Postfach.

Bereit, Ihre Prüfungen zu automatisieren?

Kostenloses Pilotprojekt mit Ihren eigenen Dokumenten. Ergebnisse in 48h.