Skip to content
Guía11 min de lectura

Documentos generados por IA: cómo detectar artefactos visuales

Aprenda a detectar documentos generados por IA a partir de sus artefactos visuales: textura, iluminación, sombras y discrepancias en la zona MRZ o el QR.

El equipo CheckFile
El equipo CheckFile·
Illustration for Documentos generados por IA: cómo detectar artefactos visuales — Guía

Resumir este artículo con

Un documento generado por IA se delata por tres familias de artefactos visuales: una textura de fondo demasiado regular allí donde un papel, un escaneado o una impresión reales muestran un grano irregular; una física de la luz incoherente, con sombras que apuntan en direcciones contradictorias en un mismo documento; y una discrepancia entre lo que el ojo lee en un campo visible y lo codificado en una zona de lectura mecánica (MRZ, código de barras, QR). Ninguno de estos tres signos se percibe en una revisión visual rápida, pero los tres se vuelven detectables en cuanto se sabe dónde buscarlos.

Este artículo se ofrece con fines informativos y no constituye asesoramiento legal ni normativo.

Qué es un artefacto visual de generación IA en un documento

Un documento generado por IA pertenece a una de dos categorías. Los documentos totalmente sintéticos se producen desde cero mediante un modelo generativo —una GAN (Generative Adversarial Network) o un modelo de difusión— entrenado para reproducir la apariencia de un tipo de documento (DNI, justificante de domicilio, nómina, extracto bancario), sin partir jamás de un ejemplar real. Los documentos parcialmente modificados parten de un escaneado auténtico donde algunos campos —nombre, importe, fecha, fotografía— se sustituyen por contenido generado, técnica más difícil de detectar porque conserva los elementos de seguridad reales del resto del documento.

Un artefacto visual, en sentido forense, es una huella que deja el propio proceso de generación, no una manipulación manual posterior. Un modelo de difusión construye una imagen mediante eliminación progresiva de ruido a partir de una señal aleatoria: ese proceso produce texturas cuya distribución de frecuencias difiere de forma medible de la de una fotografía o un escaneado ópticos reales, incluso cuando la imagen parece perfecta a simple vista. Un trabajo académico reciente documenta esta diferencia de firma estadística entre píxeles generados y capturados ópticamente (arXiv, Beyond Natural Images: Rethinking AI-Generated Image Detection in Documents).

La detección de contenidos sintéticos se añade como complemento a los controles estructurales y de metadatos existentes, en forma de capa adicional de señales de generación IA desplegada según la configuración del cliente y el perfil de riesgo sectorial — un enfoque que amplía lo tratado en nuestra guía sobre detección de deepfakes en documentos, centrada en el panorama más amplio de los documentos de identidad sintéticos.

Por qué crece este vector de fraude y a quién apunta

El coste de producir un documento falso convincente ha caído con la generalización de herramientas generativas accesibles al público, mientras que la detección manual sigue siendo estructuralmente lenta. Según el estudio de referencia de la Association of Certified Fraud Examiners, la detección puramente manual solo captura el 37 % de los casos de fraude, con un retraso medio de 87 días entre la comisión del fraude y su descubrimiento (ACFE, Report to the Nations 2024). Ese desfase entre velocidad de producción y velocidad de detección es el punto ciego que explota un documento sintético bien construido.

Los sectores más expuestos tramitan grandes volúmenes de justificantes a distancia, sin contacto físico con quien los aporta: financiación al consumo (nóminas y extractos bancarios falsos para inflar ingresos), seguros (partes de siniestro falseados), alquiler (justificantes de solvencia inventados) y selección de personal (diplomas y referencias falsas). En cada flujo, quien revisa el expediente dispone de segundos para validar un documento que a un modelo generativo le costó producir apenas decenas de segundos.

La Agencia de la Unión Europea para la Ciberseguridad (ENISA) señala en su panorama anual de amenazas el contenido sintético generado por IA como un vector de fraude documental en expansión desde 2024. En España, el propio Banco de España publica advertencias recurrentes sobre fraudes que suplantan su identidad o la de entidades supervisadas en el blog Cliente Bancario, canal oficial de referencia antes de dar por buena una comunicación que invoque su nombre.

Las tres familias de artefactos, explicadas técnicamente

Un análisis forense serio cruza tres categorías de señales, ordenadas aquí de la más estadística a la más estructural.

Textura y ruido estadístico. Un escaneado o una fotografía de un documento auténtico llevan un ruido de sensor y un grano de impresión aleatorios, ligados físicamente al soporte. Un documento producido por un modelo de difusión genera en cambio texturas de fondo —guilloché, trama de seguridad, marca de agua— estadísticamente demasiado regulares: los patrones se repiten con una periodicidad que el ojo no percibe pero que un análisis de frecuencias detecta de inmediato. Algunos modelos recientes sobrecorrigen y añaden ruido artificial uniforme, que no varía según la zona como sí lo haría el grano real de un escáner.

Física de la iluminación y geometría de las sombras. Una fotografía auténtica de un documento apoyado sobre una superficie respeta una única fuente de luz coherente: las sombras de un pliegue, una grapa o un relieve siguen la misma dirección e intensidad. Los modelos generativos aún tienen dificultades para mantener esa coherencia en toda la imagen, sobre todo en zonas en relieve —sellos, hologramas simulados, firmas— donde sombras contradictorias o la ausencia de sombra proyectada delatan la síntesis.

Coherencia entre campo visible y campo codificado. En documentos estructurados —un DNI con zona MRZ, una factura con QR, un certificado con código de barras— la información debe coincidir exactamente entre lo leído visualmente y lo codificado en la zona de lectura mecánica. Un modelo generativo entrenado para reproducir el aspecto visual de un documento rara vez consigue generar una zona MRZ cuyo dígito de control sea matemáticamente válido, o produce una fecha de nacimiento visible que no coincide con la fecha codificada. Es una señal casi imposible de falsificar manualmente sin conocer el algoritmo de control exacto, lo que la convierte en uno de los indicios más difíciles de imitar.

¿Listo para automatizar sus verificaciones?

Piloto gratuito con sus propios documentos. Resultados en 48h.

Solicitar un piloto gratuito

Tabla comparativa: documento auténtico frente a señales de generación IA

Elemento verificable Documento auténtico (escaneado o foto real) Señal de artefacto de generación IA
Textura de fondo Ruido de sensor irregular, ligado al soporte físico Patrones repetitivos con periodicidad medible, o ruido artificial uniforme
Iluminación y sombras Fuente de luz única, sombras coherentes en todo el documento Sombras contradictorias, ausencia de sombra en sellos o relieves
MRZ / código de barras / QR Concordancia estricta entre campo visible y dato codificado, dígito de control válido Discrepancia entre campo visible y dato codificado, dígito de control inválido
Metadatos del archivo Coherentes con el dispositivo de captura o el software de edición declarado Ausentes, genéricos o propios de una herramienta de generación de imagen
Texto fino y micro-impresión Nítido y regular incluso con zoom alto, según la técnica de impresión de origen Deformado o ilegible con zoom alto en los caracteres más pequeños
Coherencia entre documentos del expediente Importes, fechas e identidades coincidentes entre las piezas de un mismo dosier Desviaciones entre el documento sospechoso y el resto del expediente

Un único signo aislado de esta tabla produce demasiados falsos positivos para uso operativo; es el cruce de varias señales independientes lo que hace la detección accionable, principio ya desarrollado en nuestro artículo sobre análisis de nivel de error (ELA) aplicado al fraude documental, técnica complementaria centrada en los artefactos de compresión y no en los de generación.

Lo que preguntan los equipos de compliance en foros especializados

En foros especializados de compliance y prevención del fraude es habitual preguntar si un documento que "parece perfecto" puede seguir siendo un falso generado por IA. La respuesta es sí, y ese es el problema central: la perfección visual aparente ha dejado de ser un indicio tranquilizador, porque un modelo de difusión moderno la produce por defecto.

Otra pregunta recurrente distingue entre un documento retocado con un editor convencional y uno íntegramente generado, y si requieren métodos distintos. Sí los requieren: el retoque deja artefactos de compresión localizados en la zona editada —el terreno propio del análisis ELA—, mientras que la generación íntegra deja artefactos estadísticos repartidos por toda la imagen, del tipo descrito en las tres familias anteriores.

Una tercera cuestión, más operativa, es cómo gestionar esto a gran volumen sin que una persona examine cada documento con lupa. La respuesta pasa por automatizar una primera pasada de detección sobre los documentos entrantes y reservar la revisión humana para los expedientes que esa pasada señala como sospechosos.

Marco regulatorio: Reglamento de IA, Código Penal y prevención del blanqueo

El Reglamento de IA de la Unión Europea (UE) 2024/1689, en vigor desde el 1 de agosto de 2024, regula los sistemas de IA de alto riesgo empleados en el sector financiero —scoring crediticio y, según su uso, ciertos sistemas de detección de fraude documental— y resulta directamente aplicable a España como Estado miembro de la Unión.

En el plano penal, el artículo 392 del Código Penal castiga la falsificación de un documento por un particular con prisión de seis meses a tres años, con independencia de la técnica empleada; el artículo 390 regula la falsedad cometida por autoridad o funcionario público, con penas superiores. Que el documento se haya producido con un modelo generativo en lugar de con un editor de imagen no altera esta calificación: la ley sanciona la alteración de la verdad del documento, no la herramienta usada.

Las entidades sujetas a obligaciones de prevención del blanqueo deben tener presente el papel del SEPBLAC como unidad de inteligencia financiera española, ante quien procede comunicar operaciones sospechosas cuando persista una duda razonable sobre la autenticidad de un documento aportado en un expediente. Cuando ese documento incorpora datos personales, entra también en juego la supervisión de la AEPD sobre su tratamiento.

En este contexto, una plataforma de verificación documental como CheckFile permite a los equipos de compliance señalar indicios de generación por IA como complemento a sus controles existentes, sin sustituir el criterio del analista ni las obligaciones de diligencia debida. Nuestra página de detección de deepfakes y contenido generado por IA detalla esta capa, aplicable tanto a flujos de KYC bancario como a expedientes de financiación y leasing.

Preguntas frecuentes

¿Cómo saber si un documento ha sido generado por IA sin herramientas especializadas?

Busque una textura de fondo demasiado uniforme, sombras incoherentes en sellos o relieves, y texto fino borroso al ampliar la imagen. Estos indicios por sí solos son insuficientes: un uso operativo fiable requiere un análisis forense que cruce textura, metadatos y coherencia entre campos.

¿Un documento generado por IA tiene siempre defectos visibles?

No, y eso hace peligroso este vector: los modelos de difusión recientes producen imágenes muy convincentes. Los artefactos detectables suelen situarse en el plano estadístico —distribución del ruido, validez de la MRZ— más que en un fallo visual evidente.

¿Qué diferencia hay entre un documento retocado y uno íntegramente generado por IA?

Un documento retocado parte de un escaneado auténtico con un campo modificado mediante un editor convencional, dejando artefactos de compresión localizados en esa zona. Uno íntegramente generado nunca existió físicamente y presenta artefactos estadísticos repartidos por toda la imagen.

¿Puede la zona MRZ realmente delatar un documento falso generado por IA?

Sí, es una de las señales más fiables. Un modelo generativo entrenado en la apariencia visual de un documento suele fallar al producir un dígito de control MRZ matemáticamente válido, o genera una incoherencia entre el dato visible y el codificado.

¿Qué riesgo asume una empresa que acepta sin control un documento generado por IA en un expediente de crédito?

Más allá del riesgo de pérdida económica, la entidad se expone a un incumplimiento de sus obligaciones de vigilancia en prevención del blanqueo si la duda documental no derivó en una comunicación al SEPBLAC, con independencia de la responsabilidad penal de quien fabricó el documento.

En complemento de sus controles actuales

Los artefactos visuales de generación IA no sustituyen a las señales tradicionales de fraude documental —metadatos, coherencia entre las piezas de un expediente, verificación en origen—, sino que se suman como una capa adicional, especialmente útil frente a documentos totalmente sintéticos sin rastro de retoque clásico. Para evaluar cómo integrarla en su proceso actual, consulte nuestra página de detección de deepfakes e IA o compare los planes y precios. Para una visión completa de los métodos de verificación documental, consulte nuestra guía de verificación de documentos.

Manténgase informado

Reciba nuestros análisis de cumplimiento y guías prácticas en su correo.

¿Listo para automatizar sus verificaciones?

Piloto gratuito con sus propios documentos. Resultados en 48h.