Capa de texto oculta en PDF: la brecha que explota el fraude
Cómo los defraudadores usan la capa de texto oculta de un PDF, distinta de la imagen visible, para engañar al OCR y evadir la verificación documental.

Resumir este artículo con
Un PDF no es una fotografía. Bajo la imagen que un humano ve al abrirlo, casi siempre existe una segunda capa: el texto embebido, invisible en pantalla pero legible por cualquier motor de búsqueda, por la función copiar-pegar y, sobre todo, por los pipelines automáticos de verificación documental. Cuando esa capa oculta no coincide con lo que muestra la imagen, un sistema que confía ciegamente en el texto embebido puede aprobar datos que un vistazo humano habría descartado al instante.
Este artículo se proporciona únicamente con fines informativos y no constituye asesoramiento legal, financiero ni regulatorio. Las referencias normativas son exactas en la fecha de publicación.
Qué es la capa de texto oculta de un PDF y por qué los sistemas confían en ella
Todo PDF generado o procesado por OCR puede almacenar dos representaciones independientes del mismo contenido: el renderizado visible (los píxeles o glifos que aparecen en pantalla) y una capa de texto Unicode incrustada en la estructura interna del fichero. Esa segunda capa existe para que el documento sea buscable, seleccionable y copiable, pero en la práctica se ha convertido en la fuente de datos preferida por muchos motores de extracción automatizada.
La razón es de rendimiento: leer texto ya codificado en el fichero es más rápido que ejecutar OCR sobre cada imagen. Numerosos pipelines de onboarding, scoring crediticio o verificación de nóminas extraen directamente esa capa de texto y la tratan como equivalente a lo que ve un revisor humano. Esa suposición es exactamente el punto que un documento manipulado puede explotar.
Cómo explotan los defraudadores la brecha entre imagen y texto embebido
Un atacante que entiende esta arquitectura no necesita falsificar el documento entero: le basta con que una sola de las dos capas mienta. Existen tres variantes principales, y las tres producen el mismo resultado — un archivo que "parece" correcto para quien lo mira y "dice" algo distinto para quien lo procesa.
Alterar la imagen y dejar el texto original intacto
La variante más directa consiste en editar visualmente una nómina, un extracto bancario o una factura —cambiando un importe, una fecha o un nombre— sin tocar la capa de texto subyacente. Un revisor humano que solo mira la pantalla ve el dato falsificado. Un pipeline que solo lee la capa de texto extrae el dato original, que puede delatar la manipulación por incoherencia con el expediente o pasar inadvertido si nadie cruza ambas fuentes.
Inyectar una capa de texto "limpia" sobre una imagen alterada
La variante inversa, más sofisticada, es la que realmente compromete a los sistemas automatizados: el defraudador altera la imagen visible y además reescribe o inserta una capa de texto que reproduce exactamente los valores falsos. Un pipeline que confía en el texto embebido sin comprobar la imagen aprueba el documento sin fricción, porque no hay ninguna incoherencia interna que detectar mediante reglas simples.
Deriva accidental explotada de forma deliberada
Durante ediciones sucesivas con distintas herramientas, es habitual que la capa de texto y la imagen se desincronicen sin intención fraudulenta —un campo se actualiza en un formulario editable pero la vista impresa no se regenera—. Un defraudador puede aprovechar este comportamiento conocido para introducir divergencias que, de detectarse, resultan plausibles como error técnico y no como fraude.
El caso Manafort: la prueba de que ambas capas son independientes
En enero de 2019, un escrito judicial del equipo legal de Paul Manafort demostró de forma pública que tachar visualmente un texto en un PDF no elimina su capa de texto subyacente. Los abogados cubrieron con rectángulos negros los párrafos que querían ocultar, pero no aplicaron una redacción real que eliminase el contenido de la estructura del archivo; un periodista de The Guardian copió y pegó el texto "tachado" y recuperó íntegramente la información que se pretendía sellar, incluidos detalles sobre el intercambio de datos de campaña con un asociado ruso (Motherboard/Vice, 2019).
Este incidente no fue un fraude documental: fue un fallo de redacción. Pero ilustra con precisión el mecanismo que un defraudador explota deliberadamente: la capa visible y la capa de texto de un PDF son estructuras independientes que un editor descuidado —o malicioso— puede dejar desincronizadas sin que nada en la interfaz de usuario lo advierta.
¿Listo para automatizar sus verificaciones?
Piloto gratuito con sus propios documentos. Resultados en 48h.
Solicitar un piloto gratuitoCómo detectar la divergencia entre el texto embebido y el renderizado visual
La técnica de detección fundamental consiste en tratar ambas capas como fuentes independientes que deben coincidir, en vez de confiar en una sola. Esto implica extraer el texto embebido del PDF y, por separado, ejecutar OCR sobre la imagen renderizada de cada página, para después comparar campo a campo los valores obtenidos por cada vía.
Un desajuste material entre lo que el fichero "dice" internamente y lo que la imagen "muestra" es una señal de manipulación fuerte, especialmente en campos sensibles como importes, fechas, IBAN o identificadores fiscales. La comparación por sí sola no basta: hay que combinarla con verificaciones estructurales y de metadatos, dentro de la guía general de verificación de documentos que cubre el resto de controles del proceso.
| Señal detectada | Método | Interpretación probable |
|---|---|---|
| Texto embebido ≠ resultado OCR en el mismo campo | Comparación capa vs. imagen | Divergencia entre imagen y texto, posible manipulación |
| Texto embebido presente pero invisible (blanco sobre blanco, tamaño 0) | Análisis del modo de renderizado (Tr) y color de relleno |
Ocultación deliberada de contenido |
| Fuente incoherente entre el bloque sospechoso y el resto del documento | Análisis tipográfico comparativo | Inserción u overlay posterior a la generación original |
| Coordenadas de texto fuera del área visible de la página | Extracción de posición de los objetos de texto | Contenido "fantasma" no destinado a lectura humana |
| Múltiples revisiones incrementales en un documento de una sola página | Análisis de la estructura incremental del PDF | Edición posterior a la emisión declarada |
Este enfoque —diferenciar sistemáticamente lo que el archivo declara de lo que la imagen realmente muestra— es la base de un análisis multicapa que combina OCR, metadatos y coherencia entre documentos, en lugar de depender de una única fuente de verdad.
Herramientas y metodologías de referencia
El trabajo académico "PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents" (2025) formaliza métodos para detectar contenido oculto en documentos estructurados dirigidos a pipelines de ingesta automatizada, un problema emparentado con la manipulación de capas de texto PDF (arXiv:2508.17884).
El proyecto abierto hidden-text-detector identifica texto blanco sobre blanco, fuentes sublegibles, texto fuera de página, modos de renderizado invisibles y caracteres Unicode invisibles en PDF y DOCX (GitHub, wppoland). Esta comprobación estructural complementa, sin sustituir, la comparación directa entre OCR e imagen.
Que esta técnica de ataque es un problema reconocido, y no una hipótesis teórica, queda documentado en la patente estadounidense "Content masking attacks against information-based services and defenses thereto" (US11775749), que describe el enmascaramiento de contenido en capas ocultas como vector para engañar a servicios automatizados de extracción de información (USPTO).
En cuanto al contexto de amenazas más amplio, el informe ENISA Threat Landscape 2024 sitúa la manipulación de documentos digitales dentro de las técnicas de fraude que evolucionan junto con la sofisticación de las herramientas de edición disponibles públicamente (ENISA). Según el ACFE 2024 Report to the Nations, los controles internos manuales detectan en torno al 37 % de los casos de fraude, con un retraso medio de 87 días entre la comisión del fraude y su descubrimiento (ACFE), un plazo que la comparación automática entre capas de texto e imagen puede acortar drásticamente al ejecutarse en el momento de la carga del documento.
Qué preguntan los equipos que gestionan estos documentos
En foros de asesoría laboral y fiscal, es habitual encontrar hilos donde profesionales comentan haber recibido solicitudes para "ajustar" el importe de una nómina antes de presentarla ante un banco para una hipoteca, y discuten las implicaciones legales de acceder a ello. Otros usuarios preguntan, en comunidades de autónomos, cómo saber si un PDF que reciben de un cliente "ha sido tocado" sin tener que enviarlo a un perito.
La primera pregunta —¿es delito modificar una nómina antes de presentarla?— tiene respuesta clara: el Código Penal castiga la falsedad en documento mercantil u oficial con penas de prisión de seis meses a tres años, independientemente de si la alteración se hizo en la imagen, en el texto embebido o en ambas capas. La segunda pregunta —¿cómo detectarlo sin un perito— es precisamente el problema técnico que resuelve la comparación automatizada entre OCR y capa de texto: no requiere acceso al documento original del emisor, solo al fichero recibido.
Qué hacer cuando su equipo sospecha una capa de texto manipulada
Ante un documento dudoso, el primer paso es extraer la capa de texto embebida con una herramienta como pdftotext o PyMuPDF y compararla, campo a campo, con lo que muestra la imagen en un visor estándar. Si ambas fuentes coinciden en los campos críticos, la señal de riesgo es baja; si divergen en importes, fechas o identificadores, el documento merece revisión reforzada.
Este control encaja como una capa adicional dentro de un flujo de verificación cruzada de documentos que va más allá del OCR, junto con el análisis de metadatos como técnica complementaria, que revela ediciones posteriores a la emisión declarada del documento. Ninguna técnica es suficiente por sí sola: la fuerza del enfoque está en cruzar varias señales estructurales.
Para equipos de banca y entidades reguladas por el SEPBLAC, incorporar esta verificación reduce la dependencia de una revisión manual que, según el ACFE, llega tarde en más de ocho de cada diez casos detectados. CheckFile aplica un análisis multicapa que combina OCR sobre la imagen renderizada, extracción de la capa de texto embebida y verificación de coherencia entre documentos, como parte de sus soluciones para banca y KYC y aseguradoras, y ofrece señales de generación por IA como complemento a sus controles existentes a través de su módulo de detección de deepfakes documentales — sin sustituir el criterio humano ni garantizar la detección de toda manipulación posible.
Preguntas frecuentes
¿Todos los PDF tienen una capa de texto oculta?
No. Un PDF generado a partir de una imagen escaneada sin OCR posterior solo contiene píxeles, sin capa de texto embebida. La capa de texto aparece cuando el documento se genera digitalmente, se procesa con OCR o se edita con herramientas que insertan texto reconocible.
¿Basta con mirar el documento en pantalla para detectar esta manipulación?
No, y ese es precisamente el problema. La manipulación afecta a una capa que no es visible en el visor estándar; se necesita extraer el texto embebido por separado y compararlo con el resultado de un OCR independiente sobre la imagen.
¿Es legal seleccionar y copiar el texto de un PDF de un tercero para verificarlo?
Copiar texto de un documento recibido legítimamente para fines de verificación de fraude no plantea, con carácter general, un problema legal en sí mismo; el análisis debe limitarse a los datos ya facilitados voluntariamente por la persona que presenta el documento y respetar el RGPD en cuanto al tratamiento de esos datos.
¿Esta técnica sustituye al análisis de metadatos o al análisis ELA?
No. La comparación entre texto embebido e imagen renderizada detecta un tipo de manipulación específico —la divergencia entre lo que el fichero declara y lo que muestra—, mientras que el análisis de metadatos revela el historial de edición y el análisis ELA detecta recompresión de zonas de imagen. Un programa antifraude robusto combina las tres.
¿Puede un pipeline automatizado implementar esta comparación sin intervención humana?
Sí, técnicamente es viable ejecutar OCR y extracción de texto embebido de forma automática en el momento de la carga del documento y generar una alerta cuando ambas fuentes difieren por encima de un umbral. La revisión humana sigue siendo necesaria para decidir sobre los casos señalados, no para ejecutar la comparación inicial.
Manténgase informado
Reciba nuestros análisis de cumplimiento y guías prácticas en su correo.