Skip to content
Caso de clienteTarifasSeguridadComparativaBlog

Europe

Americas

Oceania

Guía11 min de lectura

Capa de texto oculta en PDF: la brecha que explota el fraude documental

Cómo los defraudadores en México usan la capa de texto oculta de un PDF, distinta de la imagen visible, para engañar al OCR y evadir la verificación documental.

El equipo CheckFile
El equipo CheckFile·
Illustration for Capa de texto oculta en PDF: la brecha que explota el fraude documental — Guía

Resumir este artículo con

Un PDF no es una fotografía. Debajo de la imagen que una persona ve al abrirlo, casi siempre existe una segunda capa: el texto embebido, invisible en pantalla pero legible por cualquier buscador, por la función copiar y pegar y, sobre todo, por los pipelines automáticos de verificación documental. Cuando esa capa oculta no coincide con lo que muestra la imagen, un sistema que confía ciegamente en el texto embebido puede aprobar datos que un vistazo humano habría descartado de inmediato.

Este artículo se proporciona únicamente con fines informativos y no constituye asesoramiento legal, financiero ni regulatorio. Las referencias normativas son exactas en la fecha de publicación.

Qué es la capa de texto oculta de un PDF y por qué los sistemas confían en ella

Todo PDF generado o procesado por OCR puede almacenar dos representaciones independientes del mismo contenido: el renderizado visible (los píxeles o glifos que aparecen en pantalla) y una capa de texto Unicode incrustada en la estructura interna del archivo. Esa segunda capa existe para que el documento sea buscable, seleccionable y copiable, pero en la práctica se ha convertido en la fuente de datos preferida por muchos motores de extracción automatizada.

La razón es de rendimiento: leer texto ya codificado es más rápido que ejecutar OCR sobre cada imagen. Numerosos pipelines de alta de clientes, scoring crediticio o verificación de comprobantes de ingresos extraen directamente esa capa de texto y la tratan como equivalente a lo que ve una persona revisora. Esa suposición es exactamente el punto que un documento manipulado puede explotar.

Cómo explotan los defraudadores la brecha entre imagen y texto embebido

Quien entiende esta arquitectura no necesita falsificar el documento entero: le basta con que una sola de las dos capas mienta. Existen tres variantes principales, y las tres producen el mismo resultado: un archivo que "parece" correcto para quien lo mira y "dice" algo distinto para quien lo procesa.

Alterar la imagen y dejar el texto original intacto

La variante más directa consiste en editar visualmente un recibo de nómina, un estado de cuenta bancario o una factura —cambiando un importe, una fecha o un nombre— sin tocar la capa de texto subyacente. Una persona que solo mira la pantalla ve el dato falsificado. Un pipeline que solo lee la capa de texto extrae el dato original, que puede delatar la manipulación por incoherencia con el expediente o pasar inadvertido si nadie cruza ambas fuentes.

Inyectar una capa de texto "limpia" sobre una imagen alterada

La variante inversa, más sofisticada, es la que realmente compromete a los sistemas automatizados: quien defrauda altera la imagen visible y además reescribe o inserta una capa de texto que reproduce exactamente los valores falsos. Un pipeline que confía en el texto embebido sin comprobar la imagen aprueba el documento sin fricción, porque no hay ninguna incoherencia interna que detectar mediante reglas simples.

Deriva accidental explotada de forma deliberada

Durante ediciones sucesivas con distintas herramientas, es habitual que la capa de texto y la imagen se desincronicen sin intención fraudulenta: un campo se actualiza en un formulario editable pero la vista impresa no se regenera. Un defraudador puede aprovechar este comportamiento conocido para introducir divergencias que, de detectarse, resultan plausibles como error técnico y no como fraude.

El caso Manafort: la prueba de que ambas capas son independientes

En enero de 2019, un escrito judicial del equipo legal de Paul Manafort demostró de forma pública que tachar visualmente un texto en un PDF no elimina su capa de texto subyacente. Los abogados cubrieron con rectángulos negros los párrafos que querían ocultar, pero no aplicaron una redacción real que eliminara el contenido de la estructura del archivo; un periodista de The Guardian copió y pegó el texto "tachado" y recuperó íntegramente la información que se pretendía sellar, incluidos detalles sobre el intercambio de datos de campaña con un asociado ruso (Motherboard/Vice, 2019).

Este incidente no fue un fraude documental: fue un fallo de redacción. Pero ilustra con precisión el mecanismo que un defraudador explota deliberadamente: la capa visible y la capa de texto de un PDF son estructuras independientes que una persona descuidada —o con mala intención— puede dejar desincronizadas sin que nada en la interfaz de usuario lo advierta.

¿Listo para automatizar sus verificaciones?

Piloto gratuito con sus propios documentos. Resultados en 48h.

Solicitar un piloto gratuito

Cómo detectar la divergencia entre el texto embebido y el renderizado visual

La técnica de detección fundamental consiste en tratar ambas capas como fuentes independientes que deben coincidir, en vez de confiar en una sola. Esto implica extraer el texto embebido del PDF y, por separado, ejecutar OCR sobre la imagen renderizada de cada página, para después comparar campo a campo los valores obtenidos por cada vía.

Un desajuste material entre lo que el archivo "dice" internamente y lo que la imagen "muestra" es una señal de manipulación fuerte, especialmente en campos sensibles como importes, fechas, la CLABE interbancaria o el RFC. La comparación por sí sola no basta: hay que combinarla con verificaciones estructurales y de metadatos, dentro de la guía general de verificación de documentos que cubre el resto de controles del proceso.

Señal detectada Método Interpretación probable
Texto embebido ≠ resultado OCR en el mismo campo Comparación capa vs. imagen Divergencia entre imagen y texto, posible manipulación
Texto embebido presente pero invisible (blanco sobre blanco, tamaño 0) Análisis del modo de renderizado (Tr) y color de relleno Ocultación deliberada de contenido
Fuente incoherente entre el bloque sospechoso y el resto del documento Análisis tipográfico comparativo Inserción u overlay posterior a la generación original
Coordenadas de texto fuera del área visible de la página Extracción de posición de los objetos de texto Contenido "fantasma" no destinado a lectura humana
Múltiples revisiones incrementales en un documento de una sola página Análisis de la estructura incremental del PDF Edición posterior a la emisión declarada

Este enfoque —diferenciar sistemáticamente lo que el archivo declara de lo que la imagen realmente muestra— es la base de un análisis multicapa que combina OCR, metadatos y coherencia entre documentos, en lugar de depender de una única fuente de verdad.

Herramientas y metodologías de referencia

El trabajo académico "PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents" (2025) formaliza métodos para detectar contenido oculto en documentos estructurados dirigidos a pipelines de ingesta automatizada, un problema emparentado con la manipulación de capas de texto PDF (arXiv:2508.17884).

El proyecto abierto hidden-text-detector identifica texto blanco sobre blanco, fuentes sublegibles, texto fuera de página, modos de renderizado invisibles y caracteres Unicode invisibles en PDF y DOCX (GitHub, wppoland). Esta comprobación estructural complementa, sin sustituir, la comparación directa entre OCR e imagen.

Que esta técnica de ataque es un problema reconocido, y no una hipótesis teórica, queda documentado en la patente estadounidense "Content masking attacks against information-based services and defenses thereto" (US11775749), que describe el enmascaramiento de contenido en capas ocultas como vector para engañar a servicios automatizados de extracción de información (USPTO).

En el ámbito mexicano, la reforma a la LFPIORPI publicada en el Diario Oficial de la Federación el 16 de julio de 2025 refuerza las obligaciones de identificación de clientes para actividades vulnerables, y coincide con un endurecimiento visible de la vigilancia: la UIF reportó en 2025 un incremento del 53 % en denuncias ante la Fiscalía General de la República, además del aseguramiento de 4,660 millones de pesos por operaciones con recursos de procedencia ilícita. Según el ACFE 2024 Report to the Nations, los controles internos manuales detectan en torno al 37 % de los casos de fraude, con un retraso medio de 87 días entre la comisión del fraude y su descubrimiento (ACFE), plazo que la comparación automática entre capas puede acortar al ejecutarse en la carga del documento.

Qué preguntan los equipos que gestionan estos documentos

En foros de contabilidad y nóminas es habitual encontrar hilos donde profesionales comentan haber recibido solicitudes para "ajustar" el importe de un recibo de nómina antes de presentarlo para un crédito hipotecario, y discuten las implicaciones legales de acceder a ello. Otras personas preguntan, en comunidades de trabajadores independientes, cómo saber si un PDF de un cliente "fue tocado" sin mandarlo a un perito.

La primera pregunta —¿es delito modificar un recibo de nómina antes de presentarlo?— tiene respuesta clara: el Código Penal Federal castiga la falsificación de documentos en sus artículos 243 a 246, con prisión de cuatro a ocho años para documentos públicos y de seis meses a cinco años para privados, independientemente de si la alteración se hizo en la imagen, en el texto embebido o en ambas capas; además, cada estado tiene su propio código penal local para los casos fuera de competencia federal. La segunda pregunta —¿cómo detectarlo sin un perito?— es lo que resuelve la comparación entre OCR y capa de texto: no requiere el documento original de quien lo emitió, solo el archivo recibido.

Qué hacer cuando su equipo sospecha una capa de texto manipulada

Ante un documento dudoso, el primer paso es extraer la capa de texto embebida con una herramienta como pdftotext o PyMuPDF y compararla, campo a campo, con lo que muestra la imagen en un visor estándar. Si ambas fuentes coinciden en los campos críticos, la señal de riesgo es baja; si divergen en importes, fechas o identificadores, el documento merece revisión reforzada.

Este control encaja como una capa adicional dentro de un flujo de verificación cruzada de documentos que va más allá del OCR, junto con el análisis de metadatos como técnica complementaria, que revela ediciones posteriores a la emisión declarada del documento. Ninguna técnica es suficiente por sí sola: la fuerza del enfoque está en cruzar varias señales estructurales.

Para equipos de banca y entidades obligadas conforme a la LFPIORPI, supervisadas por la CNBV y la UIF, esta verificación reduce la dependencia de una revisión manual que, según el ACFE, llega tarde en más de ocho de cada diez casos detectados. CheckFile aplica un análisis multicapa que combina OCR sobre la imagen renderizada, extracción de la capa de texto embebida y verificación de coherencia entre documentos, como parte de sus soluciones para banca y KYC y aseguradoras, y ofrece señales de generación por IA como complemento a sus controles existentes a través de su módulo de detección de deepfakes documentales — sin sustituir el criterio humano ni garantizar la detección de toda manipulación posible.

Preguntas frecuentes

¿Todos los PDF tienen una capa de texto oculta?

No. Un PDF generado a partir de una imagen escaneada sin OCR posterior solo contiene píxeles, sin capa de texto embebida. La capa de texto aparece cuando el documento se genera digitalmente, se procesa con OCR o se edita con herramientas que insertan texto reconocible.

¿Basta con mirar el documento en pantalla para detectar esta manipulación?

No, y ese es precisamente el problema. La manipulación afecta a una capa que no es visible en el visor estándar; se necesita extraer el texto embebido por separado y compararlo con el resultado de un OCR independiente sobre la imagen.

Copiar texto de un documento recibido legítimamente para verificación de fraude no plantea, con carácter general, un problema legal en sí mismo; el análisis debe limitarse a los datos ya facilitados voluntariamente por quien presenta el documento y respetar la LFPDPPP (Ley Federal de Protección de Datos Personales en Posesión de los Particulares). Tras la desaparición del INAI en 2025, la autoridad que supervisa esta ley es la Secretaría Anticorrupción y Buen Gobierno.

¿Esta técnica sustituye al análisis de metadatos o al análisis ELA?

No. La comparación entre texto embebido e imagen renderizada detecta un tipo de manipulación específico —la divergencia entre lo que el archivo declara y lo que muestra—, mientras que el análisis de metadatos revela el historial de edición y el análisis ELA detecta recompresión de zonas de imagen. Un programa antifraude robusto combina las tres.

¿Puede un pipeline automatizado implementar esta comparación sin intervención humana?

Sí, técnicamente es viable ejecutar OCR y extracción de texto embebido de forma automática en el momento de la carga del documento y generar una alerta cuando ambas fuentes difieren por encima de un umbral. La revisión humana sigue siendo necesaria para decidir sobre los casos señalados, no para ejecutar la comparación inicial.

Manténgase informado

Reciba nuestros análisis de cumplimiento y guías prácticas en su correo.

¿Listo para automatizar sus verificaciones?

Piloto gratuito con sus propios documentos. Resultados en 48h.