PDF

Detector de patrones en PDF (no es una auditoría)

Sube un PDF y detecta datos personales y sanitarios en su texto: DNI/NIE, emails, teléfonos, IBAN, tarjetas, IPs y terminología clínica, con localización por página.

Qué es (y qué no es)

No certifica RGPD ni HIPAA. Busca patrones de texto (regex) en el PDF. Un «riesgo» aquí no es un dictamen legal.

HW

Arrastra tu PDF aquí o

El análisis es heurístico (patrones de texto) y no sustituye una auditoría legal o de seguridad. Los PDF escaneados sin capa de texto no pueden analizarse sin OCR. Todo el procesamiento ocurre en tu navegador: el archivo nunca se sube a ningún servidor.

Cómo funciona

Esta ficha no aplica el RGPD ni HIPAA: solo recorre el texto extraído del PDF con expresiones regulares (DNI/NIE, email, teléfono, IBAN, Luhn, algunas palabras clínicas). Un acierto o un fallo aquí no es un dictamen legal.

El análisis funciona en tres pasos, todos en tu navegador: primero se extrae el texto de cada página con la librería PDF.js (el mismo motor que usa Firefox); después se buscan patrones de datos personales —DNI/NIE/CIF españoles, correos electrónicos, teléfonos, IBAN, números de tarjeta verificados con el algoritmo de Luhn y direcciones IP— y terminología sanitaria (paciente, diagnóstico, tratamiento, historial clínico, etc.); por último, el informe agrupa los hallazgos por tipo, indica en qué páginas aparecen y evalúa el nivel de riesgo general.

El informe incluye recomendaciones prácticas: anonimizar o minimizar los datos antes de compartir, cifrar los archivos en reposo y en tránsito, controlar el acceso y la retención, y eliminar copias innecesarias. Para archivos con salud, recuerda que además pueden aplicar leyes sectoriales de cada país (Ley 41/2002 de autonomía del paciente en España, por ejemplo).

Esta herramienta es un primer filtro rápido, no una certificación: los patrones pueden dar falsos positivos (un número de 13 dígitos que no es una tarjeta) y las expresiones clínicas dependen del idioma y del contexto. Para documentos que vayas a publicar, cruza siempre el resultado con una revisión humana. Tu PDF se procesa localmente y nunca abandona tu dispositivo.

Qué hace este detector de patrones

Extrae el texto de cada página con PDF.js y busca coincidencias de DNI/NIE, correo, teléfono, IBAN, números que pasan Luhn y unas cuantas palabras clínicas. El informe lista tipo y página. No firma, no anonimiza, no certifica y no es una auditoría.

Un PDF escaneado sin capa de texto no se puede analizar aquí: no hay OCR en esta ficha. Los falsos positivos existen (un ISBN que parece tarjeta, «paciente» en un folleto). El recuadro de honestidad de arriba vale más que el slug de la URL.

Cómo usarla

  1. Suelta el PDF. No hay cuenta.
  2. Espera el informe en pantalla. No se descarga un PDF nuevo: solo un listado.
  3. Si hay coincidencias, ábrelo en tu visor y revisa esas páginas a mano.
  4. Cierra la pestaña. El archivo no ha salido de tu navegador.

Un caso real

Antes de mandar un informe a un proveedor, pasas el PDF por aquí para ver si quedó un IBAN o un DNI en un pie de página. Si el detector marca «email», compruebas si es un correo genérico de la empresa o uno personal. Eso no sustituye a un DPO.

Límites

Preguntas frecuentes

¿El PDF se sube?

No. PDF.js corre en esta pestaña. En Red no deberías ver un POST con el archivo.

¿Puedo decir que el documento «cumple» si sale vacío?

No. Un informe vacío solo significa que estos patrones no saltaron en el texto extraíble. Un escaneo, un nombre en una imagen o un dato en otro formato no aparecen.

¿Para qué sirve entonces?

Como primer filtro rápido, igual que buscar DNI en el Bloc de notas, con paginado. Nada más.