Qué hace este detector de patrones
Extrae el texto de cada página con PDF.js y busca coincidencias de DNI/NIE, correo, teléfono, IBAN, números que pasan Luhn y unas cuantas palabras clínicas. El informe lista tipo y página. No firma, no anonimiza, no certifica y no es una auditoría.
Un PDF escaneado sin capa de texto no se puede analizar aquí: no hay OCR en esta ficha. Los falsos positivos existen (un ISBN que parece tarjeta, «paciente» en un folleto). El recuadro de honestidad de arriba vale más que el slug de la URL.
Cómo usarla
- Suelta el PDF. No hay cuenta.
- Espera el informe en pantalla. No se descarga un PDF nuevo: solo un listado.
- Si hay coincidencias, ábrelo en tu visor y revisa esas páginas a mano.
- Cierra la pestaña. El archivo no ha salido de tu navegador.
Un caso real
Antes de mandar un informe a un proveedor, pasas el PDF por aquí para ver si quedó un IBAN o un DNI en un pie de página. Si el detector marca «email», compruebas si es un correo genérico de la empresa o uno personal. Eso no sustituye a un DPO.
Límites
- No es cumplimiento, certificación ni dictamen RGPD.
- No etiqueta PHI ni aplica normas sanitarias de EE.UU.
- El nivel «más coincidencias» es un recuento de regex, no un riesgo legal.
- No reescribe el PDF.
Preguntas frecuentes
¿El PDF se sube?
No. PDF.js corre en esta pestaña. En Red no deberías ver un POST con el archivo.
¿Puedo decir que el documento «cumple» si sale vacío?
No. Un informe vacío solo significa que estos patrones no saltaron en el texto extraíble. Un escaneo, un nombre en una imagen o un dato en otro formato no aparecen.
¿Para qué sirve entonces?
Como primer filtro rápido, igual que buscar DNI en el Bloc de notas, con paginado. Nada más.