Guía práctica · RGPD

IA local para anonimizar documentos: ventajas y limitaciones del procesamiento en navegador

Actualizado el 8 min de lecturaPor Ana Gloria Gómez Ruiz
Respuesta rápida

¿Es más potente anonimizar documentos con IA en local? Analizamos las limitaciones de anonimizar con IA ejecutada en navegador: modelos, hardware, precisión, OCR, contexto y procesamiento masivo.

La inteligencia artificial puede ejecutarse hoy directamente en un navegador. Tecnologías como WebAssembly y WebGPU permiten descargar determinados modelos y realizar la inferencia con la CPU o GPU del ordenador del usuario. Aplicado a la anonimización documental, esto ofrece una ventaja clara: el documento puede analizarse sin enviarse a un servidor durante esa inferencia. Pero esta arquitectura también tiene limitaciones, y conocerlas es especialmente importante cuando la herramienta va a usarse sobre documentación administrativa compleja.

¿Una IA que funciona en local es menos potente?

No necesariamente. Un modelo local puede conseguir resultados excelentes. El problema es que, cuando la IA se ejecuta en el navegador, el ordenador del empleado se convierte en la infraestructura de procesamiento.

Su rendimiento dependerá de elementos como:

  • CPU
  • memoria disponible
  • GPU
  • navegador
  • sistema operativo
  • políticas corporativas
  • antigüedad del equipo

Esto obliga a diseñar la herramienta para funcionar razonablemente bien en una gran variedad de dispositivos.

El tamaño del modelo importa

Los modelos de inteligencia artificial pueden ocupar desde pocos megabytes hasta varios gigabytes y requerir cantidades muy diferentes de memoria y capacidad computacional. Por eso, en entornos como navegadores es habitual utilizar modelos pequeños, optimizados o cuantizados.

La cuantización permite reducir significativamente el tamaño de un modelo y sus necesidades de procesamiento. Es una técnica perfectamente válida y muy extendida. Pero introduce una decisión tecnológica: ¿qué equilibrio entre tamaño, velocidad, consumo y precisión necesita realmente la aplicación?

En una infraestructura cloud o en un servidor on-premise específicamente dimensionado para IA, esa restricción puede ser mucho menor.

Detectar un DNI no es lo mismo que comprender un expediente

La diferencia adquiere especial importancia en anonimización administrativa. Un DNI, un IBAN, un correo electrónico o un teléfono pueden detectarse en gran medida mediante patrones y reglas. El problema complejo aparece cuando hay que interpretar el contexto. Por ejemplo:

  • el nombre de un ciudadano puede necesitar anonimización;
  • el nombre de un cargo público puede tener que permanecer visible;
  • la empresa adjudicataria y determinados datos de contratación pueden ser información pública;
  • una dirección puede ser personal o corresponder a un organismo;
  • un código de validación puede permitir acceder a un documento original;
  • una combinación de datos puede identificar indirectamente a una persona.

En esos casos, anonimizar correctamente no consiste simplemente en reconocer entidades: consiste en comprender qué representa cada entidad dentro del documento.

¿Por qué importa el contexto para la revisión humana?

Porque la herramienta no termina su trabajo cuando detecta datos. Después normalmente existe una fase de revisión. Si un sistema genera demasiados falsos positivos, el usuario tendrá que comprobar manualmente cientos de detecciones. Si genera demasiados falsos negativos, aumenta el riesgo de dejar información sin anonimizar.

Por eso la métrica realmente importante no debería ser únicamente cuántos tipos de datos detecta una herramienta. También debería medirse cuánto tiempo necesita una persona para revisar el documento después. La finalidad de la IA debería ser reducir esa carga.

OCR, imágenes y documentos complejos

La documentación administrativa rara vez está formada únicamente por PDF perfectamente estructurados. Puede incluir:

  • documentos escaneados
  • fotografías
  • firmas
  • tablas
  • anexos
  • documentos Word
  • hojas de cálculo
  • metadatos
  • imágenes dentro de otros documentos

Un documento escaneado puede requerir primero OCR y posteriormente análisis del contenido. Cada una de estas operaciones aumenta las necesidades de procesamiento. Una herramienta local puede hacerlo, pero deberá utilizar los recursos disponibles en el equipo.

¿Qué ocurre con miles de páginas?

El procesamiento local tampoco hace desaparecer el coste computacional: lo traslada al ordenador del usuario. En un documento puntual puede no tener ninguna importancia. Pero en miles de páginas, tratamiento por lotes u operaciones intensivas de OCR y análisis semántico, puede convertirse en una limitación.

En un modelo SaaS, la capacidad de procesamiento la aporta y dimensiona el proveedor. En un modelo on-premise, la organización puede utilizar servidores específicamente preparados para esta tarea. En ambos casos se evita depender de la potencia de cada ordenador individual.

Local y on-premise no son lo mismo

Esta diferencia resulta fundamental. Procesamiento local significa que el modelo se ejecuta en el equipo del usuario. On-premise significa que la plataforma se instala dentro de la infraestructura de la organización.

Un despliegue on-premise puede utilizar servidores dedicados, disponer de mucha más capacidad de procesamiento y seguir evitando que la información abandone la infraestructura de la Administración. Por tanto, si una organización considera imprescindible que los documentos no salgan de su perímetro, no está obligada a limitarse a ejecutar pequeños modelos en cada navegador.

¿Cuándo tiene sentido una herramienta local?

Puede ser una excelente alternativa para documentos relativamente sencillos, volúmenes reducidos o escenarios en los que la prioridad absoluta sea que la inferencia se produzca exclusivamente en el dispositivo.

Pero antes de decidir conviene comparar resultados reales. No basta con preguntar «¿funciona en local?». Hay que preguntar: ¿qué modelo utiliza, qué contexto entiende, qué documentos procesa, qué precisión obtiene y cuánto trabajo deja después al revisor?

El enfoque de AnonimizIA

AnonimizIA se ha diseñado específicamente pensando en documentación administrativa. El objetivo no es simplemente localizar cadenas de texto, sino combinar detección automatizada, reglas, contexto, configuraciones propias de cada organización y revisión humana.

Al ejecutarse sobre una infraestructura centralizada, la capacidad de procesamiento no depende del ordenador de cada usuario. Y cuando una organización necesita mantener toda la solución dentro de su propia infraestructura, existe la posibilidad de desplegarla on-premise.

Si quieres profundizar, puedes leer también ¿Es más seguro anonimizar documentos en local? y la guía anonimización en la Administración Pública.

Preguntas frecuentes

¿Puede una IA funcionar completamente en el navegador?

Sí.

¿Todos los ordenadores ofrecerán el mismo rendimiento?

No. Hardware, memoria, GPU y navegador influyen en el resultado.

¿Un modelo local es necesariamente menos preciso?

No, pero las limitaciones del dispositivo condicionan qué modelos resulta práctico utilizar.

¿El procesamiento local elimina el coste computacional?

No. Lo traslada al dispositivo.

¿On-premise es lo mismo que procesar en navegador?

No. On-premise puede utilizar servidores dedicados dentro de la infraestructura de la Administración.

¿Qué debería comparar una Administración?

Precisión, falsos positivos y negativos, análisis contextual, OCR, documentos complejos, rendimiento y tiempo final de revisión.

¿Anonimizas documentos a diario?

Deja de tachar a mano. Automatízalo con anonimizia.

Sube tus PDFs y obtén documentos anonimizados conforme al RGPD en segundos.

Probar gratis