Protección de datos

Valoramos tu confianza y trabajamos arduamente para mantener segura tu información.

Cómo Airparser procesa tus datos con IA

Airparser convierte documentos y correos electrónicos en los campos estructurados que defines en un esquema, mediante un pipeline combinado de extracción de datos — preprocesamiento, OCR, modelos de extracción (incluidos nuestros propios modelos y modelos mejorados especializados en extracción de datos) y post-procesamiento. Queremos ser precisos sobre cómo ese pipeline protege tus datos, para que no tengas que darlo por sentado.

Esta página complementa nuestra página general de Seguridad con una mirada más cercana y técnica específicamente a la parte de IA del pipeline.

Qué hace la IA en Airparser

Airparser no es un simple wrapper alrededor de un modelo de chat. La extracción combina varias etapas — preprocesamiento, OCR, modelos de extracción estructurada y post-procesamiento/validación — y la IA se utiliza dentro de ese pipeline donde aporta más valor: interpretando contenido que varía en diseño o formato y asignándolo a los campos de tu esquema. No hay una interfaz de chat genérica ni un uso abierto de tus datos más allá de la tarea de extracción que has configurado.

Cómo se procesa un documento, paso a paso

  • Ingesta — un documento llega por carga, correo electrónico, API o una integración a tu buzón de Airparser.
  • Preprocesamiento — el archivo se normaliza, y se ejecuta OCR en archivos escaneados o imágenes para producir una capa de texto.
  • Extracción estructurada — el documento se compara con tu esquema usando nuestros modelos y lógica de extracción: una combinación de modelos propios y modelos mejorados/especializados — construidos sobre los proveedores indicados en nuestra página de subencargados — ajustados específicamente para la extracción de datos de documentos.
  • Post-procesamiento — la salida extraída se valida y normaliza según los tipos de campo de tu esquema antes de finalizarse.
  • Entrega — el resultado se almacena en tu cuenta y está disponible a través de la aplicación, la API o tu exportación/webhook configurado.

Por qué combinamos OCR, IA y post-procesamiento

Cada etapa cubre una debilidad distinta. El OCR por sí solo te da texto sin procesar, pero ninguna comprensión de lo que ese texto significa o cómo se relaciona con tu esquema. Los modelos de IA son buenos interpretando el significado y manejando documentos cuyo diseño o redacción varía — algo que las plantillas fijas gestionan mal —, pero por sí solos no garantizan un resultado bien tipado y validado. El post-procesamiento cierra esa brecha comprobando tipos, formatos y consistencia antes de que los datos lleguen a tu cuenta. Combinar los tres da resultados más fiables que depender de un único método.

Embeddings y documentos largos

Los embeddings son representaciones numéricas de texto que permiten a un sistema identificar qué partes de un documento son más relevantes para un campo o consulta determinados, sin tener que procesar el documento completo en cada paso.

Hemos usado esta técnica para ayudar a procesar documentos muy largos de forma más eficiente. Actualmente se aplica de forma selectiva y sigue siendo algo experimental, en lugar de formar parte por defecto de cada extracción — podríamos ampliar su uso en el futuro a medida que madure.

Nuestros modelos de extracción

Nuestro pipeline de extracción utiliza una combinación de modelos propios y modelos mejorados y especializados construidos sobre los proveedores de LLM indicados en nuestra página de subencargados — ajustados específicamente para la extracción de datos de documentos, no para chat de propósito general.

Entrenamiento y retención de datos

  • Nunca entrenamos ni ajustamos ningún modelo con tus datos, y nunca vendemos tus datos. Este es un compromiso permanente, no una función dependiente del plan.
  • Nuestros acuerdos con nuestros subencargados de IA les prohíben usar los datos enviados para la extracción con el fin de entrenar sus modelos.

Cifrado y transporte

Toda la comunicación con nuestros subencargados de IA se realiza mediante conexiones cifradas (HTTPS/TLS 1.2+), el mismo estándar que aplicamos a cualquier otra parte de nuestra infraestructura.

Segregación de datos

Los documentos, esquemas y resultados de cada cuenta de Airparser están lógicamente aislados de los de cualquier otra cuenta. Procesar el documento de un cliente nunca expone ni mezcla los datos de otro cliente.

Qué permanece bajo tu control

  • Tú eres el Responsable del tratamiento; Airparser y sus subencargados de IA actúan únicamente como Encargados del tratamiento, siguiendo tus instrucciones.
  • Puedes eliminar cualquier documento, esquema o toda tu cuenta en cualquier momento.
  • Las políticas de retención configurables te permiten eliminar automáticamente los datos procesados entre 1 y 180 días.

Preguntas frecuentes

¿Airparser es solo un wrapper alrededor de un modelo de chat?

No. La extracción se ejecuta a través de un pipeline — preprocesamiento, OCR, modelos de extracción estructurada y post-procesamiento/validación — usando una combinación de modelos propios y modelos mejorados y especializados construidos sobre los proveedores indicados en nuestra página de subencargados, ajustados específicamente para la extracción de datos de documentos y no para chat de propósito general.

¿Se procesa el archivo original (por ejemplo, un PDF escaneado o una imagen), o solo el texto extraído?

Depende del documento y del esquema, pero el contenido del documento — incluidos archivos originales e imágenes cuando es necesario — puede ser procesado directamente por nuestros modelos de extracción. Ese procesamiento está cifrado en tránsito y nunca se usa para entrenamiento.

¿Utilizáis embeddings o búsqueda vectorial?

Hemos usado embeddings de forma selectiva para ayudar a procesar documentos muy largos de forma más eficiente. Actualmente es algo limitado/experimental, no parte de cada extracción.

¿Pueden los empleados de Airparser leer mis documentos?

El acceso a los datos de los clientes está restringido según el principio de privilegio mínimo, limitado a lo necesario para soporte o resolución de incidencias, y se audita periódicamente. Consulta nuestra página de Seguridad para más detalles.

¿Se usan mis datos para mejorar los modelos de Airparser o de los proveedores de IA?

No. No entrenamos con tus datos, y nuestros contratos con nuestros subencargados de IA tampoco se lo permiten a ellos.

¿Qué ocurre con mis datos si elimino un documento?

Se eliminan inmediatamente de los sistemas activos, y de las copias de seguridad y registros dentro de la ventana de retención que hayas configurado (1-180 días).

¿Preguntas?

Si necesitas más detalle para tu propia revisión de seguridad o de proveedores, contáctanos en [email protected].