Protection des données

Nous apprécions votre confiance et travaillons dur pour assurer la sécurité de vos informations.

Comment Airparser traite vos données avec l'IA

Airparser transforme les documents et les e-mails en champs structurés que vous définissez dans un schéma, à l'aide d'un pipeline combiné d'extraction de données — prétraitement, OCR, modèles d'extraction (y compris nos propres modèles et des modèles améliorés spécialisés dans l'extraction de données) et post-traitement. Nous tenons à être précis sur la façon dont ce pipeline protège vos données, pour que vous n'ayez pas simplement à nous croire sur parole.

Cette page complète notre page générale Sécurité avec un regard plus précis et plus technique spécifiquement sur la partie IA du pipeline.

Ce que fait l'IA chez Airparser

Airparser n'est pas une simple surcouche autour d'un modèle de chat. L'extraction combine plusieurs étapes — prétraitement, OCR, modèles d'extraction structurée, et post-traitement/validation — et l'IA est utilisée dans ce pipeline là où elle apporte le plus de valeur : interpréter un contenu dont la mise en page ou le format varie, et le faire correspondre aux champs de votre schéma. Il n'y a ni interface de chat générique, ni prompt ouvert sur vos données au-delà de la tâche d'extraction que vous avez configurée.

Comment un document est traité, étape par étape

  • Réception — un document arrive par téléversement, e-mail, API, ou une intégration dans votre boîte Airparser.
  • Prétraitement — le fichier est normalisé, et l'OCR est exécuté sur les fichiers scannés ou les images pour produire une couche de texte.
  • Extraction structurée — le document est comparé à votre schéma à l'aide de nos modèles et de notre logique d'extraction : un mélange de nos propres modèles et de modèles améliorés/spécialisés — construits à partir des fournisseurs listés sur notre page des sous-traitants — ajustés spécifiquement pour l'extraction de données de documents.
  • Post-traitement — les données extraites sont validées et normalisées selon les types de champs de votre schéma avant d'être finalisées.
  • Livraison — le résultat est stocké dans votre compte et disponible via l'application, l'API, ou votre export/webhook configuré.

Pourquoi nous combinons OCR, IA et post-traitement

Chaque étape comble une faiblesse différente. L'OCR seul fournit du texte brut, mais aucune compréhension de ce que ce texte signifie ni de son rapport avec votre schéma. Les modèles d'IA sont doués pour interpréter le sens et gérer des documents dont la mise en page ou la formulation varie — ce que les modèles fixes gèrent mal —, mais ne garantissent pas à eux seuls un résultat bien typé et validé. Le post-traitement comble cet écart en vérifiant les types, les formats et la cohérence avant que les données n'atteignent votre compte. Combiner les trois donne des résultats plus fiables que de s'appuyer sur une seule méthode.

Embeddings et documents longs

Les embeddings sont des représentations numériques de texte qui permettent à un système d'identifier quelles parties d'un document sont les plus pertinentes pour un champ ou une requête donnés, sans avoir à traiter l'intégralité du document à chaque étape.

Nous avons utilisé cette technique pour aider à traiter plus efficacement des documents très longs. Elle est actuellement appliquée de façon sélective et reste plutôt expérimentale qu'une partie par défaut de chaque extraction — nous pourrions étendre son usage à l'avenir à mesure qu'elle mûrit.

Nos modèles d'extraction

Notre pipeline d'extraction utilise un mélange de nos propres modèles et de modèles améliorés et spécialisés construits à partir des fournisseurs de LLM listés sur notre page des sous-traitants — ajustés spécifiquement pour l'extraction de données de documents, et non pour le chat généraliste.

Entraînement et conservation des données

  • Nous n'entraînons ni n'ajustons jamais aucun modèle avec vos données, et nous ne vendons jamais vos données. C'est un engagement permanent, pas une fonctionnalité dépendante du forfait.
  • Nos accords avec nos sous-traitants IA leur interdisent d'utiliser les données soumises pour l'extraction afin d'entraîner leurs modèles.

Chiffrement et transport

Toutes les communications avec nos sous-traitants IA passent par des connexions chiffrées (HTTPS/TLS 1.2+), la même norme que nous appliquons à toutes les autres parties de notre infrastructure.

Séparation des données

Les documents, schémas et résultats de chaque compte Airparser sont logiquement isolés de tout autre compte. Le traitement du document d'un client n'expose ni ne mélange jamais les données d'un autre client.

Ce qui reste sous votre contrôle

  • Vous êtes le Responsable du traitement ; Airparser et ses sous-traitants IA n'agissent qu'en tant que Sous-traitant, selon vos instructions.
  • Vous pouvez supprimer à tout moment n'importe quel document, schéma, ou l'intégralité de votre compte.
  • Des politiques de conservation configurables vous permettent de supprimer automatiquement les données traitées entre 1 et 180 jours.

Questions fréquentes

Airparser n'est-il qu'une surcouche autour d'un modèle de chat ?

Non. L'extraction passe par un pipeline — prétraitement, OCR, modèles d'extraction structurée, et post-traitement/validation — utilisant un mélange de nos propres modèles et de modèles améliorés et spécialisés construits à partir des fournisseurs listés sur notre page des sous-traitants, ajustés spécifiquement pour l'extraction de données de documents et non pour le chat généraliste.

Le fichier brut (par exemple un PDF scanné ou une image) est-il traité, ou seulement le texte extrait ?

Cela dépend du document et du schéma, mais le contenu du document — y compris les fichiers bruts et les images si nécessaire — peut être traité directement par nos modèles d'extraction. Ce traitement est chiffré en transit et n'est jamais utilisé pour l'entraînement.

Utilisez-vous des embeddings ou une recherche vectorielle ?

Nous avons utilisé les embeddings de façon sélective pour aider à traiter plus efficacement des documents très longs. C'est actuellement limité/expérimental, pas une composante de chaque extraction.

Les employés d'Airparser peuvent-ils lire mes documents ?

L'accès aux données clients est restreint selon le principe du moindre privilège, limité à ce qui est nécessaire pour le support ou le dépannage, et audité régulièrement. Consultez notre page Sécurité pour plus de détails.

Mes données sont-elles utilisées pour améliorer les modèles d'Airparser ou des fournisseurs d'IA ?

Non. Nous n'entraînons pas sur vos données, et nos contrats avec nos sous-traitants IA le leur interdisent également.

Que deviennent mes données si je supprime un document ?

Elles sont immédiatement supprimées des systèmes actifs, et des sauvegardes et journaux dans le délai de conservation que vous avez configuré (1 à 180 jours).

Des questions ?

Si vous avez besoin de plus de détails pour votre propre évaluation de sécurité ou de fournisseurs, contactez-nous à [email protected].