Protezione dei dati

Apprezziamo la tua fiducia e lavoriamo duramente per mantenere le tue informazioni al sicuro.

Come Airparser elabora i tuoi dati con l'IA

Airparser trasforma documenti ed e-mail nei campi strutturati che definisci in uno schema, utilizzando una pipeline combinata di estrazione dati — pre-elaborazione, OCR, modelli di estrazione (inclusi modelli proprietari e modelli avanzati specializzati nell'estrazione dati) e post-elaborazione. Vogliamo essere precisi su come questa pipeline protegge i tuoi dati, così non devi semplicemente fidarti sulla parola.

Questa pagina completa la nostra pagina generale sulla Sicurezza con uno sguardo più approfondito e tecnico specificamente sulla parte IA della pipeline.

Cosa fa l'IA in Airparser

Airparser non è un semplice wrapper attorno a un modello di chat. L'estrazione combina diverse fasi — pre-elaborazione, OCR, modelli di estrazione strutturata e post-elaborazione/validazione — e l'IA viene utilizzata all'interno di questa pipeline dove apporta il massimo valore: interpretando contenuti che variano per layout o formato e mappandoli sui campi del tuo schema. Non c'è un'interfaccia di chat generica né un prompting aperto dei tuoi dati oltre l'attività di estrazione che hai configurato.

Come viene elaborato un documento, passo dopo passo

  • Acquisizione — un documento arriva tramite caricamento, e-mail, API o un'integrazione nella tua casella Airparser.
  • Pre-elaborazione — il file viene normalizzato, e su file scansionati o immagini viene eseguito l'OCR per produrre un livello di testo.
  • Estrazione strutturata — il documento viene confrontato con il tuo schema utilizzando i nostri modelli e la nostra logica di estrazione: un mix di modelli proprietari e modelli avanzati/specializzati — costruiti sui fornitori elencati nella nostra pagina dei sub-responsabili — calibrati specificamente per l'estrazione di dati dai documenti.
  • Post-elaborazione — l'output estratto viene validato e normalizzato secondo i tipi di campo del tuo schema prima di essere finalizzato.
  • Consegna — il risultato viene archiviato nel tuo account ed è disponibile tramite l'app, l'API o l'esportazione/webhook configurati.

Perché combiniamo OCR, IA e post-elaborazione

Ogni fase copre una debolezza diversa. L'OCR da solo fornisce testo grezzo, ma nessuna comprensione di cosa significhi quel testo o di come si relazioni al tuo schema. I modelli IA sono bravi a interpretare il significato e a gestire documenti il cui layout o formulazione varia — cosa che i modelli fissi gestiscono male —, ma da soli non garantiscono un risultato ben tipizzato e validato. La post-elaborazione colma questa lacuna verificando tipi, formati e coerenza prima che i dati raggiungano il tuo account. Combinare i tre approcci offre risultati più affidabili rispetto ad affidarsi a un unico metodo.

Embeddings e documenti lunghi

Gli embeddings sono rappresentazioni numeriche del testo che permettono a un sistema di identificare quali parti di un documento sono più rilevanti per un determinato campo o query, senza dover elaborare l'intero documento a ogni passaggio.

Abbiamo usato questa tecnica per aiutare a elaborare documenti molto lunghi in modo più efficiente. Attualmente viene applicata in modo selettivo e rimane in qualche modo sperimentale piuttosto che una parte predefinita di ogni estrazione — potremmo ampliarne l'uso in futuro man mano che matura.

I nostri modelli di estrazione

La nostra pipeline di estrazione utilizza un mix di modelli proprietari e modelli avanzati e specializzati costruiti sui fornitori LLM elencati nella nostra pagina dei sub-responsabili — calibrati specificamente per l'estrazione di dati dai documenti, non per la chat generica.

Formazione e conservazione dei dati

  • Non addestriamo né ottimizziamo mai alcun modello con i tuoi dati, e non vendiamo mai i tuoi dati. Questo è un impegno permanente, non una funzione legata al piano.
  • I nostri accordi con i sub-responsabili IA vietano loro di utilizzare i dati inviati per l'estrazione al fine di addestrare i loro modelli.

Crittografia e trasporto

Tutte le comunicazioni con i nostri sub-responsabili IA avvengono tramite connessioni cifrate (HTTPS/TLS 1.2+), lo stesso standard che applichiamo a ogni altra parte della nostra infrastruttura.

Segregazione dei dati

I documenti, gli schemi e i risultati di ogni account Airparser sono logicamente isolati da ogni altro account. L'elaborazione del documento di un cliente non espone né mescola mai i dati di un altro cliente.

Cosa rimane sotto il tuo controllo

  • Sei tu il Titolare del trattamento; Airparser e i suoi sub-responsabili IA agiscono solo come Responsabili del trattamento, secondo le tue istruzioni.
  • Puoi eliminare qualsiasi documento, schema, o l'intero account in qualsiasi momento.
  • Le policy di conservazione configurabili ti permettono di eliminare automaticamente i dati elaborati tra 1 e 180 giorni.

Domande frequenti

Airparser è solo un wrapper attorno a un modello di chat?

No. L'estrazione passa attraverso una pipeline — pre-elaborazione, OCR, modelli di estrazione strutturata e post-elaborazione/validazione — utilizzando un mix di modelli proprietari e modelli avanzati e specializzati costruiti sui fornitori elencati nella nostra pagina dei sub-responsabili, calibrati specificamente per l'estrazione di dati dai documenti e non per la chat generica.

Il file grezzo (ad es. un PDF scansionato o un'immagine) viene elaborato, o solo il testo estratto?

Dipende dal documento e dallo schema, ma il contenuto del documento — inclusi file grezzi e immagini quando necessario — può essere elaborato direttamente dai nostri modelli di estrazione. Questa elaborazione è cifrata in transito e non viene mai utilizzata per l'addestramento.

Utilizzate embeddings o ricerca vettoriale?

Abbiamo usato gli embeddings in modo selettivo per aiutare a elaborare documenti molto lunghi in modo più efficiente. Attualmente è qualcosa di limitato/sperimentale, non parte di ogni estrazione.

I dipendenti di Airparser possono leggere i miei documenti?

L'accesso ai dati dei clienti è limitato secondo il principio del privilegio minimo, ristretto a quanto necessario per l'assistenza o la risoluzione dei problemi, e viene verificato regolarmente. Consulta la nostra pagina sulla Sicurezza per maggiori dettagli.

I miei dati vengono usati per migliorare i modelli di Airparser o dei fornitori IA?

No. Non ci addestriamo con i tuoi dati, e anche i nostri contratti con i sub-responsabili IA lo vietano loro.

Cosa succede ai miei dati se elimino un documento?

Vengono rimossi immediatamente dai sistemi attivi, e dai backup e dai log entro la finestra di conservazione che hai configurato (1-180 giorni).

Domande?

Se hai bisogno di maggiori dettagli per la tua verifica di sicurezza o dei fornitori, contattaci a [email protected].