Proteção de dados
Valorizamos sua confiança e trabalhamos arduamente para manter suas informações seguras.
Como a Airparser processa seus dados com IA
A Airparser transforma documentos e e-mails nos campos estruturados que você define em um esquema, usando um pipeline combinado de extração de dados — pré-processamento, OCR, modelos de extração (incluindo modelos próprios e modelos aprimorados especializados em extração de dados) e pós-processamento. Queremos ser precisos sobre como esse pipeline protege seus dados, para que você não precise apenas confiar.
Esta página complementa nossa página geral de Segurança com um olhar mais detalhado e técnico especificamente sobre a parte de IA do pipeline.
O que a IA faz na Airparser
A Airparser não é um simples wrapper em torno de um modelo de chat. A extração combina várias etapas — pré-processamento, OCR, modelos de extração estruturada e pós-processamento/validação — e a IA é usada dentro desse pipeline onde agrega mais valor: interpretando conteúdo que varia em layout ou formato e mapeando-o para os campos do seu esquema. Não há interface de chat genérica nem uso aberto dos seus dados além da tarefa de extração que você configurou.
Como um documento é processado, passo a passo
- Ingestão — um documento chega por upload, e-mail, API ou uma integração na sua caixa de entrada da Airparser.
- Pré-processamento — o arquivo é normalizado, e o OCR é executado em arquivos escaneados ou imagens para produzir uma camada de texto.
- Extração estruturada — o documento é comparado com seu esquema usando nossos modelos e lógica de extração: uma combinação de modelos próprios e modelos aprimorados/especializados — construídos sobre os provedores listados em nossa página de subprocessadores — ajustados especificamente para a extração de dados de documentos.
- Pós-processamento — a saída extraída é validada e normalizada de acordo com os tipos de campo do seu esquema antes de ser finalizada.
- Entrega — o resultado é armazenado em sua conta e fica disponível pelo aplicativo, API ou sua exportação/webhook configurado.
Por que combinamos OCR, IA e pós-processamento
Cada etapa cobre uma fraqueza diferente. O OCR sozinho fornece texto bruto, mas nenhuma compreensão do que esse texto significa ou como ele se relaciona com seu esquema. Os modelos de IA são bons em interpretar significado e lidar com documentos cujo layout ou redação varia — algo que modelos fixos lidam mal —, mas sozinhos não garantem um resultado bem tipado e validado. O pós-processamento fecha essa lacuna verificando tipos, formatos e consistência antes que os dados cheguem à sua conta. Combinar os três produz resultados mais confiáveis do que depender de um único método.
Embeddings e documentos longos
Embeddings são representações numéricas de texto que permitem que um sistema identifique quais partes de um documento são mais relevantes para um determinado campo ou consulta, sem precisar processar o documento inteiro a cada etapa.
Usamos essa técnica para ajudar a processar documentos muito longos com mais eficiência. Atualmente ela é aplicada de forma seletiva e permanece um tanto experimental, em vez de fazer parte padrão de toda extração — podemos ampliar seu uso no futuro à medida que amadurece.
Nossos modelos de extração
Nosso pipeline de extração usa uma combinação de modelos próprios e modelos aprimorados e especializados construídos sobre os provedores de LLM listados em nossa página de subprocessadores — ajustados especificamente para a extração de dados de documentos, não para chat de uso geral.
Treinamento e retenção de dados
- Nunca treinamos ou ajustamos nenhum modelo com seus dados, e nunca vendemos seus dados. Este é um compromisso permanente, não um recurso dependente de plano.
- Nossos acordos com nossos subprocessadores de IA os proíbem de usar dados enviados para extração no treinamento de seus modelos.
Criptografia e transporte
Toda a comunicação com nossos subprocessadores de IA ocorre por conexões criptografadas (HTTPS/TLS 1.2+), o mesmo padrão que aplicamos a qualquer outra parte da nossa infraestrutura.
Segregação de dados
Os documentos, esquemas e resultados de cada conta da Airparser são logicamente isolados de qualquer outra conta. Processar o documento de um cliente nunca expõe ou mistura os dados de outro cliente.
O que permanece sob seu controle
- Você é o Controlador de Dados; a Airparser e seus subprocessadores de IA atuam apenas como Operadores, seguindo suas instruções.
- Você pode excluir qualquer documento, esquema ou toda a sua conta a qualquer momento.
- Políticas de retenção configuráveis permitem excluir automaticamente dados processados entre 1 e 180 dias.
Perguntas frequentes
A Airparser é apenas um wrapper em torno de um modelo de chat?
Não. A extração passa por um pipeline — pré-processamento, OCR, modelos de extração estruturada e pós-processamento/validação — usando uma combinação de modelos próprios e modelos aprimorados e especializados construídos sobre os provedores listados em nossa página de subprocessadores, ajustados especificamente para a extração de dados de documentos, não para chat de uso geral.
O arquivo bruto (por exemplo, um PDF escaneado ou uma imagem) é processado, ou apenas o texto extraído?
Depende do documento e do esquema, mas o conteúdo do documento — incluindo arquivos brutos e imagens quando necessário — pode ser processado diretamente por nossos modelos de extração. Esse processamento é criptografado em trânsito e nunca é usado para treinamento.
Vocês usam embeddings ou busca vetorial?
Usamos embeddings de forma seletiva para ajudar a processar documentos muito longos com mais eficiência. Atualmente isso é limitado/experimental, não faz parte de toda extração.
Os funcionários da Airparser podem ler meus documentos?
O acesso aos dados dos clientes é restrito pelo princípio do menor privilégio, limitado ao necessário para suporte ou solução de problemas, e é auditado regularmente. Veja nossa página de Segurança para mais detalhes.
Meus dados são usados para melhorar os modelos da Airparser ou dos provedores de IA?
Não. Não treinamos com seus dados, e nossos contratos com nossos subprocessadores de IA também proíbem que eles o façam.
O que acontece com meus dados se eu excluir um documento?
Eles são removidos imediatamente dos sistemas ativos, e dos backups e registros dentro da janela de retenção que você configurou (1-180 dias).
Perguntas?
Se você precisar de mais detalhes para sua própria avaliação de segurança ou de fornecedores, entre em contato conosco em [email protected].