데이터 보호

고객님의 신뢰에 감사드리며 정보 보안을 위해 최선을 다하고 있습니다.

Airparser가 AI로 데이터를 처리하는 방식

Airparser는 전처리, OCR, 추출 모델(자체 모델과 데이터 추출에 특화된 강화 모델 포함), 후처리를 결합한 데이터 추출 파이프라인을 사용하여 문서와 이메일을 스키마에 정의된 구조화된 필드로 변환합니다. 저희는 이 파이프라인이 고객님의 데이터를 어떻게 보호하는지 정확하게 설명하여, 그냥 믿기만 하시지 않도록 하고자 합니다.

이 페이지는 저희의 일반 보안 페이지를 보완하며, 파이프라인 중 AI와 관련된 부분을 더 자세하고 기술적으로 살펴봅니다.

Airparser에서 AI의 역할

Airparser는 채팅 모델을 감싼 단순한 래퍼가 아닙니다. 추출 과정은 전처리, OCR, 구조화 추출 모델, 후처리/검증이라는 여러 단계를 결합하며, AI는 이 파이프라인 내에서 가장 큰 가치를 더하는 부분, 즉 레이아웃이나 형식이 다양한 콘텐츠를 해석하여 고객님의 스키마 필드에 매핑하는 작업에 사용됩니다. 범용 채팅 인터페이스는 없으며, 설정된 추출 작업을 벗어나 고객님의 데이터에 대해 개방형 프롬프트를 실행하지도 않습니다.

문서가 처리되는 단계별 과정

  • 수집 — 문서는 업로드, 이메일, API 또는 Airparser 메일함으로의 연동을 통해 도착합니다.
  • 전처리 — 파일이 정규화되며, 스캔된 파일이나 이미지의 경우 OCR이 실행되어 텍스트 레이어가 생성됩니다.
  • 구조화 추출 — 문서는 저희의 추출 모델과 로직을 사용해 고객님의 스키마와 대조됩니다. 이는 자체 모델과, 하위 처리업체 페이지에 나열된 제공업체를 기반으로 문서 데이터 추출에 특화되도록 강화한 모델을 결합한 것입니다.
  • 후처리 — 추출된 결과는 최종 확정되기 전에 스키마의 필드 유형에 따라 검증 및 정규화됩니다.
  • 전달 — 결과는 고객님의 계정에 저장되며, 앱, API 또는 설정된 내보내기/웹훅을 통해 이용할 수 있습니다.

OCR, AI, 후처리를 결합하는 이유

각 단계는 서로 다른 약점을 보완합니다. OCR만으로는 원시 텍스트를 얻을 수 있지만, 그 텍스트가 무엇을 의미하는지, 스키마와 어떻게 연관되는지는 이해하지 못합니다. AI 모델은 의미를 해석하고 레이아웃이나 표현이 다양한 문서——고정된 템플릿이 잘 처리하지 못하는 부분——를 다루는 데 뛰어나지만, 그 자체만으로는 유형이 잘 정리되고 검증된 결과를 보장하지 않습니다. 후처리는 데이터가 고객님의 계정에 도달하기 전에 유형, 형식, 일관성을 확인하여 이 격차를 메웁니다. 이 세 가지를 결합하면 단일 방법에만 의존하는 것보다 더 신뢰할 수 있는 결과를 얻을 수 있습니다.

임베딩과 긴 문서

임베딩이란 텍스트의 수치적 표현으로, 시스템이 매 단계마다 문서 전체를 처리하지 않고도 특정 필드나 쿼리와 가장 관련성이 높은 문서의 부분을 식별할 수 있게 해줍니다.

저희는 이 기술을 매우 긴 문서를 더 효율적으로 처리하는 데 활용해 왔습니다. 현재는 선택적으로 적용되고 있으며, 모든 추출 작업의 기본 요소라기보다는 다소 실험적인 성격을 띠고 있습니다——기술이 성숙해짐에 따라 향후 사용 범위를 확대할 수 있습니다.

당사의 추출 모델

저희의 추출 파이프라인은 자체 모델과, 하위 처리업체 페이지에 나열된 LLM 제공업체를 기반으로 한 강화·특화 모델을 결합하여 사용합니다——이는 일반적인 채팅이 아닌 문서 데이터 추출에 특화되어 조정되었습니다.

학습 및 데이터 보관

  • 저희는 고객님의 데이터로 어떤 모델도 학습하거나 미세 조정하지 않으며, 고객님의 데이터를 절대 판매하지 않습니다. 이는 요금제에 따라 달라지는 기능이 아니라 지속적인 약속입니다.
  • AI 하위 처리업체와의 계약에 따라, 추출을 위해 제출된 데이터를 그들의 모델 학습에 사용하는 것은 금지되어 있습니다.

암호화 및 전송

저희 AI 하위 처리업체와의 모든 통신은 암호화된 연결(HTTPS/TLS 1.2 이상)을 통해 이루어지며, 이는 저희 인프라의 다른 모든 부분에 적용하는 것과 동일한 기준입니다.

데이터 분리

각 Airparser 계정의 문서, 스키마, 결과는 다른 모든 계정과 논리적으로 분리되어 있습니다. 한 고객님의 문서를 처리한다고 해서 다른 고객님의 데이터가 노출되거나 섞이는 일은 결코 없습니다.

고객님의 통제하에 남는 것

  • 고객님은 데이터 컨트롤러이며, Airparser 및 그 AI 하위 처리업체는 고객님의 지시에 따라서만 행동하는 데이터 프로세서입니다.
  • 언제든지 문서, 스키마 또는 전체 계정을 삭제할 수 있습니다.
  • 설정 가능한 보관 정책을 통해 처리된 데이터를 1일에서 180일 사이에서 자동으로 삭제할 수 있습니다.

자주 묻는 질문

Airparser는 단순히 채팅 모델을 감싼 래퍼인가요?

아닙니다. 추출은 전처리, OCR, 구조화 추출 모델, 후처리/검증이라는 파이프라인을 통해 이루어지며, 자체 모델과 하위 처리업체 페이지에 나열된 제공업체를 기반으로 한 강화·특화 모델을 결합하여 사용합니다. 이는 일반적인 채팅이 아닌 문서 데이터 추출에 특화되어 조정되었습니다.

원본 파일(예: 스캔된 PDF나 이미지)이 처리되나요, 아니면 추출된 텍스트만 처리되나요?

문서와 스키마에 따라 다르지만, 필요한 경우 원본 파일과 이미지를 포함한 문서 콘텐츠가 당사의 추출 모델에 의해 직접 처리될 수 있습니다. 이 처리 과정은 전송 중 암호화되며 학습에 사용되는 일은 결코 없습니다.

임베딩이나 벡터 검색을 사용하나요?

매우 긴 문서를 더 효율적으로 처리하기 위해 임베딩을 선택적으로 사용해 왔습니다. 현재는 제한적/실험적인 수준이며 모든 추출 작업의 일부는 아닙니다.

Airparser 직원이 제 문서를 읽을 수 있나요?

고객 데이터에 대한 접근은 최소 권한 원칙에 따라 제한되며, 지원이나 문제 해결에 필요한 범위로 한정되고 정기적으로 감사됩니다. 자세한 내용은 저희 보안 페이지를 참조하십시오.

제 데이터가 Airparser나 AI 제공업체의 모델을 개선하는 데 사용되나요?

아닙니다. 저희는 고객님의 데이터로 학습하지 않으며, AI 하위 처리업체와의 계약에서도 이를 금지하고 있습니다.

문서를 삭제하면 제 데이터는 어떻게 되나요?

활성 시스템에서 즉시 제거되며, 고객님이 설정한 보관 기간(1~180일) 내에 백업 및 로그에서도 제거됩니다.

질문이 있으신가요?

보안 또는 공급업체 검토를 위해 더 자세한 정보가 필요하시면 아래로 연락해 주십시오: [email protected].