Защита данных

Мы ценим ваше доверие и прилагаем все усилия, чтобы обеспечить безопасность вашей информации.

Как Airparser обрабатывает ваши данные с помощью ИИ

Airparser превращает документы и электронные письма в структурированные поля, которые вы определяете в схеме, используя комбинированный конвейер извлечения данных — предварительную обработку, OCR, модели извлечения (включая собственные модели и улучшенные модели, специализированные для извлечения данных) и постобработку. Мы хотим точно объяснить, как этот конвейер защищает ваши данные, чтобы вам не приходилось просто верить нам на слово.

Эта страница дополняет нашу общую страницу Безопасность более подробным, техническим взглядом именно на ту часть конвейера, которая связана с ИИ.

Что делает ИИ в Airparser

Airparser — это не простая надстройка над чат-моделью. Извлечение объединяет несколько этапов — предварительную обработку, OCR, модели структурированного извлечения и постобработку/валидацию, — и ИИ используется в этом конвейере там, где он приносит наибольшую пользу: при интерпретации содержимого, различающегося по макету или формату, и его сопоставлении с полями вашей схемы. Здесь нет универсального чат-интерфейса и открытого промптинга ваших данных за пределами настроенной задачи извлечения.

Как документ обрабатывается шаг за шагом

  • Приём — документ поступает через загрузку, электронную почту, API или интеграцию в ваш почтовый ящик Airparser.
  • Предварительная обработка — файл нормализуется, а для отсканированных файлов или изображений выполняется OCR для создания текстового слоя.
  • Структурированное извлечение — документ сопоставляется с вашей схемой с помощью наших моделей и логики извлечения: сочетания собственных моделей и улучшенных/специализированных моделей — построенных на основе поставщиков, указанных на нашей странице субподрядчиков, — настроенных специально для извлечения данных из документов.
  • Постобработка — извлечённые данные проверяются и нормализуются в соответствии с типами полей вашей схемы, прежде чем они будут окончательно оформлены.
  • Доставка — результат сохраняется в вашем аккаунте и доступен через приложение, API или настроенный экспорт/webhook.

Почему мы сочетаем OCR, ИИ и постобработку

Каждый этап устраняет свою слабость. OCR сам по себе даёт лишь необработанный текст, но не понимание того, что этот текст означает или как он соотносится с вашей схемой. ИИ-модели хорошо интерпретируют смысл и работают с документами, макет или формулировки которых различаются, — с чем плохо справляются жёсткие шаблоны, — но сами по себе не гарантируют хорошо типизированный, проверенный результат. Постобработка закрывает этот пробел, проверяя типы, форматы и согласованность данных, прежде чем они попадут в ваш аккаунт. Сочетание всех трёх методов даёт более надёжные результаты, чем опора на какой-либо один из них.

Эмбеддинги и длинные документы

Эмбеддинги — это числовые представления текста, которые позволяют системе определить, какие части документа наиболее релевантны конкретному полю или запросу, не обрабатывая при этом весь документ целиком на каждом шаге.

Мы использовали эту технику, чтобы помочь эффективнее обрабатывать очень длинные документы. В настоящее время она применяется выборочно и остаётся скорее экспериментальной, чем стандартной частью каждого извлечения, — в будущем мы можем расширить её использование по мере развития технологии.

Наши модели извлечения

Наш конвейер извлечения использует сочетание собственных моделей и улучшенных, специализированных моделей, построенных на основе LLM-поставщиков, указанных на нашей странице субподрядчиков, — настроенных специально для извлечения данных из документов, а не для общего чата.

Обучение моделей и хранение данных

  • Мы никогда не обучаем и не дообучаем какие-либо модели на ваших данных и никогда не продаём ваши данные. Это постоянное обязательство, а не функция, зависящая от тарифного плана.
  • Наши соглашения с ИИ-субподрядчиками запрещают им использовать данные, отправленные для извлечения, для обучения своих моделей.

Шифрование и передача

Вся связь с нашими ИИ-субподрядчиками осуществляется через зашифрованные соединения (HTTPS/TLS 1.2+) — тот же стандарт, который мы применяем ко всем остальным частям нашей инфраструктуры.

Разделение данных

Документы, схемы и результаты каждого аккаунта Airparser логически изолированы от любого другого аккаунта. Обработка документа одного клиента никогда не раскрывает и не смешивает данные другого клиента.

Что остаётся под вашим контролем

  • Вы являетесь контролёром данных; Airparser и его ИИ-субподрядчики выступают исключительно в роли обработчика данных, действуя по вашим указаниям.
  • Вы можете в любой момент удалить любой документ, схему или весь свой аккаунт.
  • Настраиваемые политики хранения позволяют автоматически удалять обработанные данные в диапазоне от 1 до 180 дней.

Часто задаваемые вопросы

Является ли Airparser просто надстройкой над чат-моделью?

Нет. Извлечение выполняется через конвейер — предварительную обработку, OCR, модели структурированного извлечения и постобработку/валидацию — с использованием сочетания собственных моделей и улучшенных, специализированных моделей, построенных на основе поставщиков, указанных на нашей странице субподрядчиков, настроенных специально для извлечения данных из документов, а не для общего чата.

Обрабатывается ли исходный файл (например, отсканированный PDF или изображение), или только извлечённый текст?

Это зависит от документа и схемы, но содержимое документа — включая исходные файлы и изображения, когда это необходимо, — может обрабатываться напрямую нашими моделями извлечения. Такая обработка шифруется при передаче и никогда не используется для обучения.

Используете ли вы эмбеддинги или векторный поиск?

Мы выборочно использовали эмбеддинги, чтобы помочь эффективнее обрабатывать очень длинные документы. В настоящее время это ограниченная/экспериментальная практика, а не часть каждого извлечения.

Могут ли сотрудники Airparser читать мои документы?

Доступ к данным клиентов ограничен принципом минимальных привилегий, ограничен тем, что необходимо для поддержки или устранения неполадок, и регулярно проверяется. Подробнее см. на нашей странице Безопасность.

Используются ли мои данные для улучшения моделей Airparser или ИИ-поставщиков?

Нет. Мы не обучаемся на ваших данных, и наши договоры с ИИ-субподрядчиками также запрещают им это делать.

Что происходит с моими данными, если я удаляю документ?

Они немедленно удаляются из активных систем, а также из резервных копий и журналов в рамках настроенного вами срока хранения (1–180 дней).

Остались вопросы?

Если вам нужны дополнительные детали для собственной проверки безопасности или поставщиков, свяжитесь с нами по адресу [email protected].