귀사의 데이터에 대한 학습 없음 정책은 말하기 쉽습니다 - 이를 검증하는 12가지 질문

**귀사의 데이터에 대한 학습 없음(No training on your data)**은 공급업체가 고객이 요청한 결과를 제공하기 위해 콘텐츠를 처리하되, 이를 기계 학습 모델의 학습, 미세 조정(fine-tuning), 평가 또는 벤치마킹에 다시 사용하지 않음을 의미합니다. 귀하의 문서는 서비스의 입력값일 뿐, 제품을 위한 원재료가 아닙니다.

이러한 문구는 공급업체 입장에서 작성하는 데 아무런 비용이 들지 않기 때문에, 보안 검토자들은 더 이상 이 말만 믿지 않습니다. 아래는 이를 검증하는 12가지 질문과 이에 대한 Parseur의 답변입니다. 정직한 답변이 "저희에게 문의하시고 서면으로 확약받으세요"인 항목도 포함되어 있습니다.

Key Takeaways

  • 귀사의 데이터에 대한 학습 없음이란 콘텐츠가 처리만 될 뿐 모델에 재활용되지 않음을 의미합니다.
  • 어떤 공급업체든 이 말을 할 수 있으므로, 보안 검토는 명시된 하위 프로세서(subprocessor), 일 단위로 명시된 보존 기간, 익명화 데이터 예외 조항 등 검증 가능한 부분으로 이동했습니다.
  • Parseur는 고객 데이터를 AI 모델 학습에 재사용하거나 판매하지 않으며, EU에 호스팅된 GDPR 네이티브 환경을 제공하고, 문서 보존 기간을 1일부터 무제한까지 설정할 수 있도록 합니다.
  • SOC 2 Type II 및 HIPAA는 현재 진행 중이며 2026년 완료를 목표로 하고 있어, 현재는 인증되지 않았음을 의미합니다. 또한 Parseur는 제로 데이터 보존(Zero Data Retention) 공급업체가 아니며, 이 페이지에서는 귀하가 실질적으로 원하는 문서 파서가 왜 제로 데이터 보존이 될 수 없는지 설명합니다.

Why "We Never Train on Your Data" Stopped Meaning Anything

이제 모든 공급업체가 그렇게 말합니다. 바로 그것이 문제입니다.

마케팅 페이지에서 "저희는 귀하의 데이터로 학습하지 않습니다"라는 문구를 읽은 검토자는 위험 관리 대장에 기록할 수 있는 실질적인 정보를 아무것도 얻지 못합니다. 이 문장에는 범위도, 하위 프로세서의 이름도, 데이터 보존 수치도 없으며, 그 누구의 서명도 들어 있지 않습니다.

그 문장과 실제 계약 사이의 괴리는 꽤 넓습니다. 2,400개의 인기 있는 비즈니스 소프트웨어 제공업체를 분석한 DataGrail의 2026년 Privacy and AI Trends Report에 따르면, AI 기능을 광고하는 공급업체의 63.6%가 법적 문서 어디에도 제3자 AI 하위 프로세서를 공개하지 않았습니다.

이들 중 소수만이 실제로 공개할 하위 프로세서가 없는 경우입니다. 나머지는 이름 없는 공급망을 그냥 믿고 수용하라는 뜻이며, 외부에서는 이 두 그룹을 구별할 방법이 없습니다. 아래 질문들의 전체 목적이 바로 이것을 구별하는 것입니다.

따라서 유용한 질문은 더 이상 공급업체가 학습 금지 정책을 가지고 있는지 여부가 아닙니다. 문서화를 요구했을 때 그중 무엇이 살아남는지가 중요합니다.

Processing Versus Training, and Why Only One Is Reversible

업로드한 문서에는 두 가지 일이 일어날 수 있으며, 그 차이는 작업이 끝난 후 무엇이 남느냐에 있습니다.

  • 처리(Processing): 공급업체 인보이스에서 라인 항목(line items)을 추출하는 등 작업을 완료하기 위해 데이터가 실시간으로 사용됩니다. 작업이 끝나면 데이터는 미래의 학습을 위해 시스템에 다시 입력되지 않습니다.
  • 학습(Training): 모델을 개선하기 위해 귀하의 데이터가 주입되어, 귀하의 입력값이 모델 지식의 일부가 됩니다. 여기에는 실행 취소(undo)가 없습니다. 귀하의 콘텐츠를 다시 빼내려면 모델을 재학습해야 하는데, 그에 대한 예산을 책정한 사람은 아무도 없습니다.

이 두 가지의 경계가 모호해지면서 세 가지 문제가 발생했고, 이 문제들은 지속되고 있습니다. 기밀 문서가 이를 암기한 모델을 통해 재구성될 수 있었습니다. 귀하의 계약서를 학습한 모델이 귀하의 지적 재산을 흡수했기 때문에 소유권이 불분명해졌습니다. 그리고 규제가 강한 산업의 경우 클라이언트 데이터가 실제로 어디로 갔는지에 대한 가장 기본적인 감사 질문조차 대답할 수 없게 되었습니다.

학습 금지 정책은 이러한 모호함을 없애줍니다. 귀하의 데이터는 오직 요청된 작업에만 처리되고, 그 이상은 사용되지 않습니다.

Zero Data Retention, and Why Parseur Does Not Claim It

제로 데이터 보존(ZDR)은 제공업체가 메모리에서 요청을 처리하고 디스크에는 아무것도 쓰지 않음을 의미합니다. 입력값도, 출력값도, 콘텐츠 로그도 저장되지 않습니다. 이는 가능한 가장 엄격한 보안 태세이며, 구매 팀은 점점 더 학습 여부를 묻는 대신 이를 직접 요구하고 있습니다.

하지만 이 용어는 지속적으로 과대 포장되고 있으므로, ZDR이 일반적으로 무엇을 누락하는지 아는 것이 중요합니다.

  • 결제 메타데이터는 남습니다. 타임스탬프, 토큰 수, 지연 시간(latency)은 어딘가에 기록되어야 청구가 가능합니다.
  • 악용 및 안전 모니터링은 이 합의의 외부에 존재할 수 있으며, 이는 귀하가 전혀 안내받지 못한 인간의 검토 과정입니다.
  • 모든 엔드포인트(endpoint)가 ZDR 대상인 것은 아닙니다. 대상이 아닌 엔드포인트를 호출하는 것은 합의 밖으로 벗어나는 조용한 결정이며, 보통 계약서를 읽어본 적 없는 엔지니어에 의해 이루어집니다.

다음은 대부분의 공급업체 페이지에서 건너뛰는 부분입니다. Parseur는 제로 데이터 보존 제품이 아니며, 귀하가 추출을 다시 실행하거나 지난달의 결과를 검토할 수 있게 해주는 문서 파서는 사실상 제로 데이터 보존일 수 없습니다. 문서를 재처리하려면 그 문서가 여전히 존재해야 하기 때문입니다. 대신 Parseur는 요금제에 따라 1일부터 무제한까지 귀하가 제어할 수 있는 보존 기간을 제공하며, 기간이 만료되는 즉시 자동 삭제됩니다.

만약 공급업체가 전체 문서 기록과 제로 데이터 보존을 동시에 제공한다고 한다면, 둘 중 어느 것을 뺏어갈 것인지 물어보십시오.

The 12 Questions to Ask a Document Extraction Vendor About AI Training and Retention

Checklist infographic of the questions to ask a document extraction vendor about AI training, subprocessors and data retention
The questions to send your vendor

이를 공급업체 질문지(vendor questionnaire)에 복사해 넣으십시오. 공급업체가 이를 제대로 준비했다면 짧은 답변이 돌아올 것이고, 그렇지 않다면 긴 침묵이 돌아올 것입니다.

  1. 당사가 업로드한 문서, 추출된 필드, 메타데이터, 수정 사항 또는 출력값을 모델의 학습, 미세 조정, 평가 또는 벤치마킹에 사용합니까?
  2. 해당 답변은 당사 데이터의 익명화, 비식별화, 집계 또는 파생된 버전에도 적용됩니까?
  3. 당사의 문서를 수신하는 제3자 AI, OCR 또는 클라우드 하위 프로세서는 무엇입니까? 각각의 이름을 명시하고 어디에서 실행되는지 말씀해 주십시오.
  4. 해당 하위 프로세서들은 당사의 데이터를 학습이나 서비스 개선을 위해 사용하지 못하도록 계약상 금지되어 있습니까?
  5. 원본 문서, 추출된 필드, 처리 로그, 오류 로그, 캐시 및 백업 등 각 데이터 유형은 얼마나 오래 보관됩니까?
  6. 당사가 보존 기간을 직접 구성할 수 있습니까? 제공하는 가장 짧은 보존 기간은 얼마입니까?
  7. 필요 시 온디맨드로 데이터를 삭제할 수 있습니까? 서면으로 보장된 삭제 SLA는 어떻게 됩니까?
  8. 삭제가 백업본에도 적용됩니까? 백업본이 덮어씌워지기까지 얼마나 걸립니까?
  9. 귀사의 직원이나 계약업체가 어떤 상황에서 당사의 문서를 열람할 수 있으며, 해당 접근은 로깅됩니까?
  10. 고객 데이터가 개발, 테스트, QA 또는 데모 환경으로 복사되는 경우가 있습니까?
  11. 당사의 데이터는 어디에 저장되고 처리됩니까? 해당 지역을 벗어날 수 있습니까?
  12. 이러한 약속이 서명된 DPA(데이터 처리 계약) 또는 MSA(기본 서비스 계약)에 명시됩니까? 또한 두 내용이 충돌할 경우 온라인 약관보다 우선합니까?

매끄러운 단락 하나로 열두 가지 질문에 모두 답변하는 공급업체는 그저 추측해서 말하고 있을 뿐입니다. 이름, 수치, 조항 참조를 포함하여 답변하는 공급업체는 이전에 동일한 질문을 받아본 적이 있는 곳입니다.

Parseur's Answers, Including the Awkward One

Infographic showing how Parseur processes customer documents without using them to train AI models
How Parseur implements this policy

Parseur는 문서 파서입니다. 공급업체 인보이스를 보내면 구조화된 필드를 반환하며, 고객 데이터로 학습하지 않습니다. 위 질문들에 매핑된, 이 인보이스에 일어나는 과정은 다음과 같습니다.

Question Parseur's answer
1. Model training 고객 데이터는 Parseur의 AI 모델을 학습시키는 데 절대 재사용되지 않으며 결코 판매되지 않습니다. 모든 추출은 귀하의 출력값을 생성하기 위해서만 실행되며 다른 목적은 없습니다.
5 and 6. Retention 문서 보존 기간은 요금제에 따라 1일부터 무제한까지 구성할 수 있습니다. 문서는 보존 기간이 종료되면 자동으로 삭제되며, 귀하가 요청할 때 즉시 삭제됩니다.
11. Location EU-호스팅 및 GDPR 네이티브 환경을 제공하며 데이터 레지던시는 EU 내로 유지됩니다. 호스팅 데이터 센터는 ISO 27001 인증을 받았으며, 이는 Parseur의 자체 인증이 아닌 데이터 센터의 인증입니다.
12. Roles and paper 귀하는 데이터 컨트롤러이고 Parseur는 데이터 프로세서이며, Data Processing Agreement에서 허용되는 범위를 규정합니다.
Regulations EU GDPR, 영국 GDPR, 캘리포니아 CCPA 및 CPRA, 싱가포르 PDPA를 준수합니다. 자세한 내용은 Privacy and GDPR at Parseur에서 확인하세요.
Certifications SOC 2 Type II 및 HIPAA 프로그램은 현재 진행 중이며 2026년에 완료될 예정입니다. 현재 Parseur는 두 가지 모두에 대해 인증을 받지 않았습니다.
Security controls 전송 및 저장 중 암호화, 역할 기반 권한 및 감사 추적, 정기적인 제3자 보안 테스트를 제공합니다.
2, 3, 4, 7, 8, 9 and 10 이 페이지에서는 답변하지 않습니다. 저희에게 문의하여 답변을 받은 후, 다음 분기에 저희가 몰래 수정할 수도 있는 웹페이지 대신 서명된 계약서에 해당 내용을 명시하십시오.

로고가 더 멋져 보일 자리에 "진행 중"이라고 적는 것은 약간의 허세를 포기하는 대신 많은 신뢰를 얻게 해줍니다. 과장된 인증을 하나라도 발견한 검토자는 나머지 11개의 답변도 믿지 않게 되며, 그것은 당연한 일입니다.

이러한 행 중 두 가지는 누구와 이야기하기 전에도 검증할 수 있습니다. 데이터 처리 계약서(Data Processing Agreement)는 서명하기 전에 전체를 읽어볼 수 있는 문서이며, 보존 기간은 약속이 아니라 귀하의 계정에서 직접 확인할 수 있는 설정입니다.

무료 계정 만들기
Parseur로 시간과 노력을 절약하세요. 문서 처리를 자동화하세요.

What OpenAI, Microsoft, Anthropic, AWS and Google Actually Commit To

기업 구매자들은 전체 시장을 명시적인 보증을 요구하는 방향으로 이끌었고, 이제 좋은 답변의 형태가 정착되었습니다.

  • OpenAI는 제품별로 다릅니다. 소비자용 ChatGPT 데이터는 모델 개선에 사용될 수 있지만, 엔터프라이즈 및 API 티어는 기본적으로 제외되며 옵트아웃 제어가 문서화되어 있습니다.
  • Microsoft는 격리에 의존합니다. Microsoft 365용 Copilot과 Azure OpenAI는 파운데이션 모델 학습에서 고객 콘텐츠를 제외하고 일시적인 처리 데이터에 대한 기본 보존 기간을 게시합니다.
  • Anthropic은 엔터프라이즈 데이터로 학습하지 않겠다고 공개적으로 약속합니다.
  • Google Cloud 및 AWS는 데이터 거버넌스 약관에서 Document AI 및 Textract에 대한 학습 제외를 모두 게시하지만, AWS는 기본 설정 대신 귀하가 조직 수준의 명시적 옵트아웃 정책을 적용하도록 요구합니다. 기본적으로 제외되는 것과 누군가 기억해서 클릭해야 제외되는 것은 같은 약속이 아닙니다.

이들이 공통적으로 가지고 있는 점에 주목하십시오. 대답은 블로그 게시물이 아닌 거버넌스 문서에 존재하며, 지정된 기본값과 함께 제공됩니다. 그것이 기준이며, 이 페이지에서 달성하고자 하는 목표이기도 합니다.

Why This Question Now Blocks Purchases

구매자들은 단지 호기심에 묻는 것이 아닙니다. The Futurum Group의 2025년 설문 조사에 따르면 조직의 52%가 AI 공급업체의 기술적 전문성을 우선시하며, 데이터 처리 및 프라이버시 제어가 51%로 그 뒤를 바짝 쫓고 있습니다. 같은 기간, 2025 Investment Management Compliance Testing Survey에 따르면 컴플라이언스 담당자의 57%가 AI 사용을 가장 큰 컴플라이언스 우려 사항으로 꼽았고, PwC's 2025 AI agent survey에 따르면 비즈니스 리더의 28%가 AI 에이전트에 대한 신뢰 부족을 더 넓은 배포의 가장 큰 장벽으로 평가합니다.

이러한 수치 아래 대중의 분위기는 더욱 차갑습니다. Protecto에 따르면 성인의 약 70%는 기업이 AI를 책임감 있게 사용할 것이라고 신뢰하지 않으며, 80% 이상은 자신의 데이터가 어느 정도 오용될 것으로 예상합니다. 귀하의 고객은 이미 최악의 상황을 가정하고 있으며, 이것이 데이터 오용 사고가 벌금으로 이어지기 훨씬 전에 평판을 잃게 만드는 이유입니다.

이것이 이 모든 내용을 서면으로 작성해야 하는 진짜 이유입니다. 학습 금지 정책은 비교 표에 추가하는 단순한 기능이 아닙니다. 보안 검토자가 서명할지 여부를 결정짓는 핵심 요소이며, 검토자는 단락에 서명하지 않습니다. 그들은 조항에 서명합니다.

그러니 Parseur에 12개의 질문을 보내고, 후보 명단에 있는 다른 모든 업체에도 동일한 12개의 질문을 보내십시오. Data Processing Agreementretention settings on your plan부터 시작하십시오. 비교야말로 핵심이며, 우리는 다른 업체들을 대체해서라기보다 그들과 나란히 비교되고 싶습니다.

마지막 업데이트

더 알아보기

이런 내용도 관심 가질 수 있습니다

시작하기

문서 데이터 추출,
이제 자동화하세요.

무료로 시작해, Parseur가 실제 업무에 어떻게 맞아 들어가는지 직접 확인해 보세요.

모델 학습 필요 없음
어떤 문서든 데이터 입력을 자동화
클릭 몇 번으로 시작, API로 확장

자주 묻는 질문

아래 질문들은 보안 검토자 및 구매 팀이 문서 추출 공급업체에 실제로 보내는 질문들입니다. 여기서는 짧은 답변을 제공하며, 계약상 답변은 데이터 처리 계약서(Data Processing Agreement)에서 확인할 수 있습니다.

귀사의 데이터에 대한 학습 없음(No training on your data)은 공급업체가 고객이 요청한 결과를 제공하기 위해 콘텐츠를 처리하되, 이를 기계 학습 모델의 학습, 미세 조정(fine-tuning), 평가 또는 벤치마킹에 다시 사용하지 않음을 의미합니다. 귀하의 문서는 서비스의 입력값일 뿐, 제품을 위한 원재료가 아닙니다.

제로 데이터 보존(ZDR)은 제공업체가 메모리에서 요청을 처리하고 디스크에는 아무것도 쓰지 않음을 의미합니다. Parseur는 제로 데이터 보존이 아니며, 추출을 다시 실행하거나 과거 결과를 검토할 수 있는 문서 파서 중 이를 정직하게 주장할 수 있는 곳은 없습니다. 대신 Parseur는 요금제에 따라 1일부터 상향 조정할 수 있는 구성 가능한 보존 기간을 제공합니다.

Parseur는 EU-호스팅 및 GDPR 네이티브 환경을 제공하며 데이터 레지던시는 EU 내로 유지됩니다. 호스팅 데이터 센터는 ISO 27001 인증을 받았으며, 이는 Parseur의 자체 인증이 아닌 데이터 센터의 인증입니다.

귀하는 데이터 컨트롤러이고 Parseur는 데이터 프로세서입니다. Parseur는 데이터 처리 계약(Data Processing Agreement)의 조건에 따라 귀하를 대신하여, 귀하의 지침에 따라 데이터를 처리합니다.

자동으로 적용되지는 않으며, 이 부분에서 대부분의 정책이 조용히 새어나갑니다. 귀하의 데이터로 학습하지 않겠다고 약속하면서도, 해당 데이터의 익명화, 비식별화, 집계 또는 파생된 버전에 대해서는 학습할 권리를 유보하는 공급업체가 많습니다. 이 예외 조항을 명시적으로 밝히고 차단하도록 요구하세요.

두 가지 핵심 원칙을 직접적으로 지원합니다. 목적 제한(Purpose limitation)은 데이터가 요청한 작업에만 사용됨을 의미하고, 데이터 최소화(data minimisation)는 나중에 노출될 2차 사본이 존재하지 않음을 의미합니다. 두 원칙 모두 데이터 처리 계약서를 대체할 수는 없지만, 학습 금지 약속이 없다면 입증하기가 훨씬 어렵습니다.

아니요. 고객 데이터는 Parseur의 AI 모델을 학습시키는 데 절대 재사용되지 않으며 결코 판매되지 않습니다. 모든 추출은 귀하의 출력값을 생성하기 위해서만 실행되며 다른 목적은 없습니다.

귀하가 지정한 기간만큼 보관합니다. 문서 보존 기간은 요금제에 따라 1일부터 무제한까지 구성할 수 있으며, 보존 기간이 종료되면 문서는 자동으로 삭제됩니다. 필요 시 온디맨드로 삭제할 수도 있습니다.

EU GDPR, 영국 GDPR, 캘리포니아 CCPA 및 CPRA, 싱가포르 PDPA를 준수합니다. SOC 2 Type II 및 HIPAA 컴플라이언스 프로그램은 현재 진행 중이며 2026년에 완료될 예정으로, 현재 Parseur는 두 가지 모두에 대해 인증을 받지 않았습니다.

각각의 이름을 명시하고, 데이터를 처리하는 위치, 데이터 보관 기간, 학습 목적으로 콘텐츠를 사용하는 것이 계약상 금지되어 있는지 물어보세요. 2,400개의 비즈니스 소프트웨어 제공업체를 분석한 2026년 DataGrail의 자료에 따르면, AI 기능을 광고하는 공급업체의 63.6%가 법적 문서 어디에도 제3자 AI 하위 프로세서를 공개하지 않았습니다.

개인정보 처리방침이 아닌 데이터 처리 계약서(Data Processing Agreement)나 기본 서비스 계약(Master Services Agreement)에 명시하고, 우선순위 조항을 추가하여 서명된 문서가 예고 없이 변경될 수 있는 온라인 약관보다 우선하도록 하세요.

계약서에 서명하기 전에 모든 공급업체에 이 질문을 하십시오. 삭제 시 백업, 로그 및 캐시까지 완전히 삭제되는지, 그리고 그 과정에 얼마나 걸리는지도 포함해야 합니다. Parseur를 사용하면 귀하가 보존 기간을 통제하고 온디맨드로 문서를 삭제할 수 있습니다.