블로그
인사이트2026. 8. 10.·전병욱

비문학 도서가 AI 학습 데이터로 더 가치 있는 이유

비문학 도서는 AI 학습 데이터 시장에서 소설이나 시집보다 훨씬 높은 단가에 거래되고 있습니다. 이유는 단순합니다. LLM(대형 언어 모델)이 사실에 기반한 추론을 하려면, 사실에 기반한 텍스트가 필요합니다. 그런데 인터넷에 넘쳐나는 텍스트 대부분은 품질이 고르지 않거나, 오류가 섞여 있거나, 출처가 불분명합니다. 수십 년간 편집자와 전문가의 검수를 거친 비문학 도서는 이 문제를 해결하는 드문 자원입니다.

AI가 할루시네이션을 일으키는 진짜 원인

AI가 잘못된 정보를 자신 있게 말하는 '할루시네이션' 문제의 뿌리는 학습 데이터의 품질에 있습니다. 모델이 신뢰할 수 없는 데이터로 학습하면, 신뢰할 수 없는 답변을 생성합니다. AI 기업들이 고품질 데이터를 확보하기 위해 수백만 달러를 투자하는 이유가 여기에 있습니다. 비문학 도서는 구조적으로 이 문제를 해소합니다. 의학서, 법률 교재, 역사서, 경제 분석서는 단순한 텍스트가 아닙니다. 전문 저자가 작성하고, 편집자가 검토하고, 법무팀이나 학술 심사를 거친 사실 검증 문서입니다. AI 기업 입장에서는 웹 스크래핑으로는 절대 얻을 수 없는 구조화된 지식의 보고입니다.

소설과 비문학의 데이터 가치는 무엇이 다른가

소설은 AI 학습에 무용하지 않습니다. 문체, 서사 구조, 감정 표현을 학습하는 데 유효합니다. 그러나 소설의 문장은 의도적으로 비현실적이거나 주관적입니다. '내 심장이 폭발할 것 같았다'는 문장은 문학적 가치가 있지만, 의학 AI가 학습해서는 안 되는 문장입니다. 반면 비문학 도서는 다릅니다.

  • 사실 진술이 명확하게 구분됩니다 — '2023년 기준 글로벌 탄소 배출량은 X톤이었다'처럼 검증 가능한 형태로 쓰입니다
  • 개념 간 관계가 체계적으로 서술됩니다 — 교재와 전문서는 원인-결과, 정의-예시 구조를 유지합니다
  • 전문 어휘가 정확하게 사용됩니다 — AI가 법률, 의학, 과학 용어를 올바르게 이해하려면 해당 분야 전문서가 필수입니다
  • 출처와 근거가 내재되어 있습니다 — 참고문헌과 각주는 AI가 주장의 신뢰도를 가중치로 학습하는 데 활용될 수 있습니다

Wiley나 Bloomsbury 같은 학술·전문 출판사들이 AI 라이선싱 계약에서 더 높은 단가를 확보하고 있는 것은 우연이 아닙니다. 멘탯이 앞서 다룬 Wiley의 AI 라이선싱 실적Bloomsbury의 수익 증명 사례에서도 학술·비문학 카탈로그를 가진 출판사가 더 유리한 조건으로 협상하고 있다는 패턴이 반복됩니다.

출판사가 지금 해야 할 것

비문학 도서의 높은 AI 데이터 가치를 실제 수익으로 전환하려면 두 가지가 필요합니다. 첫째, 자신이 보유한 카탈로그의 가치를 정확하게 파악해야 합니다. 어떤 분야의 도서가 어떤 AI 학습 목적에 부합하는지, 어떤 타이틀이 사실 밀도가 높고 전문성이 검증된 형태인지를 분류해야 합니다. 둘째, AI 기업과의 협상에서 이 가치를 근거로 제시할 수 있어야 합니다. '우리 책이 잘 팔린다'는 논리가 아니라, '우리 데이터가 귀사의 할루시네이션 문제를 줄일 수 있다'는 논리로 접근해야 합니다. 멘탯은 출판사가 보유한 비문학 콘텐츠의 AI 학습 데이터 가치를 평가하고, AI 기업과의 라이선싱 협상을 지원합니다. 카탈로그 분석부터 계약까지, 출판사 서비스에서 확인하실 수 있습니다.

멘탯과 함께 시작하세요

AI 시대, 도서 콘텐츠의 새로운 가능성을 열어보세요

제휴가 궁금해요