https://youtu.be/uaplNOgVV9s?si=G0I3vYSkS611Mpze
올여름 일본 곳곳의 온라인 헌책방에 이상한 주문이 몰려들었습니다. 8월 무렵부터 하루 100권씩 책이 나가는 가게가 생겼고, 매출이 평소의 다섯 배로 뛴 날도 있었습니다. 다만, 팔려 나간 책에는 공통점이 없었습니다. 철학서와 의학서 옆에 에도시대 생활사와 30년 전 정계 이야기가 섞여 있었습니다. 닛폰TV 보도에 따르면 주문한 계정은 여럿이었지만 책은 모두 오카야마현의 한 물류센터로 배송됐습니다. 1,000권 넘게 판 간토 지방의 한 점주는 주문이 거의 같은 간격으로 들어온다며 사람보다 기계가 사 가는 것 같다고 말했습니다.

닛폰TV는 일본 최대 출판 도매상 닛판(日販)의 계열사가 지난해부터 미국으로 책 50톤 이상을 보낸 수출 기록도 찾아냈습니다. 헌책방 주문과 이 수출이 같은 구매자가 한 일인지는 아직 밝혀지지 않았습니다. 다만 작가들이 앤트로픽(Anthropic)을 상대로 낸 소송에서 이 회사의 내부 회의록이 공개됐는데, 여기에 앤트로픽이 2024년 11월 21일 닛판과 책 구매 계약을 맺었다는 기록이 있습니다.
비영리 연구기관 에포크 AI(Epoch AI)는 ‘인터넷에 공개된 글 가운데 사람이 쓴, AI 학습에 쓸 만한 글의 양을 약 300조 토큰으로 추산’합니다(토큰은 AI가 글을 나눠 읽는 최소 단위입니다). 지금 속도라면 최첨단 AI 모델들이 2026년에서 2032년 사이에 이 분량을 다 쓸 것으로 봅니다. 웹에는 새 글이 계속 올라오지만, 그 가운데 AI가 쓴 글의 비중이 빠르게 늘고 있습니다. AI가 쓴 글로 다시 학습한 모델은 세대를 거듭할수록 품질이 떨어집니다. 2024년 《네이처》에 실린 연구는 이를 '모델 붕괴(Model Collapse)'라고 불렀습니다.
그래서 AI 기업들은 출간 연도를 따지기 시작했습니다. 도서 데이터 업체 ISBNdb의 경우 2022년 이전에 인쇄된 책을 한 번에 1,000권에서 100만 권까지 AI 기업에 공급합니다. 챗GPT가 나오기 전에 찍은 책에는 AI가 쓴 문장이 들어 있을 수 없다는 계산입니다. 말하자면, 2022년 이전에 나온 책은 빈티지 와인처럼 양이 정해진 원자재가 됐습니다. (와인은 마시면 없어지지만 글은 여러 모델이 되풀이해 읽을 수 있으니 딱 맞는 비유는 아닙니다. 다만 종이책 원본은 스캔할 때 파쇄되어 낱장으로 해체된 뒤 버려지기 때문에 실제로 사라집니다.)
AI 기업이 책 한 권을 학습에 쓰는 비용은 그 책을 어떻게 손에 넣느냐에 따라 수백 배까지 벌어집니다. 2024년 11월 대형 출판사 하퍼콜린스는 일부 논픽션 도서를 3년 동안 AI 학습용으로 제공하기로 마이크로소프트와 계약했고, 권당 5,000달러를 저자와 출판사가 절반씩 나누기로 했습니다. 한편, 과거 해적판 사이트에서 책을 무단 수집했던 앤트로픽에 대한 소송 사례를 보면, 엔트로픽이 작가들의 집단소송에서 합의한 금액은 15억 달러였습니다. 이때, 대상 작품이 48만여 편으로, 이를 나눈 금액, 즉 권당 약 3,000달러를 물어낸 셈입니다. 그렇지만, 헌책을 사서 스캔하면 책값 몇 달러로 끝나고, 저자에게는 한 푼도 돌아가지 않습니다.
이 마지막 방법을 합법으로 인정한 것이 2025년 6월 미국 윌리엄 앨섭 판사의 결정입니다. 앨섭 판사는 앤트로픽이 사들인 종이책을 스캔한 행위를 **'공정이용(Fair Use)'**으로 봤습니다. 원본을 없앴으니(책 한권 자체를 파쇄), 책의 사본이 늘지 않았다는 이유였습니다. 헌책을 사고팔 때 저자가 받는 돈은 없습니다. '최초판매원칙'에 따라 적법하게 한 번 팔린 책은 누가 어디에 되팔든 저작권자가 막을 수 없기 때문입니다. 저자에게 돈이 가지 않는 가장 싼 길을 미국 법원이 열어 준 셈입니다.
앤트로픽도 처음부터 이 길을 택하지는 않았습니다. 법원 기록을 보면 앤트로픽은 2024년 봄 대형 출판사들과 라이선스 협상을 벌였지만 진전이 없자, 도매상과 소매상에서 도서를 대량으로 사들이는 쪽으로 돌아섰습니다.

2024년 9월 앤트로픽 회의록에 따르면, '성사 가능성 높음' 출판사 이름에는 ‘닛판’외에도 국내 출판 도매 업체 '북센(Booxen Korea)'의 이름이 적혀 있습니다. 이 거래가 실제로 이뤄졌는지는 확인되지 않았습니다. 하지만 해외 AI 기업이 한국 도매상에서 한국어 책을 사들여 미국에서 스캔한다면 앨섭 판결의 논리가 그대로 적용됩니다. 우리 저작권법도 한 번 적법하게 팔린 책은 저작권자의 허락 없이 되팔 수 있다고 정하고 있어(제20조 단서), 출판사가 이런 거래를 저작권으로 막기는 어렵습니다.
국내 AI 기업이 같은 책을 국내에서 해체해 스캔하고 학습에 쓴다면 사정이 다릅니다. 이런 행위가 우리 법의 공정이용(제35조의5)에 해당하는지 판단한 판례가 아직 없습니다. 정부가 최근 저작권 업계와 AI 업계에 '독자 AI 모델 등에 대한 형사책임 면제 방안 검토'를 과제로 내놓은 것도 그래서입니다. 국립중앙도서관은 저작권 문제가 풀린 자료로 학습용 텍스트를 만들어 독자 AI 프로젝트에 공급할 계획입니다. 하지만 독자 AI 5개 정예팀이 1차로 구축해 공개한 데이터는 약 1.56조 토큰으로, 에포크가 추산한 전 세계 공개 텍스트의 0.5% 남짓입니다(재는 방식이 다르기 때문에, 규모만 어림짐작으로 추산한 것입니다.).