결론: 문제의 핵심은 “판매된 책이 무엇으로 변화하는가”에 있다.
선생님: “먼저 결론부터 말씀드리겠습니다. 니케이 크로스테ック 기사에 보도된 내용은, 대형 출판 도매업체인 히판이 미국 AI 기업 Anthropic에 AI 학습용으로 추정되는 엄청난 양의 책을 판매하는 계약을 체결했다는 내용입니다. 보도에 따르면, Anthropic 등 AI 기업들이 책을 구매하여 제본, 스캔, 전자 데이터화한 후 AI 학습에 활용하고 있다는 것이 미국 법원 자료에서 밝혀진 것입니다.”
유키: “갑자기 걸리는 건데, ‘책을 사다’라는 단계까지만은 괜찮은데. 문제는 그 다음의 ‘페이지를 잘라내고 스캔해서 AI 학습’이라는 부분이에요?”
선생님 말씀이 맞습니다. 여기서 독자들이 주목해야 할 점은 종이책의 판매와 그로부터 만들어지는 디지털 데이터의 이용이 같은 이야기처럼 보이지만 실제로는 다른 논점을 포함하고 있다는 것입니다. 서점에서 책을 구매하면 그 책을 읽거나, 밑줄을 긋거나, 중고로 판매하는 등 일상적으로 행해지는 행동들이 있습니다. 하지만 그 책을 대량으로 잘라내어 기계가 처리할 수 있는 데이터로 바꾸고 AI 모델의 학습 자료로 활용한다면 저자, 출판사, 유통, 독자, AI 기업의 이해관계가 한 번에 교차하게 됩니다.
유키:「그렇군요. ‘샀으니 좋겠네’라는 말만으로는 끝이 아니에요.”
선생님 말씀처럼, 이번 일의 심각성은 AI 개발이 “정보를 수집하고 읽는” 단계에서 “사회에 존재하는 지식 자원을 어떻게 확보할 것인가”의 단계로 진입했음을 보여주는 것입니다. 책은 단순한 종이 묶음이 아닌, 저자의 노력, 편집자의 판단, 출판사의 투자, 유통업체와 서점의 유통망, 독자의 신뢰가 쌓여 만들어진 문화적인 상품입니다. 이러한 것이 AI 학습 데이터라는 또 다른 가치로 전환될 때, 누가 만족하고, 누가 보상을 받으며, 어느 정도의 투명성이 필요한지가 문제됩니다.
발생한 일:일본판람(닛반), 앤트로픽, 그리고 소송 자료
유키:「먼저 등장인물을 정리하고 싶어요. 니반은 무슨 일을 하는 회사인가요?」
선생님: “니반(日本出版販売)은 공식적으로 일본의 출판 유통을 지원하는 대규모 도매업체입니다. 도매업체는 출판사와 서점 사이에 위치하여 책의 유통을 담당하며, 출판사에서 만든 책을 서점에 전달하고 판매 및 반품 시스템을 지원하는 중요한 존재입니다. 독자에게는 잘 보이지 않지만, 일본의 책 흐름을 지탱해 온 중요한 주체입니다.”
유키가 “그날 판이 앤트로픽에 책을 팔았다고 하더라. 앤트로픽은 클로드 AI를 만들고 있는 기업이지?”
선생님 “이 정도면 충분합니다. Anthropic은 생성 AI 서비스인 Claude로 잘 알려진 미국의 AI 기업입니다. 니케이 크로스테ック 기사에 따르면, 미국 법원 자료를 통해 일본판(니販)이 Anthropic에 대량의 책을 판매하는 계약을 맺고 있었던 것이 밝혀졌습니다. 또한, AI 기업이 구매한 책을 절단, 스캔, 전자 데이터화하여 AI 학습에 활용하고 있었다는 내용도 보도되었습니다.”
유키:「쌀판 출판 거래는 거절당한 사례도 있었다고 하더라. 그래서 더 걱정이 되는 부분이다. 미국 측이 거절했음에도 불구하고 일본 측이 판매했다는 식으로 보이는 점이 좀 이상해.”
선생님: “그 부분은 신중하게 읽어야 합니다. 제목만으로는 미국 측 저자는 윤리적으로 거부하고, 일본 측 저자는 수용했다는 단순한 선악의 모습으로 치부하기 쉽습니다. 하지만, 저자별 계약 조건, 판매처 심사, 상거래 관행, 당시 AI 학습 활용에 대한 이해, 법적 위험에 대한 인식 등은 다릅니다. 우리가 확실하게 말할 수 있는 것은, 최소한 보도 당시 기준으로, Anthropic이 AI 학습에 활용하기 위한 도서 조달을 진행하고 있었으며, 그 중에는 일반전(日販)과의 계약이 포함되었을 가능성이 있다는 점입니다.”
유키는 “작가나 출판사 입장에서 보면 ‘독자에게 판매한 것처럼 느껴졌지만, AI의 소재로 활용된’ 상황일 수도 있겠지”라고 말했다.
선생님께서는 말씀하시길, “바로 거기なんです. 판매라는 행위가 성립하더라도 ‘이해’라는 의미에서는 또 다른 문제가 남아 있습니다. 한 권의 종이책을 사는 독자와 AI 기업이 대량으로 구매하여 데이터화하는 행위는 사회적 의미가 상당히 다릅니다. 전자는 작품의 소비이며, 후자는 작품을 바탕으로 다른 시스템을 만드는 데 사용되는 입력물과 유사한 괴리감을 낳습니다.”
왜 지금인가: AI는 “학습 데이터의 질”을 두고 경쟁하는 단계에 접어들었다.
유키: “왜 지금, 이런 이야기가 계속 나오는 걸까요? AI는 인터넷상의 정보로 학습한다는 인식이 있었죠.”
선생님: “훌륭한 질문입니다. 생성 AI의 성능 경쟁에서는 모델의 규모나 계산 자원뿐만 아니라 학습 데이터의 질이 매우 중요합니다. 인터넷에는 방대한 양의 텍스트가 있지만, 모두 정확하고 편집되어 체계화된 것은 아닙니다. 책은 저자, 편집자, 교정, 출판사의 과정을 거친 정보입니다. 전문 서적, 문학 작품, 번역서, 실용서, 아동 문학까지, 다양한 언어 표현과 지식이 담겨 있습니다. AI 기업에게 보면, 책은 고품질의 학습 자료가 될 수 있습니다.”
유키:「그건 AI 기업에게는 정말 귀중한 자원이라고 할 수 있죠.»
선생님 말씀이 맞습니다. 다만, 그곳에 저작권, 계약, 윤리 문제가 복잡하게 얽히게 됩니다. 특히 대량으로 데이터화하는 경우에는 단순한 독서와는 전혀 다른 규모와 목적을 갖습니다. 인간이 책을 읽고 영향을 받아 다음 작품이나 일에 활용하는 것은 오래전부터 있었습니다. 하지만 AI 학습에서는 방대한 텍스트를 통계적으로 처리하고, 모델의 능력으로 통합하며, 다수의 이용자에게 서비스 형태로 제공되어 기업 가치에도 연결됩니다.
유키:「사람도 책에서 배우는 것처럼 AI도 똑같이 같은 방식으로 설명할 수 있다는 건 다소 억지스럽게 느껴집니다.”
선생님 말씀에 동의합니다. 유사한 부분은 있지만 완전히 같다고 단정하기 어렵습니다. 인간의 학습은 한 가지 경험에 갇히기 쉬운 반면, AI 모델은 한 번 학습하면 많은 사람들이 사용하는 제품의 핵심이 됩니다. 또한, 학습에 사용된 개별 책이 어떻게 영향을 미쳤는지 뒤따라 추적하는 것은 어렵습니다. 따라서 학습 데이터 획득 방식에는 투명성과 책임성이 요구됩니다.
왜 중요할까: 출판 유통의 신뢰가 흔들리는 가능성
최근 출판 업계에서 유통 경로의 투명성, 출판사의 책임과 같은 출판 유통의 신뢰가 흔들리는 문제점이 제기되고 있다. 구체적으로 다음과 같은 요인들이 거론되고 있다.
* **전자책 보급과 유통 경로 복잡화:** 전자책의 판매 플랫폼이 다양화되어 출판사의 직접 판매, 온라인 서점, 구독 서비스 등 여러 경로를 통해 독자에게 책이 전달되면서 유통 경로의 투명성이 저하되고 있다는 지적이다.
* **출판사의 책임 소재 모호화:** 전자책 판매 플랫폼의 개입으로 인해 책의 판매 가격, 인쇄비, 배송비, 로열티 등 수익 배분과 관련된 출판사의 책임 소재가 불분명한 문제가 발생하고 있다.
* **유통업체 의존도 증가:** 일부 출판사는 유통업체에 대한 의존도가 높아 유통업체의 경영 상황이나 전략에 따라 출판사의 수익이 좌우될 위험이 높아지고 있다는 지적이다.
* **독자 니즈 다양화와 유통 과제:** 독자 니즈의 다양화에 대응하기 위해 다양한 장르의 책이 발행되고 있지만, 그 결과 유통 경로의 선택지가 다양화되어 출판사의 유통 전략이 복잡해지는 과제가 발생하고 있다.
이러한 요인들이 복합적으로 작용하여 출판 유통의 신뢰가 흔들리고 출판 업계 전체의 지속 가능성에 영향을 미칠 수 있다는 우려가 제기되고 있다.
향후 출판 업계는 유통 경로의 투명성 향상, 출판사의 책임 명확화, 유통업체와의 긍정적인 관계 구축, 독자 니즈에 대한 유연한 대응 등 다양한 과제에 직면하게 될 것이다. 또한 정부와 관계 기관은 출판 유통의 건전한 발전을 지원하기 위한 정책을 추진해 나가야 할 것이다.
유키:「하지만 법적으로 문제가 있는지 여부는 나라마다 다를 텐데. 결국에는 재판으로 결정되는 문제일 뿐이야?」
선생님: “법은 중요합니다. 하지만 이번 논점은 법만으로는 해결되지 않습니다. 출판 유통은 출판사, 도매업체, 서점, 독자의 신뢰로 이루어집니다. 저자와 출판사는 독자에게 전달하기 위해 도매업체에 책을 공급합니다. 만약 그 유통 과정에서 많은 책이 AI 학습용으로 판매될 가능성이 있다면, 출판사 측은 ‘어떤 부분을 얼마나 파악할 수 있는지’, ‘판매처를 선택할 수 있는지’, ‘계약 조건으로 제한할 수 있는지’ 등을 고려할 수밖에 없습니다.”
유키: “출판사는 단순히 책을 판매하는 것뿐만 아니라, 신뢰의 연결고리 역할을 하기도 한다.”
선생님 말씀이 맞습니다. 책의 유통은 물류이면서 동시에 문화의 기반 시설입니다. 예를 들어 독자는 서점에 진열된 책들이 기본적으로 읽기 위해 팔리는 것으로 생각하고, 출판사는 독자에게 전달한다는 전제하에 인쇄부수와 유통 경로를 고려합니다. 여기에 AI 기업의 대량 구매가 억지질리게 들어오면, 같은 ‘판매’ 개념도 의미가 달라집니다. 물론 기업이 책을 구매하는 것 자체가 나쁜 것은 아닙니다. 연구기관, 도서관, 기업 교육 자료, 미디어 자료 등 단체에서 책을 구매하는 경우도 많습니다. 문제는 구매 후 이용 목적이 작품의 시장이나 저자에게 어떤 영향을 미치는지에 대한 것입니다.
유키: “가장 이상한 점은, 그걸 만든 사람에게 보상을 기대하기 어렵다는 데 있을 것 같아요. AI가 책을 통해 똑똑해지고 기업이 이익을 얻는다면, 저자에게는 그에 대한 보상이 있어야 하죠.”
선생님께서는 현재 시스템이 충분히 정비되어 있다고 말씀드리기는 어렵습니다. 개별 허가, 포괄 라이선스, 집단 관리, 옵트아웃, 보상금과 같은 제도 설계 등 고려할 수 있는 선택지는 많습니다. 하지만 인공지능 개발 속도가 제도나 상례에 뒤쳐져 있다는 점을 보여주는 사례로 해석할 수 있습니다. 이번 보도는 이러한 괴리가 출판 유통 현장에 나타난 예시로 읽힙니다.
삶에 미치는 영향: 독자분들께도 무관심하지 않은
유키:「그런데, 일반 독자들에게는 관련이 있을까? AI 기업과 출판 업계의 이야기처럼 보이지만」
선생님: “관계가 상당히 깊습니다. 첫째, 읽을 책의 미래와 관련이 있습니다. 만약 저자나 출판사가 작품이 충분한 설명이나 보상 없이 AI 학습에 사용된다고 느낀다면, 출판에 대한 의욕이나 투자 결정에 영향을 미칠 수 있습니다. 특히 전문성이 높은 책, 오랜 시간 동안 취재한 노픽션, 번역이나 교정에도 많은 노력이 들어가는 책처럼 제작하는 데 비용이 많이 들죠. 그러한 책이 줄어들면 독자들이 접할 수 있는 지적 폭도 좁아질 것입니다.”
유키: “AI가 편리해지는 대신, 그 근본이 되는 책들이 점점 더 얇아질 수 있다는 의미인가?”
선생님: “가능성으로는 있습니다. 물론, AI가 출판을 돕는 면도 있습니다. 조사, 번역 지원, 교정 보조, 독자와의 만남 창출 등, 잘 활용한다면 제작과 유통을 지지하는 도구로 활용될 수 있습니다. 따라서 AI와 출판이라는 단순한 대립은 아닙니다. 중요한 것은 AI가 지식 생태계에서 단방향으로 지식을 흡수하는 일이 없도록, 이익과 책임의 순환을 만드는 것입니다.”
유키: “두 번째 작품의 영향은 무엇입니까?”
선생님: “AI 서비스의 신뢰성에 대해 말씀드리는 것입니다. 관련 기사에서는 메타의 신규 AI 에이전트 ‘Muse’가 기밀 컴퓨팅과 안전 설계를 선보이고 있다는 내용이 소개되고 있습니다. 또 다른 보도에서도 Muse는 사용자 대신 이메일 전송이나 여행 예약 등을 수행하는 AI 에이전트로서 설명되며, 개인 정보 및 보안에 대한 관심이 집중되고 있습니다. 이는 이번 책의 주제와는 별개로 보이지만, 근본적으로는 연결되어 있습니다.”
유키: “어떻게 연결하는 거지?”
선생님: “AI가 사회에 깊숙이 들어오면서 사용자는 두 가지를 크게 염두에 둡니다. 하나는 ‘이 AI가 어떤 데이터를 기반으로 만들어졌는가’ 하는 점이고, 다른 하나는 ‘이 AI에 자신의 정보나 행동을 맡겨도 안전한가’ 하는 점입니다. 학습 데이터의 조달이 불투명하다면 AI 기업에 대한 신뢰는 흔들리게 됩니다. 반대로, 개인 정보 처리나 에이전트의 행동 통제가 부족하다면 편리함보다는 오히려 사용하기 불편할 것입니다. AI의 보급에는 성능뿐만 아니라 데이터의 출처, 이용 목적, 보호 메커니즘이 반드시 필요합니다.”
관련 정보에서 드러나는 핵심 쟁점: IT 부문과 경영은 외면할 수 없는 문제이다.
유키: “또 다른 관련 기사에는 IT 부서가 경영 전략의 핵심이 될 가능성에 대한 내용이 있었지. 이건 관련 있는 건가?”
선생님: “직접적으로는 다른 기사이지만, AI 시대의 기업 경영라는 의미에서는 관련이 있습니다. 이전에는 IT 부서는 비용 센터처럼 여겨지는 경우도 있었습니다. 하지만 AI를 사업에 통합하는 시대가 되면서 데이터를 어떻게 다루고, 외부 서비스를 어떻게 선택하며, 저작권 및 개인 정보 위험을 어떻게 관리할지가 경영 판단이 됩니다. IT 부서는 단순히 시스템을 작동시키는 부서가 아니라, 사업의 신뢰를 설계하는 부서로 발전해 나갈 것입니다.”
유키:「결국, AI를 사용하는 기업은 ‘편리해서 도입했다’라고 쉽게 생각할 수 없겠지?”
선생님께서는 기업이 생성 AI를 도입할 때 모델 학습 데이터의 출처, 입력한 내부 정보의 처리, 결과물의 저작권 위험, 고객 데이터 보호, 감사 가능성 등을 확인해야 한다고 말씀하셨습니다. 메타의 Muse와 같은 에이전트형 AI가 확산되면 AI가 정보를 읽는 것뿐만 아니라 예약, 전송, 구매와 같은 행동까지 수행하게 될 것이므로, 오작동이나 권한 관리, 외부 유도 방지 등의 대책도 중요합니다.
유키: “AI가 ‘답변 도구’에서 ‘움직이는 도구’로 발전함에 따라 신뢰의 장벽이 높아지는 것은 자연스러운 현상이다.”
선생님 말씀하신 대로, Anthropic과의 협력과 닛반과의 논의는 인공지능의 진입점, 즉 학습 데이터 조달을 다루는 부분이고, Muse 이야기는 인공지능의 출구, 즉 사용자를 대신하여 무엇을 할 것인가를 묻는 부분입니다. 진입점과 출구 모두에서 신뢰가 흔들린다면, 아무리 뛰어난 성능을 가진 인공지능이라도 사회에 널리 받아들여지기 어려울 것입니다.
여기에서 제가 고민하고 싶은 세 가지 질문이 있습니다.
유키:「머리가 정리되기 시작했는데, 논점이 너무 많다. 무엇을 분리해서 생각해야 할까?」
선생님께서는 “책을 세 가지로 나누어 설명하면 더 명확하게 이해할 수 있습니다. 첫째, 법률의 문제입니다. 구매한 종이책을 스캔하여 AI 학습에 사용하는 것이 어떤 국가의 법률에서 어느 범위까지 허용되는지, 이는 판결이나 제도에 따라 달라지는 문제이며, 일본법, 미국법, 공정 이용, 저작권 제한 규정 등이 관련되지만, 개별적인 사정을 무시하고 단정적으로 말하는 것은 위험합니다.”
유키 “두 번째는 왜?”
선생님께서 말씀하신 것은 상거래 관련 질문입니다. 서점이나 출판사의 계약상 판매처와 이용 목적을 어디까지 고려했는지, 대량 구매나 AI 학습 이용을 제한할 수 있는지에 대한 것입니다. 만약 제한하고 싶다면, 계약 및 유통 규칙을 어떻게 재검토해야 하는지입니다. 이는 업계 내 협상 및 설계 문제에 해당합니다.
유키:「세 번째는 윤리라고 생각합니다」
선생님 말씀처럼, 법적으로 가능하다고 하더라도 창작자가 납득하고 독자가 신뢰할 수 있으며, 문화의 지속성을 해치지 않는다는 윤리적 문제가 남아 있습니다. AI 개발은 지식의 축적에 의존하기 때문에, 기존의 지적 생태계를 파괴하지 않고 활용하는 방안을 모색해야 합니다.
유키:「이해할 수 없는 것의 본질은 ‘불법인지 합법인지’라는 이분법적인 질문으로만 해결하려고 하기 때문에 풀리지 않는 문제라는 거야.”
선생님 말씀에 따르면, 독자가 다른 사람에게 설명할 때는 “이번 문제는 단순히 책을 판매한 것뿐만 아니라, 책이 AI 학습 데이터로 변환될 때의 동의, 보상, 투명성, 책임 체계가 아직 충분히 정립되지 않았다는 것을 보여주는 것이다”라고 말하는 것이 좋습니다.
향후 전망: 주목해야 할 점은 “설명”과 “규칙 마련”입니다.
유키:「이제 무엇을 봐야 할까?」
선생님 말씀하신 대로, 일본판 소매점(日販)이나 출판업계 단체, 출판사들이 어떻게 설명하고 어떤 대응을 취했는지 알아내야 합니다. 판매 사실 관계, 계약 범위, 판매 시점에 이용 목적을 어디까지 파악했는지 등이 명확해질수록 논의는 감정론에서 제도론으로 발전할 것입니다.
유키: “AI 기업은?”
선생님: “Anthropic를 포함한 AI 기업들이 학습 데이터 조달에 대해 얼마나 투명성을 높일 수 있는가 하는 점에 주목해야 합니다. 물론 기업 비밀이나 경쟁상의 이유 등으로 모든 것을 공개하는 것은 어려울 것입니다. 하지만 저작물을 대량으로 사용할 가능성이 있다면, 권리자나 사회에 대해 일정 수준의 설명을 제공하는 것이 신뢰로 이어질 수 있습니다. AI 기업이 ‘안전’과 ‘윤리’를 내세운다면, 모델의 행동뿐만 아니라 학습 자료의 수집 방식에도 관심을 기울여야 할 것입니다.”
유키: “독자님들께서는 무엇을 할 수 있나요?”
선생님 말씀에 따르면, 우선 뉴스를 단순한 선악으로 소비해서는 안 됩니다. AI 기업이 악하고 출판사가 정의롭거나, 혹은 그 반대로 이야기할 경우, 제도 설계에 대한 논의가 진전되지 않습니다. 다음으로 자신이 사용하는 AI 서비스에 대한 데이터 처리, 이용 약관, 기업 설명을 조금씩 확인해야 합니다. 또한, 읽고 싶은 작가나 출판사의 책을 구매하거나, 도서관에서 빌려오거나, 감상문을 쓰는 등과 같은 행동 역시 지식의 순환을 지지하는 작은 투표가 됩니다.
유키:「책을 읽는 것 자체가 미래의 책을 지지하는 행동이기도 하다」
선생님 말씀이 맞습니다. AI 시대이기에 인간이 무엇을 읽고 어떤 가치를 두느냐가 중요해집니다. AI가 책을 배우는 시대에 인간이 책을 읽지 않게 된다면 지의 근원은 메마르게 되어갈 것입니다. 반대로 AI를 편리한 도구로 활용하면서 동시에 창작자에게 환원과 투명성을 요구해 나간다면 출판과 AI가 단순한 대립뿐만 아니라 공존하는 길 또한 보일 것입니다.
요약: 책은 데이터로서의 것보다 먼저, 누군가의 노력으로 만들어진 것이다.
유키:「마지막으로, 이번 이야기를 한 단어로 설명한다면?」
선생님 말씀하시길, “『日販과 Anthropic의 계약 보도는 AI 학습을 위해 책을 어떻게 다뤄야 하는지, 출판 유통 전체에 던진 질문』이라는 사건이다. 책을 사는 행위 자체는 일상적인 행동이다. 하지만 대량의 책을 잘라내고 스캔하여 AI 모델 학습에 사용하는 것은 저작권, 계약, 상습화, 윤리, 문화의 지속성과 관련된 문제들을 복합적으로 야기한다.”
유키:「사람이 읽는 책과 AI가 배우는 책. 같은 책이라도 사용 방식에 따라 의미가 달라지는 거네.”
선생님 말씀처럼 정확합니다. 게다가 이 문제는 출판에만 국한되지 않습니다. 메타의 뮤즈와 같은 AI 에이전트가 등장하면서 IT 부서가 경영 전략의 핵심으로 자리 잡는 흐름을 보면, AI는 이미 사회 곳곳에서 ‘신뢰 설계’를 요구받고 있습니다. 입구에서는 무엇을 바탕으로 배우고 성장했는지, 그리고 출구에서는 누구를 위해, 어디까지 행동해야 하는지를 고민해야 합니다. AI 시대의 본질은 바로 이 두 가지를 동시에 생각하는 데 있습니다.
유키:「단순히 편리하냐 아니냐가 아니라, 편리함을 뒷받침하는 시스템 전체를 면밀히 살펴봐야 합니다.”
선생님 말씀처럼, 도움이 되셨기를 바랍니다. 다음으로는 관련 주제도 함께 다루도록 하겠습니다. AI 에이전트의 안전 설계, 저작권 및 학습 데이터, 기업의 AI 거버넌스 세 가지를 연계하여 살펴보면 뉴스의 시각이 상당히 달라질 것입니다.
출처를 명시해주시기 바랍니다. 출처가 없으면 번역이 불가능합니다.
- AI 학습용 앤솔로지 판매, 니혼반이 계약을 시도했으나 미국 출판 유통업체인 미즈출판이 계약을 거절했습니다. | 니케이 크로스테크
- 메타의 신 AI 에이전트 “Muse” 공개, 기밀 컴퓨팅에 주목 | Google 뉴스
- 그 아래의 IT 부서는 구조 조정으로 어려움을 겪었으나, 경영 전략의 핵심으로 부활할 수 있을지 검토되고 있다.
※ 이 글은 AI 지원으로 작성되었습니다.
출처: note 원문
번역: Gemma 3(.44) 초벌 + 교정 60청크
원문 보기 | 출처: note.com