# 중국 AI 개발이 “중국어 훈련 데이터 부족”이라는 새로운 병목 현상에 직면하고 있다.

> https://bookfactory.kr/c/news/9286
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-08-11T01:26:55.902Z

---

고급 AI 모델의 성능을 향상시키기 위해서는 대량의 고품질 훈련 데이터가 필요합니다. 중국의 AI 개발을 억제하는 문제로는 미국에 의한 첨단 AI 칩 수출 규제가 주목받고 있지만, 중국 AI 전문가들은 중국어 훈련 데이터 부족이 다음 큰 병목 현상이 될 수 있다고 경고합니다. China faces new AI bottleneck as it runs out of Chinese-language training data | South China Morning Post https://www.scmp.com/tech/tech-trends/article/3363318/china-faces-new-ai-bottleneck-it-runs-out-chinese-language-training-data

AI 훈련 데이터 부족은 중국만의 문제가 아니며, AI의 발전이 고품질 데이터 부족으로 둔화될 가능성은 이전부터 지적되어 왔습니다. AI 연구기관인 Epoch AI는 인간이 작성하고 공개한 문서를 품질과 동일 데이터를 반복적으로 학습할 수 있는 효과를 고려한 실질적인 양을 약 300조 토큰으로 추정하고, 현재 추세가 지속된다면 언어 모델은 2026년부터 2032년 사이에 이 문서 데이터를 이용하게 될 것입니다. 중국에서 문제가 특히 심각하다고 여겨지는 이유는 인터넷상에서 중국어를 사용하는 웹사이트가 부족하다는 점입니다. 웹 기술 조사 서비스인 W3Techs에 따르면 2026년 8월 10일 기준으로 사용 언어를 판별할 수 있는 웹사이트 중 중국어를 사용하는 사이트는 1.3%였습니다. 영어는 49.5%, 일본어는 5.0%입니다. 청화대학교의 孫茂松 교수와 孔存良 氏は光明日報への寄稿에서, 중국에서는 AI 모델의 훈련 및 평가에 사용되는 문장 데이터를 대량으로 수집한 “코퍼스”의 정비가 대규모 언어 모델 시대에 대응하기에는 아직 초기 단계에 있다고 지적합니다. 대규모 웹 아카이브인 “Common Crawl”에 포함된 중국어 데이터는 약 4.8%에 불과하며, 중국어 백과사전, 과학 서적, 학술지, 사전과 같은 지적 밀도가 높은 자료도 기존의 중국어 코퍼스에는 매우 적습니다. 孫氏らは 중국어 데이터를 늘리는 방법으로 출판물, 고전, 지방지, 역사 자료 등의 디지털화를 진행하고, 사전, 영상, 방언, 소수 민족 언어를 코퍼스에 포함하도록 제안합니다. 또한, 저작권자로부터 사용 허가를 얻는 메커니즘도 필요하다고 孫氏らは 지적하며, 실제로 중국의 화夏出版社은 책의 AI 훈련에 사용을 금지하고 있습니다.

중국 정부 또한 중국어에 국한되지 않은 AI를 위한 전반적인 데이터 정비도 진행하고 있습니다. 중국 국가 데이터국은 2026년 6월 8일, 2028년 말까지 과학 연구, 산업 제조, 의료 위생 등의 분야에서 실제 용도에 따른 검증을 거친 고품질 데이터 세트를 구축할 계획을 발표했습니다. 수집이 어려운 데이터는 시뮬레이션이나 합성 기술로 보완하는 방안입니다. 중국 정보통신研究院의 여악휘 원장은 국가 데이터국의 웹사이트에 게시된 기고에서 “AI 시대의 경쟁은 모델과 계산 능력뿐만 아니라 고품질 데이터 공급 시스템의 경쟁이기도 하다”고 언급하며, 데이터의 생성, 관리, 유통, 활용, 가치 창출까지를 통합한 시스템을 먼저 정비한 국가가 다음 AI 개발 경쟁에서 주도권을 쥘 것이라고 주장합니다.

* 관련 기사: 드디어 AI 학습을 위한 데이터가 고갈되나, 데이터 세트 부족으로 AI 기업은 대규모의 범용적인 LLM에서 소규모의 전문적인 모델로 전환될 가능성이 크다 - GIGAZINE 앤서티크(Anthropic)가 AI 학습을 위해 수백만 권의 종이 책을 재단하여 디지털화하면서 희귀본이 소실될 수 있다는 우려가 제기되었고, 일론 머스크는 “SpaceXAI는 그런 일을 하지 않을 것이다”라고 주장 - GIGAZINE AI가 출력한 데이터로 학습하면 AI가 붕괴하는 “AI의 자식 장애”는 무엇인가? - GIGAZINE Google이 AI 훈련에 필요한 데이터량을 1만분의 1로 줄이는 혁신적인 방법을 발표 - GIGAZINE

[전자책 세일 50% 할인] Kindle 책을 모두 반값으로 판매하는 여름 세일이 진행 중입니다! [2026년 8월 16일(일)까지]

2026년 08월 11일 10시 00분 00초 inAI, Posted by log1b_ok

최근 24시간 (1시간마다 업데이트, 5분 간격으로는 여기)

[원문 보기](https://gigazine.net/news/20260811-china-ai-chinese-training-data/) | 출처: Gigazine