스타트업 뉴스ZDNet Korea2026년 8월 8일
[AI는 지금] "LLM 키울 데이터가 없다"…中 AI, 중국어 부족에 비상등
[지디넷코리아]중국 인공지능(AI) 기업들이 고품질 학습 데이터 확보에 비상이 걸렸다. 온라인에서 활용할 수 있는 중국어 데이터가 제한적인 데다 공개 데이터 고갈 우려까지 커지면서 차세대 대규모언어모델(LLM) 개발을 위한 데이터 확보 부담도 높아지고 있다.8일 사우스차이나모닝포스트(SCMP)가 인용한 인터넷 통계업체 W3테크스(Techs) 자료에 따르면 이달 기준 전 세계 웹 콘텐츠에서 중국어가 차지하는 비중은 1.3% 수준이다. 영어는 전체의 절반에 가까운 비중을 차지했으며 스페인어와 독일어는 각각 6%, 일본어는 5%로 집계됐다.AI 업계 전반에선 모델 학습에 투입할 고품질 인간 생성 데이터가 빠르게 줄고 있다는 우려가 커지고 있다. 미국 연구기관 에포크AI는 공개적으로 이용할 수 있는 고품질 인간 생성 텍스트가 향후 6년 안에 사실상 소진될 수 있다고 전망했다. 오픈AI 공동창업자 안드레이 카파시도 2030년 전후 신뢰할 수 있는 신규 데이터를 충분히 공급하지 못하면 모델 성