스타트업 뉴스ZDNet Korea2026년 10월 6일
구글딥마인드 "AI 벤치마크, 10~20개 언어로만 모델 평가…범위 넓혀야"
[지디넷코리아]"현재 다수 인공지능(AI) 벤치마크는 10~20개 언어로만 모델을 평가하고 있습니다. AI의 실제 역량을 제대로 검증하려면 소수 언어·문화 중심 평가 평가 체계부터 바꿔야 합니다. 현지 전문가와 함께 각 지역 언어와 문화를 벤치마크에 반영해 모델이 소수 국가의 사회 관습과 규범까지 이해하는지 평가해야 할 것입니다."로라 아로요 구글딥마인드 수석 과학자는 6일 서울 코엑스에서 열린 'AI 페스타 20206' 기조연설에서 벤치마크 평가 방식이 이같이 개편돼야 한다고 주장했다. 다국어·다문화 AI 평가를 주제로 한 발표에서 기존 벤치마크의 영어 편중 문제와 개선 과제를 제시했다.아로요 박사는 다양한 언어와 문화적 맥락에서 AI 모델 안전성과 응답 적절성을 평가하는 연구를 진행하고 있다. 지역별 가치관과 사회 규범을 데이터 수집과 모델 평가에 반영해 영어 중심 AI 평가 한계를 줄이는 데 주력하고 있다.아로요 박사는 현재 AI 모델이 약 70~100개 언어를 지원하지만 다수