스타트업 뉴스ZDNet Korea2026년 8월 19일
오픈AI·딥마인드가 짚은 벤치마크 함정, AI 승부는 '현장'서 갈린다
[지디넷코리아]인공지능(AI) 경쟁 기준이 성적표에서 현장으로 옮겨가고 있다. 벤치마크 점수가 아무리 높아도 실제 업무에서 쓰이지 않으면 좋은 모델로 보기 어렵다는 인식이 확산 중이다. 18일 발표된 정부의 국가대표 AI 선발 2차 평가가 이 변화를 그대로 보여줬다.이날 독자 AI 파운데이션 모델(독파모) 2차 단계평가에서는 글로벌 AI 평가기관 아티피셜 애널리시스의 AAII 지표에서 참여팀 중 최고점을 받은 모티프테크놀로지스가 사용성·활용성에서 밀려 탈락했다. 반면 업스테이지·SK텔레콤·LG AI연구원이 3차에 진출했다.이번 평가는 벤치마크 40점, 전문가 평가 35점, 사용자 평가 25점 등 총 100점으로 진행했다. AI 전문가 49명과 일반 국민 185명이 각 팀의 모델을 직접 써보고 채점하는 사용자 평가를 새로 도입해, 벤치마크 성능만으로는 통과할 수 없는 구조였다.류제명 과기정통부 제2차관은 브리핑에서 "기술력이 뛰어나도 75점의 상당한 배점이 주어진 사용성·활용성에서 낮