
과기정통부 류제명 제2차관이 8월 18일 정부서울청사 브리핑에서 독자 인공지능(AI) 파운데이션 모델(독파모) 프로젝트 2차 단계평가와 관련해 제기된 벤치마크 과적합(벤치맥싱) 의혹에 대해 평가기관으로부터 "문제없다"는 공식 답변을 받았다고 밝혔다. 류 차관은 "해당 평가기관에 벤치맥싱 우려를 의뢰한 결과, 평가를 위한 체계적인 암기나 과적합 문제가 입증될 만한 답변을 찾지 못했으며, 큰 문제가 없다는 답변을 받았다"고 말했다.
이번 2차 평가에서 벤치마크 평가는 배점 40점으로, 글로벌 AI 모델 평가 플랫폼 아티피셜 애널리시스가 산출하는 AAII 평가(25점)와 한국지능정보사회진흥원(NIA) 벤치마크 평가(15점)로 구성됐다. AAII는 에이전트·코딩·일반·과학적 추론 등 분야의 고난도 벤치마크 9종을 묶어 단일 점수로 환산하는 지표로, 과기정통부는 글로벌 빅테크들도 고득점을 받기 어려운 공신력 높은 지표라는 점에서 이번 평가에 중점적으로 도입했다고 설명했다. 업계 일각에서는 독파모 참여사 중 한 곳이 AAII 점수를 겨냥해 취약한 항목을 끌어올리는 벤치맥싱을 했다는 의혹이 제기됐고, 이에 과기정통부는 AAII 운영사인 아티피셜 애널리시스에 공식 분석을 의뢰해 "체계적인 암기나 과적합 문제가 입증될 만한 단서를 찾지 못했다"는 답변을 받았다. 류 차관은 "AAII의 공식 답변을 토대로 했고, 전문가 평가를 통해 여러 가지를 검증한 결과 불공정한 기술 지원 등은 없었다는 결론을 내렸다"며 "참여 기업들의 이의제기를 충분히 받아 이의가 해소될 때까지 공감대를 형성하는 작업을 거쳤다"고 덧붙였다.
과기정통부는 이번 2차 평가가 벤치마크·전문가·사용자 평가를 아우르는 다층 구조로 설계됐다는 점도 강조했다. 3개 평가 영역별 1위 팀은 모두 달랐으며 일관되게 1등을 한 기업은 없었다고 밝혔다. 배점 40점인 벤치마크 평가에서 1위와 4위 간 격차는 4.0점, 배점 35점인 전문가 평가에서는 2.4점, 배점 25점인 사용자 평가에서는 5.0점에 그쳤다. 류 차관은 "특별히 어떤 항목이 결정적이었다고 보기 어려울 정도로 각 항목별 결과를 종합적으로 만들어낸 결과"라고 부연했다.
독파모 프로젝트는 국가대표 AI를 선발하기 위해 과기정통부와 정보통신산업진흥원(NIPA)이 추진하는 대규모언어모델(LLM) 개발 사업이다. 지난해 말 1차 평가를 거쳐 LG AI연구원·SK텔레콤·업스테이지·모티프테크놀로지스 등 4개 정예팀이 2차 평가에 진출했으며, 이번 2차 평가 결과 모티프테크놀로지스가 탈락하고 나머지 3개 팀이 다음 단계로 올라섰다. 정부는 3차 평가를 거쳐 내년 초 최종 2개팀을 선정할 계획이다.
· · · · · · · · · ·
관련기사
▶ 독파모 2차 평가…LG·SKT·업스테이지 3파전, 한국 AI 세계 3위
▶ [속보] LG·SKT·업스테이지 독파모 최종 진출…모티프 탈락
▶ [속보] 독파모 최종 2팀 연내 선정 '미지수'…"경쟁 방식 고민"
· · · · · · · · · ·
함께 보면 좋은 상품
[네이버] 메이크샐러드 단백질 닭가슴살 직장인 벌크업 저당 식단 냉동 도시락 간편식 바베큐 외 15종 — 4,900원
[쿠팡] 다처리 틈새 브러쉬 욕실 청소솔 — 2,050원
※ 이 글에는 네이버 쇼핑 커넥트 활동의 일환으로, 판매 발생 시 일정액의 수수료를 제공받는 링크가 포함되어 있습니다.
※ 이 글은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
· · · · · · · · · ·
스페셜타임스는 AI 기술의 도움을 받아 더 빠르고 다양한 뉴스를 독자에게 전달하기 위해 노력하고 있습니다.
NEWS 참여포털
내 지역 날씨·재난·복지를 한 곳에서
폭염경보부터 고속도로 사고까지, 오늘 필요한 것만
withnews.co.kr →

