본문으로 건너뛰기
뉴에라 데일리Read in English

과기정통부, AI학습 데이터 29종·1.56조 토큰 개방…네이버·SK·LG 등 5개 정예팀 구축

네이버클라우드·업스테이지·SK텔레콤·엔씨에이아이·LGAI연구원이 각자 전략으로 확보…이론적으로 70~80B급 대형모델 학습 가능

기자명 뉴에라 데일리 AIAI 작성입력 수정
일러스트: 과기정통부, AI학습 데이터 29종·1.56조 토큰 개방…네이버·SK·LG 등 5개 정예팀 구축
과학·기술 일러스트: 뉴에라 데일리 · AI 생성

과학기술정보통신부와 한국지능정보사회진흥원(NIA)이 27일 독자 AI 파운데이션 모델 프로젝트 5개 정예팀이 구축한 AI 학습용 데이터 29종을 AI허브에 개방한다고 밝혔다.

이 데이터는 약 3544만 건, 약 1조5600억 토큰 규모로, 이론적으로 70~80B 수준의 대형 AI 모델 학습에 사용될 수 있다. 정예팀은 네이버클라우드, 업스테이지, SK텔레콤, 엔씨에이아이, LGAI연구원으로 각자의 개발 전략에 맞춰 데이터를 기획·확보했다. 네이버클라우드는 공개 영상과 방송 영상 기반 텍스트, 음성 질의응답 등 멀티모달 데이터를, 업스테이지는 1조 토큰 규모의 사전학습 데이터와 AI 에이전트 개발용 사후학습 데이터를 구축했다. SK텔레콤은 수학·과학·법률 등 전문 도메인의 고난도 추론 데이터와 한국형 레드티밍 데이터를, 엔씨에이아이는 제조 분야 기술문서와 민원 상담 음성 등 현장 실데이터를 기반으로 한 긴 문맥 이해·멀티턴 대화 데이터를 확보했다. LGAI연구원은 국내 50개 실제 가정환경에서 촬영한 피지컬 AI 멀티모달 데이터셋을 만들었다.

이번 개방을 위해 NIA와 한국정보통신기술협회(TTA)는 데이터 품질검증과 개인정보·유해성 검증, 라이선스 제약 데이터 제외 등을 진행했다. 사업 공고상 참여조건에 따라 의무개방량(50% 이상)을 준수해야 하는 가운데 네이버클라우드, 업스테이지, SK텔레콤, 엔씨에이아이는 품질검증을 거친 데이터 전체를 개방하고 LGAI연구원은 통계적 추출 방식으로 선별 공개한다.

공개된 데이터는 대한민국 국민이라면 누구나 AI허브 누리집(aihub.or.kr)을 통해 무료로 다운로드받을 수 있다. 일부 데이터는 보안이 보장된 온라인 환경인 '안심존' 내 별도 신청을 거쳐 이용 가능하다. 과기정통부는 향후 2차 단계평가에서 구축된 데이터에 대해서도 품질검증을 거쳐 개방을 이어갈 예정이라고 덧붙였다.

김경만 과기정통부 인공지능정책실장은 "이번 개방 데이터는 정예팀의 AI학습 전략이 담긴 귀중한 자산인 만큼 AI생태계의 성장과 자생력 강화를 이끄는 밑거름이 될 것"이라고 말했다.

이 기사가 근거로 삼은 자료

기사에 쓰인 사실은 아래 원문에서 직접 확인할 수 있습니다.

  1. 정부·공공과학기술정보통신부 과학기술 보도자료· 과학기술정보통신부· 확인 2026.08.29

저작권자 © 뉴에라 데일리 무단전재 및 재배포 금지