텍스트·이미지·글자 데이터셋 개방…'공유서재' 새 단장
OCR·자연어처리·디지털인문학 연구 등에 활용 가능
근대잡지·정부간행물·교과서·OA 논문 등 AI 학습 기

국립중앙도서관이 소장 국가문헌을 가공한 인공지능(AI) 학습데이터 3833만건을 처음으로 일반에 공개한다.

국립중앙도서관이 17일 새롭게 개편해 공개한 AI 학습데이터 플랫폼 '공유서재' 화면. 1930~40년대 근대잡지와 정부간행물·교과서 등 국가문헌에서 구축한 텍스트·이미지·글자 데이터셋 총 3833만건을 검색하고 내려받아 활용할 수 있다. 국립중앙도서관

국립중앙도서관이 17일 새롭게 개편해 공개한 AI 학습데이터 플랫폼 '공유서재' 화면. 1930~40년대 근대잡지와 정부간행물·교과서 등 국가문헌에서 구축한 텍스트·이미지·글자 데이터셋 총 3833만건을 검색하고 내려받아 활용할 수 있다. 국립중앙도서관

AD
원본보기 아이콘

국립중앙도서관은 17일부터 텍스트 데이터 3974건과 표·삽화·광고·사진 등 이미지 데이터 2만1485건, 메타데이터, 문자 단위 글자 데이터셋 3830만건 등을 '공유서재'를 통해 공개한다고 밝혔다.


공개 대상은 국립중앙도서관이 디지털화한 자료 가운데 저작권 문제가 해결된 1930~40년대 근대잡지, 1940~60년대 정부간행물과 교과서, 도서관 발간자료, AI 학습 이용을 허락받은 오픈액세스(OA) 학술논문 등이다. 이용자는 공유서재에서 해당 자료를 자유롭게 열람하거나 내려받아 활용할 수 있다.

텍스트 데이터는 AI가 인식하기 쉽도록 정제해 연구와 서비스 개발에 바로 활용할 수 있도록 했다. 글자 데이터셋은 다양한 형태의 문자 데이터를 포함해 대규모 학습데이터 확보가 쉽지 않은 중소·벤처기업의 광학문자인식(OCR), 자연어처리 기술 개발 등에 활용될 수 있다고 도서관 측은 설명했다.


기존 프로젝트 플랫폼이었던 '공유서재'도 AI 학습데이터 활용 중심으로 전면 개편했다. 자료·이미지 유형별 탐색 기능을 강화하고 별도의 회원가입 없이 누구나 자료를 검색하고 내려받을 수 있도록 사용자 환경을 개선했다. AI와 디지털 인문학 연구, 서비스·앱 개발, 콘텐츠 제작 등 다양한 용도로 활용할 수 있다.

특히 대규모로 축적된 문헌과 기록, 이미지 등을 AI가 분석할 수 있는 형태로 가공하면서 디지털 인문학 연구에도 활용 범위가 넓어질 전망이다. 연구자들은 방대한 자료에서 단어나 문체, 이미지 등의 패턴을 분석하는 방식으로 새로운 연구를 시도할 수 있다.


국립중앙도서관은 올해 말 한글 딱지본 소설 300여책, 약 3만면의 텍스트 데이터도 추가 공개할 예정이다. 이후에도 국가문헌의 데이터 구축과 개방 범위를 확대해 공유서재를 AI 학습·연구 플랫폼으로 발전시킨다는 계획이다.

AD

이현주 국립중앙도서관 디지털정보기획과장은 "도서관의 방대한 지식자원을 AI 시대의 핵심 인프라로 전환하는 중요한 시작점"이라며 "국민 누구나 공공 지식자원의 혜택을 누릴 수 있도록 데이터 개방 범위를 넓혀가겠다"고 말했다.


김희윤 기자 film4h@asiae.co.kr

<ⓒ투자가를 위한 경제콘텐츠 플랫폼, 아시아경제. 무단전재 배포금지, AI 학습 및 활용 금지>

함께 보면 좋은 기사

새로보기

취향저격 맞춤뉴스

많이 본 뉴스

당신을 위한 추천 콘텐츠

놓칠 수 없는 이슈