开放文本、图像及字符数据集……“Gongyuseojae”焕新改版
可用于光学字符识别、自然语言处理、数字人文研究等
近代杂志、政府刊行物、教科书、开放获取论文等人工智能学习资料
国立中央图书馆首次向公众开放其馆藏国家文献加工而成的3833万件人工智能学习数据。
韩国国立中央图书馆17日全新改版并公开的人工智能训练数据平台“共享书斋”界面。该平台可检索、下载并利用从20世纪30至40年代近代杂志、政府出版物及教材等国家文献中构建的文本、图像和文字数据集,共计3833万条。韩国国立中央图书馆供图
View original image国立中央图书馆表示,自17日起将通过“Gongyuseojae”公开3974件文本数据、2.1485万件表格、插图、广告和照片等图像数据,以及元数据和3830万件字符级文字数据集等。
公开对象包括国立中央图书馆数字化资料中已解决著作权问题的20世纪30至40年代近代杂志、20世纪40至60年代政府刊行物和教科书、图书馆出版资料,以及获准用于人工智能学习的开放获取学术论文等。用户可在Gongyuseojae自由阅览、下载和使用相关资料。
文本数据经过整理,便于人工智能识别,可直接用于研究和服务开发。图书馆方面说明,字符数据集包含多种形式的文字数据,可应用于中小企业和创投企业难以获取大规模学习数据的光学字符识别、自然语言处理等技术开发。
原有项目平台“Gongyuseojae”也全面改版为以人工智能学习数据应用为核心的平台。平台强化了按资料和图像类型进行检索的功能,并改善用户环境,使任何人无需另行注册会员即可搜索和下载资料。该平台可用于人工智能及数字人文研究、服务和应用程序开发、内容制作等多种用途。
尤其是随着大量积累的文献、记录和图像等被加工为可供人工智能分析的形式,其在数字人文研究中的应用范围预计也将扩大。研究人员可通过分析海量资料中的词语、文体和图像等模式,开展新的研究尝试。
国立中央图书馆计划于今年年底追加公开约300册韩文通俗小说、约3万页文本数据。此后还将持续扩大国家文献的数据建设和开放范围,把Gongyuseojae发展为人工智能学习与研究平台。
国立中央图书馆数字信息企划科科长Lee Hyeonju表示:“这是将图书馆庞大的知识资源转化为人工智能时代核心基础设施的重要起点。我们将持续扩大数据开放范围,让所有民众都能享受到公共知识资源的惠益。”
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。