降低AI研究门槛·扩大应用规模
Ellis Group于14日表示,已在全球开源平台“Hugging Face”公开了两种韩语教育用数据集。
本次公开的数据集由两种数据集构成,旨在强化大语言模型(LLM)在学术·教育领域的韩语性能,分别是“韩语FineWeb教育数据集演示版(Korean FineWeb-Edu Demo)”和“韩语网页文本教育数据集(Korean-webtext-edu)”。
“韩语FineWeb教育数据集演示版”是将英文教育用网页文本语料FineWeb-Edu翻译成韩语而构建的、约1900亿(190B)标记规模的数据集“korean-translated-fineweb-edu-dedup”的5%样本组成的演示版。其设计目的是可用于学术·教育领域的韩语LLM训练,并在大规模训练前用于验证数据特性及可用性。
“韩语网页文本教育数据集”则是从大规模韩语网页文本中,仅筛选通过教育价值评分的内容构建而成,通过对事实性、语境一致性及教育适配性进行评估,使其可用于韩语人工智能模型训练。
Ellis Group计划向研究人员、开发者和企业广泛提供适合韩语人工智能(AI)模型训练的高质量数据,以支持国内外AI研究与开发的活跃开展。
Ellis Group首席营收官(CRO)Kim Suin表示:“今后也将以覆盖数据、模型和基础设施的技术能力为基础,持续为韩语AI研究和产业生态系统的成长作出贡献。”
本报道由人工智能(AI)翻译技术生成。
版权所有 © 阿视亚经济。未经许可不得转载,禁止用于AI训练及使用。