当前位置:商业频道首页 > 财讯 > 正文

多语言语料库“万卷·丝路”发布,AI赋能共建“一带一路”(3)

万卷·丝路数据处理流程

为评估“万卷·丝路”数据集质量,研究团队采样了部分“万卷·丝路”数据在开源基座上进行继续预训练,实验结果显示,使用“万卷·丝路”后,模型在多语言内容理解及推理能力上的表现均获得了提升。

大模型语料数据联盟

由上海人工智能实验室联合中央广播电视总台、人民网、国家气象中心、中国科学技术信息研究所、上海报业集团、上海文广集团等10家单位联合发起。为应对大模型发展对高质量、大规模、安全可信语料数据资源的需求,保障大模型科研攻关及相关产业生态发展,大模型语料数据联盟于2023年7月6日世界人工智能大会开幕式上宣布成立,旨在通过链接模型训练、数据供给、学术研究、第三方服务等多方面机构,联合打造多知识、多模态、标准化的高质量语料数据,探索形成基于贡献、可持续运行的激励机制,打造国际化、开放型的大模型语料数据生态圈。

(责任编辑:卢其龙 CN070)

热点推送

本周关注

MORE