艾瑞网
26-06-02 10:23 微博认证:聚合互联网数据资讯,融合互联网行业资源的国内新经济门户。

#OpenBMB##清华NLP##开源数据集##大模型训练#
【行业动态:OpenBMB开源超大规模中文合成数据,数据层竞争继续升温】
OpenBMB联合清华NLP与Modelbest发布UltraData两大开源数据集。Ultra-FineWeb-L3面向预训练合成数据,包含600B+tokens,其中英文超400B、中文200B+,是目前体量很大的开源中文预训练合成数据集;UltraData-SFT-2605面向后训练SFT,包含1500万以上样本,覆盖数学、代码、知识和指令遵循,并包含思考与非思考标注。两者已在HuggingFace免费开放,并在MiniCPM5-1B训练中完成验证。
大模型竞争不只发生在参数和榜单上,数据质量正在变成更底层的护城河。尤其是中文预训练与后训练数据,长期存在高质量开放资源不足的问题。OpenBMB这次把预训练和SFT两端同时开源,价值不只是给研究者“多一份数据”,而是可能降低小模型、行业模型和本地化模型的训练门槛,让中文生态在数据工程层面更可复用。

发布于 北京