大模型竞争下半场:千万级 SFT + 全球最大中文合成数据,一起开源了!
中文摘要
面壁智能联合清华大学、OpenBMB开源UltraData系列,包含超大规模中文合成预训练及千万级SFT数据,旨在推动大模型竞争转向数据质量。
English Summary
ModelBest, Tsinghua University, and OpenBMB open-sourced UltraData, featuring massive Chinese synthetic pre-training and SFT datasets to prioritize data quality over model scale.
原文节选
📌 一句话摘要 面壁智能联合清华大学、OpenBMB 开源了 UltraData 系列两大 L3 层级数据集:全球最大中文预训练合成数据 Ultra-FineWeb-L3 和千万级 SFT 数据 UltraData-SFT-2605,并公开了 L0-L4 数据分级治理体系,旨在推动大模型竞争从参数规模转向数据质量。 📝 详细摘要 本文由面壁智能团队发布,核心介绍了其联合清华大学、OpenBMB 开源的 UltraDat...