中国发布首份《数据工厂白皮书》
2026-07-21 10:51
收藏

维度网讯,近日,北京交通大学与北京化工大学牵头,联合华为、北京数据集团、清华大学、北京大学等30余家单位共同编制的《数据工厂白皮书》正式发布。该白皮书是中国首份系统研究数据工厂政策、理论与实践的成果,首次明确界定了数据工厂的涵义、类型划分和主要特征,为中国数据要素产业建设和人工智能场景落地提供了体系化参考。

白皮书由六个章节组成。第一部分从人工智能发展现状、数智产业链形成及其薄弱环节出发,阐述数据工厂作为高质量数据集规模化生产关键设施的必要性与紧迫性。第二部分梳理了国内外典型数据工厂的探索实践,国际案例包括Scale AI、美国星际之门项目、欧洲数据中心、欧洲数据实验室、Parse Biosciences、Bioptimus、笛卡尔实验室等;国内案例涵盖崖州湾国家实验室“繁|未来农业智能枢纽”超级数据工厂、贵州主枢纽存力中心暨数据要素保障基地、库帕思“语料超级工厂”、京津冀数据要素产业园人工智能数据工厂、广东省先进存力中心、帕西尼具身智能超级数据工厂、上海徐汇区“模速空间”、北京经开区“模数世界”、珠海市“模数空间”、北京市石景山区“大模型超级工厂”等,并总结了国内数据工厂的共性特征。第三部分提出数据工厂是高质量数据集规模化生产设施和新型业态,是国家数据基础设施的重要组成部分,分为集中式、半集中式和分布式三种类型,具备多样化、规模化、体系化、标准化、AI化五大特点。第四部分从广义和狭义两个层面阐述数据工厂的构成、定位与功能:广义上包括国家数据基座、国家数据工厂、国家人工智能训练场;狭义上包括储备车间、生产车间和中试车间,分别对应数据原料供应基地、高质量数据集流水线和数据集靶场。第五部分论述了四种建设模式(数据标注企业迭代、数据存储基地升级、人工智能企业延伸、技术企业创新创立)、四种运营机制(保障、定制、结对子、电商),以及三种部署策略(在国家基础设施底座部署通识数据集数据工厂、在重要功能设施部署行业通识数据集数据工厂、在各业务节点部署行业专识数据集数据工厂)。第六部分从政策、标准、技术、平台四个维度提出发展建议,包括加快出台指导意见、启动标准研制、突破关键技术瓶颈等。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com