
《国家数据局关于印发〈关于推进行业高质量数据集建设行动的实施方案〉的通知》(国数科基〔2026〕25号,6月8日对外发布),共8个部分20条,本质上是在把一件事讲透:AI竞争打到今天,"数据"不再是"有就行",而是要变成"AI-Ready(可直接训练/可对齐/可复用/可交易/可监管)"的高质量行业数据集体系。这也是官方语境里强调的:国家层面首次对"数据赋能AI发展"作出系统性部署。

核心内容:深入贯彻党的二十大和二十届历次全会精神,全面落实“人工智能+”行动,主动顺应人工智能发展范式跃迁,按照“需求牵引、急用先行、应用验证、安全保障”原则,聚焦国民经济发展重点行业和战略性新兴产业,围绕行业高质量数据集供给、流通、应用等关键环节,部署强基扩容、标注攻坚、提质增效、应用赋能、管理服务、价值释放六个专项行动,形成“场景牵引数据、数据驱动模型、模型赋能应用、应用创造价值”的“数据飞轮”,加快构建数据要素与人工智能协同演进的共生生态。到2028年底,建成一批覆盖重点领域、经过应用验证的行业高质量数据集,打造一批数据驱动人工智能创新发展的典型应用场景,培育一批具备领先优势的创新型数据企业和专业人才,形成一批行业高质量数据集建设工具和标准。数据从供给到价值释放的良性循环基本形成,数据赋能人工智能创新发展的作用更加凸显,数据产业与人工智能深度融合,持续催生智能经济新增长点。

1. 它到底在解决什么问题?(现实痛点→政策靶心)。
过去几年国内并不缺数据量,但普遍卡在几类"质量与机制瓶颈":数据存在但不是AI能用:散、脏、无标注/弱标注、口径不统一、场景不绑定,拿来做行业模型很容易"看起来能用,训出来不行"。供给动力不足:数据权责、收益分配、合规成本高,"宁可放着也别惹事",导致关键行业数据出不来、合不起、流不动。链条断裂:采集—清洗—标注—质检—测评—治理—流通—应用没有形成闭环,结果是"一次性项目数据",难以沉淀成可复用的行业资产。这份《实施方案》的写法很直白:它把数据集供给、流通、应用当作一条完整产业链/基础设施来建,而不是只喊"要共享"。

2. 核心定义:什么叫"行业高质量数据集"(这里的定义很关键)。
文件给出的口径是:行业高质量数据集:经过采集、加工等数据处理,可直接用于开发和训练AI模型,能有效提升模型性能的行业数据集合,包含行业通识 + 行业专识数据集;并且它是推动 "人工智能+"赋能千行百业、实现产业落地的基础性、关键性资源。这句话的政策含义是:它把"数据集"从IT资产/档案思维抬到了生产要素+工程底座的位置;强调"可直接用于训练/提升性能"——意味着后面一切行动(标注、质检、测评、存力、流通)都要围绕可复用、可验证、可对齐来建,而不是"堆文件"。

3. 总体逻辑:不是"供给侧单向灌数据",而是"数据飞轮" 。
总体要求里把方法论浓缩成一个闭环(多家解读也反复点名):场景牵引数据 → 数据驱动模型 → 模型赋能应用 → 应用创造价值。并且给出时间锚点(到2028年底的目标画像):建成一批覆盖重点领域、经过应用验证的行业高质量数据集;打造一批数据驱动AI创新的典型应用场景;培育一批创新型数据企业与专业人才;形成一批建设工具与标准。数据从供给到价值释放的良性循环基本形成,一句话:从"有数据"走向"能飞起来的数据经济体"。

4. 六大专项行动:每条行动在打哪个"堵点"?(深度拆解)。
1) 强基扩容行动:先把"可用数据源"做厚、做准、做进场景。 行业覆盖非常具体:工业制造、科研、农业农村、智慧能源、交通、金融、医疗、教育、电商、文旅、应急、气象、绿色低碳、公共安全/城市治理等19个重点领域,再加低空经济、具身智能、智能驾驶、智慧海洋、生物制造等5个创新领域(合计指向约24类赛道),并要求围绕这些领域加快高质量数据集建设。

路径上抓"链主"与"联合体":用链主单位牵引上下游协同共建,鼓励开放与赋能中小企业;同时把高校/院所/协会/数据流通服务机构纳入建设主体;并提出加大公共数据开发利用、推动公共数据与行业数据融合利用。数据形态不只"文本+图片":明确推进文本、代码、图像、音频、视频、点云、时序数据、科学数据等多模态,并延伸到知识库/知识图谱、智能体所需的长程推理与决策数据、具身真机交互/仿真合成数据,乃至面向"世界模型"等前沿方向布局。基础设施联动:提到依托国家数据基础设施,用隐私保护计算、可信数据空间等能力,鼓励探索支撑大规模多模态数据集的存力中心——这其实是把"数据集"当成新一代算力/存力网络的"一等公民"。这一条的底层信号:高质量数据集不是"拍脑袋采集",而是先把行业数据底盘、权属/合规边界、场景清单、公共数据接口与存算底座一起对齐。

2) 标注攻坚行动:把"数据变知识"的环节工业化、专家化。核心判断很准:标注是把知识与经验注入训练数据的关键一环。升级方向:从"以人为主"转向人机协同:模型预标注 + 人工校准;人工标注 + 模型检验;模型预标注 + 模型检验等智能化标注服务。并强调行业专家深度参与(专家认证机制),尤其在指令微调、强化学习阶段需要的专业知识与逻辑推理标注上。产业侧:继续做强首批7个数据标注先行先试城市,梯次布局数据标注创新试验区,培育龙头/独角兽/瞪羚企业;人才侧走产教融合、职业技能等级认定、专职+兼职路线。深度含义:它把"标注"从低附加值外包,重新定义为高知识密度工程能力(尤其对医疗、工业、金融、交通等强专业场景)。未来"专家标注产能"会是稀缺资源。

3)提质增效行动:让数据集有标准、可测评、可互认(这部分在权威转载文本中被归入"提升质效/提质"脉络)。攻关点落在:清洗、增强、标注、对齐、质检等工具链与自动化;并用智能过滤/配比做出更高知识密度的数据集;对稀缺/高成本场景,明确鼓励数据合成技术补位。标准与测评是灵魂:加快格式、类型、标注、质量测评等国家标准研制;推动"数据质量验证 + 模型应用反馈"的测评方法;追求"一次测评、全国互认"这类互认机制思路(见解读整理稿对"提质增效"的归纳)。这一条决定了:以后行业采购/交易/共建数据集时,大家能不能用同一套"质量语言"说话——否则永远扯皮。

4) 应用赋能行动:用"场景—数据—模型"闭环逼出真实供给。 关键词是:以模引数、用数赋模。不是先攒一堆"通用语料"等奇迹,而是让AI+场景反过来拉需求清单、拉字段口径、拉标注规则;再用模型在实际应用里跑出来的交互数据反哺迭代——这就是"数据飞轮"的工程化版本。机制层还写了:搭政产学研用金平台、供需对接、遴选典型案例、以赛促建促用,以及数据集跨境安全有序流动的规则互认探索,并提示防止偏见与歧视。

5) 管理服务行动:全生命周期治理 + "物理分散、逻辑集中"的系统化管理。 强调覆盖采集→清洗→加工→标注→质检→测评→迭代→审计的全生命周期管理。提出建设"物理分散、逻辑集中"的国家数据集管理服务系统,并允许地方/行业设专区——这实质是在为后续目录化、确权/授权、合规审计、质量追溯铺底座(很多"流通"的前提条件都在这里)。制度侧要点:落实数据持有权/使用权/经营权"三权分置"思路的研究与探索,研究合成数据等新情况,完善训练阶段数据使用规则、收益分配规则,并强调伦理与防敏感数据滥用/防偏见。

6) 价值释放行动:把数据集推向"可交易、可计价、可资产化" 。这条最"市场化":对接模式多样化:以数换数 / 数模互换 / 数据托管 / 数算一体等。流通场所化:鼓励数据集在数据交易所(中心)挂牌交易,发展订阅/商城/定制等形态,并提到"词元(Token)交易"等新型交易模式的探索(偏前沿,但方向很明确:把价值度量往"模型消耗单位"靠近)。资产化工具箱:盘点/登记/评估试点,并探索质押融资、作价入股、资产证券化、数据信托、数据保险等;同时要做的是培育"为数据付费"的市场共识,政府/国企/模型企业率先开展数据采购实践。

5. 对不同类型的你,意味着什么?(落地视角)。
对行业企业/链主: 接下来会进入一个更"被鼓励联合体+开放赋能"的环境:你能牵头做数据集,就可能同时拿到场景牵引 + 公共数据融合支持 + 标注/存力/合规工具链的协同红利;但也要做好口径标准化、质检与审计留痕,否则"规模"反而变成风险。对数据服务商/标注企业: 门槛会抬升:纯低价人力池模式会承压,专家型标注 + 智能化工具链 + 行业know-how会更吃香;同时试验区/先行先试城市会出现更强的产业集聚机会。

对地方政府/数据局系统: 政策工具从"号召共享"转到"建系统、建标准、建专区、建示范场景":国家层面的管理服务系统框架 + 标准体系 + 试点示范,会让地方竞争从"口号"转向"谁先把目录/质量/安全审计跑通"。对AI团队/模型公司: 今后获取行业能力的瓶颈,往往不在参数,而在有没有绑定到经应用验证的高质量行业数据集:谁能更早接入(或共建)这些"被认证过"的行业数据资产,谁的垂类模型迭代速度就更稳。

6. 仍值得盯住:它没写死、但会决定成败的"下一步"。
这份《实施方案》更多是顶层施工图,真正落地还要看后续更硬的东西:国家标准/行业标准在格式、标注规范、质量测评上如何细化到行业(医疗、工业、交通等差异很大)。合规细则:训练阶段数据使用边界、合成数据合法性与披露要求、"三权分置"在数据集维度的操作规则与合同范本。国家数据集管理服务系统的接入条件、审计要求、跨省/跨行业互通机制。数据交易所层面如何把"挂牌—定价—交付—售后质量责任—再使用边界"做成可执行的流程。

注:数据飞轮是一种企业数智化升级模式,于2023年4月被提出,其理念源于某企业内部的数据驱动与人工智能实践总结。该模式以数据消费为核心,旨在应对数据平台建设中可能存在的“重资产、轻消费”等问题,通过业务应用与数据资产建设的相互促进来驱动企业增长。2023年9月,该理念在某科技峰会上得到进一步阐述,随后进入系统化产品支撑阶段。2024年12月,相关企业发布了该模式的2.0版本,将人工智能置于核心位置,并通过系列产品推动数据消费。这一模式已在汽车、零售、金融、物流、移动应用优化与增长等多个行业领域得到应用。



