——《中国数据产业发展报告(2026)》独家深度调研解读
【软盟资讯·新闻导读】6.78万亿元产业规模、48.2万家数据企业、七成产值与人工智能高度相关——三个数字勾勒出中国数据产业的最新全貌。当数据从沉睡的资源变为流动的资产,当词元成为智能时代的价值锚点,一场围绕数据要素的深刻变革正在发生。本文以《中国数据产业发展报告(2026)》为线索,独家拆解产业变局的逻辑与隐忧。

一、报告总览:三个数字定义「十五五」开局之年的数据产业
2026年8月28日,2026中国国际大数据产业博览会在贵州贵阳开幕。本届数博会以「词元——数据要素价值释放新路径」为主题,国家数据局在会期集中发布了词元、数据标注、数据基础设施、数字人才培养等多个领域的重要成果。而在这场年度行业盛会的开幕式上,由国家数据发展研究院研究编制的《中国数据产业发展报告(2026)》正式对外发布,用一组系统性数据,为「十五五」开局之年的中国数据产业画出了第一张完整画像。
报告给出的第一个数字,是6.78万亿元。2025年,我国数据产业规模达到6.78万亿元,同比增长15.7%。这是一个需要放在时间纵深处才能读出分量的数字:据国家数据局此前披露,2024年我国数据产业规模为5.86万亿元,较「十三五」末增长117%。也就是说,从「十三五」末到2025年,短短五年时间,数据产业完成了一轮翻倍以上的扩张;而2025年一年的净增量就接近万亿元。放在任何一个产业门类中,这都是重量级的扩张速度。
第二个数字,是48.2万家。截至2025年底,全国数据企业总量达到48.2万家,同比增长17.9%。作为对照,2024年全国数据企业数量为超过40万家。简单倒推可知,一年之内全国净增数据企业超过7万家,平均每天有约200家数据相关企业诞生。市场主体的高速扩容,意味着数据产业不再是少数头部玩家的「牌桌游戏」,而是正在形成一个纵深广阔、层次丰富的产业生态。
第三个数字,是七成以上。与人工智能高度相关的数据产品和服务,已经占数据产业总产值的七成以上,成为当之无愧的发展主力。这是整份报告中最具结构性意义的一个数字——它标志着中国数据产业的增长引擎,已经完成了从「信息化红利」向「智能化红利」的历史性切换。
增速的含金量同样值得掂量。15.7%的增速,是在数据产业体量已经站上数万亿元高位之后取得的——基数越大,维持高增速越难。这一增速不仅显著高于同期宏观经济的整体增速,也快于大多数传统数字化产业的扩张速度。数据产业对经济增长的边际贡献正在扩大,一个直接的证据是:净增的近万亿元产值中,相当部分来自人工智能带动的全新增量需求,而非存量业务的此消彼长。换言之,这不是一场零和的份额转移,而是一次增量意义上的价值创造。
把三个数字放在一起看,结论更加清晰:产业规模、市场主体、产业结构三个维度同时向好,且相互印证。规模扩张说明需求真实存在,企业扩容说明供给能力活跃,结构升级说明增长质量在改善。在宏观经济整体处于新旧动能转换期的背景下,数据产业是为数不多保持两位数高增长、且由市场内生需求驱动的大赛道。可以说,数据产业已经完成了从政策概念期向产业兑现期的跨越。
| 核心指标 | 2024年 | 2025年 | 变化情况 |
| 数据产业规模(万亿元) | 5.86 | 6.78 | 增长15.7% |
| 数据企业数量(万家) | 超40 | 48.2 | 增长17.9% |
| AI相关数据产品与服务产值 | — | 4.99万亿元 | 占总产值73.6% |
| 较「十三五」末累计增幅 | 增长117% | — | 五年翻倍以上 |
需要说明的是,上述核心数据均来自国家数据发展研究院《中国数据产业发展报告(2026)》及国家数据局在2026数博会期间发布的权威信息,本文的交叉验证亦参考了新华社、央视新闻等官方渠道的公开报道,数据口径具备较高的可信度。
二、结构透视:4.99万亿元与73.6%,「AI浓度」成为产业底色
如果说6.78万亿元回答的是「产业有多大」,那么另一组数据回答的是「产业靠什么增长」。报告显示,2025年,包含人工智能应用软件的数据类软件产品,与包含词元服务的数据资源产品,产值规模合计达到4.99万亿元,占数据产业总产值的73.6%。换言之,在每100元数据产业产值中,有超过73元与人工智能直接相关。
先看两类产品的构成。所谓数据类软件产品,覆盖了从数据采集、清洗、标注、治理到人工智能应用软件的完整软件链条;而数据资源产品,则包括数据集、语料库以及新兴的词元服务——即把数据加工成大模型可以直接调用的智能服务单元。这两大类别的高增长,共同指向同一个源头:大模型的规模化落地。
词元经济的爆发是最直观的注脚。过去两年,我国日均词元调用量经历了一场「千倍级」跃迁——从2024年初的约1000亿,到2025年底突破100万亿,再到2026年3月站上140万亿的新台阶。调用量是智能服务消费的「电表读数」,两年增千倍,意味着社会层面的智能应用消费正在呈指数级扩张。国家信息中心的专家文章亦指出,国产大模型已在全球周调用量排名中包揽前四,词元经济正成长为中国智能经济最具活力的增长极。
这一结构变化的产业含义极为深远。传统数据产业的商业模式围绕「人」展开:为人提供报表、看板、数据库和分析工具,价值实现链条长、天花板低。而当数据产品的消费主体变成「模型」,一切都变了——大模型越强,对高质量数据的需求越旺盛;数据供给越充分,模型能力提升越快。这种「数据—模型」的双向飞轮,正在取代传统的信息化建设逻辑,成为数据产业的第一增长曲线。
值得注意的是,传统数据治理、数据中台、商业智能等业务并未萎缩,仍在稳定增长,但产业的边际增量、资本注意力与人才流向,正在加速向AI相关环节集中。对数据企业而言,「AI浓度」正在从可选项变为生存题:要么把数据能力接入智能化的价值链,要么在存量市场中逐步边缘化。
当然,七成占比也意味着深度绑定。数据产业的景气度从此与大模型产业周期高度相关,模型层的每一次技术跃迁、每一次资本冷暖,都会沿产业链向数据层传导。这既是动力,也是波动源,本文将在后文展开分析。
三、企业图谱:48.2万家数据企业的生态切片
48.2万家数据企业,构成了中国数据产业最具活力的微观基础。这庞大的市场主体内部,正在形成一个分工日益精细的产业谱系。以产值规模简单平均计算,每家数据企业对应约1400万元的年产值——这个数字直观地说明,中国数据产业呈现「海量中小服务商+头部引领者」并存的生态结构,产业主体仍是数量庞大的中小型专业企业,而非少数巨头。
从功能定位看,数据企业大致可以分为五类:
- 数据资源型企业:掌握数据采集、加工与供给能力,参与公共数据授权运营、行业数据集建设,是数据「原料」的提供方;
- 数据技术型企业(数商):提供数据标注、清洗、治理、隐私计算、区块链存证等技术服务,是数据「炼化」环节的专业力量;
- 数据应用型企业:开发人工智能应用软件与行业智能解决方案,直接面向千行百业交付智能价值;
- 数据安全型企业:提供数据分类分级、安全防护、合规审计等服务,为数据流通保驾护航;
- 数据基础设施型企业:建设数据流通交易设施、算力与存储底座,是产业的「高速公路」运营商。
资本的流向进一步勾勒出生态演进的方向。《中国数据产业发展报告(2026)》特别指出,2025年以来,大模型、仿真合成数据、具身智能数据服务等细分领域的企业融资活跃。这三个关键词颇具信息量:大模型企业持续吸纳资金,说明模型层竞赛仍未终局;仿真合成数据走红,反映出真实数据稀缺与隐私合规的双重约束下,数据供给正在开辟「人工制造」的第二战线;而具身智能数据服务的兴起,则预示着机器人产业爆发前夜,又一轮大规模「数据喂养」需求正在集结。
不过,企业数量的高增长也有另一面。平均每天约200家的新增速度,必然伴随相当程度的同质化竞争。目前,大量企业仍集中于数据标注、基础数据处理等门槛相对较低的环节,而高质量数据集建设、行业语料工程、数据资产运营等高价值环节的专业供给能力仍然不足。「数量领先、质量追赶」,是48.2万家企业画像的真实底色。
四、供给革命:从「数据资源」到「智能原料」,12.6万个高质量数据集意味着什么
数据产业的发展史,本质上是一部供给侧不断升级的历史。国家数据局在本届数博会上披露的最新数据显示,截至2026年8月,全国已建成高质量数据集超过12.6万个,数据总体量超过1815PB,较2026年一季度末大幅增长超89%。作为参照,2026年6月底这两个数字分别为12万个和1565PB——两个月内总体量增长约16%,供给扩张的速度可见一斑。
何为高质量数据集?官方定义是:经过采集、加工等数据处理,可直接用于开发和训练人工智能模型、能有效提升模型性能的数据的集合。这个定义的关键在于「可直接用于训练」和「有效提升性能」——它标志着数据供给的目标客户不再是「人」,而是「模型」。过去,数据的价值在于支撑人的分析与决策;现在,数据的价值在于喂养机器、生成智能。这是数据供给逻辑的一次根本性转变。
体量维度更能说明问题。截至2026年6月底,全国高质量数据集总体量超过1565PB,约相当于中国国家图书馆数字资源总量的547倍,覆盖科学研究、工业制造、医疗卫生、教育教学等重点行业领域。数据基础设施的建设重心,已经从「建数据中心、扩存储容量」演进到「建语料库、提数据质量」——这是继算力军备竞赛之后,智能基础设施竞赛的第二条战线。
与高质量数据集同步走向前台的,是「词元」这一新概念。国家数据局局长刘烈宏在数博会开幕式上表示,词元正开辟数据要素价值释放的全新路径;依托词元,可以把原始数据的价值加工转化为可调用的智能服务单元,为破解数据要素「价值难度量、收益难分配」等问题提供了新的解决方案。本届数博会直接以「词元——数据要素价值释放新路径」为主题,足见其分量。
从制度经济学的视角看,词元的意义在于为数据要素提供了「度量衡」。一个要素市场要真正成立,必须先有统一的计量单位和定价基准——正如电力交易离不开千瓦时,流量经济离不开字节。词元把抽象的数据价值转化为可统计、可计量、可结算的智能服务单元,这是数据从「资源」走向「资产」、进而走向可交易「资本品」的关键一跃。可以说,谁掌握了词元的计量与计价规则,谁就在一定程度上掌握了智能时代的价值分配话语权。
五、资本动向与市场化进程:钱在流向哪里,路还堵在哪里
产业数据之外,资本市场的动向是观察产业温度的另一个温度计。《中国数据产业发展报告(2026)》披露,大模型、仿真合成数据、具身智能数据服务等数据企业融资活跃。这与一级市场的公开信息相互印证:经历2023年至2024年的概念驱动阶段后,2025年以来的数据要素投资明显转向「业绩验证」逻辑——有订单、有场景、有复购的企业获得溢价,纯概念企业融资难度显著上升。
具体到细分赛道,三个方向最值得关注。其一,大模型及其上下游持续吸金,模型层竞赛外溢带动语料工程、数据标注基础设施等配套环节订单化,头部数据服务商的收入可见性明显改善;其二,仿真合成数据成为新热点,在真实数据获取成本高企、隐私合规约束趋严的背景下,「以合成补真实」正在成为数据供给的新范式;其三,具身智能数据服务快速升温,机器人训练所需的视觉、触觉、运动控制等多模态数据采集与处理,正在催生一批「具身数据工厂」。
从市场化配置的整体进程看,数据要素改革已经驶入「深水区」。第三方研究机构此前预测,2025年中国数据要素市场规模有望突破3000亿元,复合增长率超过30%。但即便按这一乐观口径,与6.78万亿元的数据产业总规模相比,通过市场化流通配置实现的部分仍属少数——大量数据价值的实现,仍以企业内部闭环和项目制交付为主。场内交易活跃度与产业总盘量之间的落差,恰恰说明数据要素的市场化配置仍处于早期。
制度基础设施的进展值得肯定:数据产权「三权分置」框架(数据资源持有权、数据加工使用权、数据产品经营权)已经确立;自2024年1月1日起,《企业数据资源相关会计处理暂行规定》正式施行,数据资源「入表」有了明确依据;全国数据交易场所体系逐步成形,公共数据授权运营在多地展开试点。从确权、登记、评估到交易、入表,制度拼图正在一块块补齐。
另一个值得注意的方向是出海。随着国产大模型在全球周调用量排名中进入前列,以模型能力为载体的数据服务正在成为中国数字服务输出的新形态——语料工程、数据标注、行业智能解决方案等能力的对外输出,可能成为「十五五」期间数据企业打开第二增长曲线的重要选项。当然,数据跨境流动的合规框架仍在完善之中,出海节奏受制度环境影响较大,企业宜以「能力出海、数据留境」的谨慎模式起步。
但冷静观察,入表不等于变现,挂牌不等于成交。数据资产评估方法尚未统一,收益分配机制仍在探索,跨主体、跨行业的数据互信成本依然高企。对多数数据企业而言,现金流仍主要来自对企业和政府的项目制收入,产品化、订阅化收入占比仍有较大提升空间。资本市场的热情与商业模式的成熟度之间,还存在一段需要时间填平的鸿沟。
六、政策坐标:从「数据二十条」到「智能经济新形态」
理解6.78万亿元,离不开政策坐标系。回望主线:2022年底,「数据二十条」出台,确立数据基础制度的四梁八柱;2023年10月,国家数据局挂牌,数据要素事务有了专职主管部门;2024年起,「数据要素×」三年行动计划全面铺开,公共数据资源开发利用的顶层设计文件相继落地,「人工智能+」行动写入政府工作报告。制度供给的密度和力度,在中国要素市场改革史上并不多见。
2026年政府工作报告首次明确提出「打造智能经济新形态」。从「十四五」时期对数字经济的战略布局,到「人工智能+」行动的深入实施,再到「智能经济新形态」的正式提出,中国经济的叙事主线正从「数字化」向「智能化」切换。数据产业恰好站在这条主线的关键节点上——它既是智能经济的「原料工业」,又是数据要素价值释放的「主战场」。
政策演进呈现清晰的三段逻辑:第一段是「制度先行」,解决数据能不能流通、归谁所有、如何交易的问题;第二段是「要素放量」,通过公共数据授权运营、高质量数据集建设、数据基础设施投资,做大供给基本盘;第三段是「智能跃迁」,围绕词元、大模型、智能体,推动数据价值实现方式从「人的消费」转向「机器的消费」。本届数博会发布的成果——词元、数据标注、数据基础设施、数字人才培养——恰好覆盖这三个层面,政策工具箱正在从「给政策」转向「给底座」。
对产业参与者而言,政策坐标的意义在于研判确定性:制度先行阶段的红利属于交易平台和合规服务商,要素放量阶段的红利属于数据基础设施建设者和公共数据运营方,而智能跃迁阶段的红利,将属于那些能把数据能力产品化、并深度接入智能产业链的企业。读懂政策节奏,就是读懂产业机会的时间表。
七、区域观察:数据产业地理版图与「数博会窗口」
产业数据的另一重解读维度,是地理版图。从公开信息看,中国数据产业呈现「东密西进」的格局:京津冀、长三角、粤港澳大湾区聚集了最密集的数据技术型企业与头部数商,在人工智能应用软件、数据交易服务与人才储备上占据领先位置;而以贵州为代表的中西部省份,则依托「东数西算」工程与先行先试的综合试验区探索,在算力基座与数据流通枢纽上形成了特色化位置。多极化、差异化的发展格局,正在取代早期一哄而上的同质化竞争。
数博会本身,就是产业温度计。贵州作为全国首个国家级大数据综合试验区,其主办的数博会已连续多年成为观察中国数据产业的政策与产品风向标。今年的专业展览围绕算力基座、数据供给、模型驱动、安全护航、智能体验等板块展开,「词元」成为贯穿始终的关键词。从展会热词的变迁可以读出产业重心的迁移:前几年的高频词是「数据交易」「数据资产」,如今则是「词元」「高质量数据集」「具身智能」——供给侧的语言体系已经彻底AI化,这是一场静默但深刻的范式转换。
区域竞争也在进入新阶段。各地政府正从「抢项目、给优惠」转向「建生态、供数据」:公共数据授权运营、行业高质量数据集、可信数据空间等基础设施,成为新一轮竞争的焦点。对地方而言,数据产业的竞争已不再是税收优惠的竞争,而是数据供给能力、制度创新速度与人才生态的系统性较量。谁能率先供给高质量、合规可用的数据要素,谁就能吸引模型与智能应用企业落地,形成「数据供给—模型训练—场景落地」的正向循环。
八、冷思考:高增长背后的六个待解命题
数据产业的年度成绩单足够亮眼,但一份严肃的市场调研,必须同时看见数字背后的结构性矛盾。综合报告数据与行业公开信息,以下六个命题值得持续跟踪。
命题一:供给的结构性矛盾
数据总量与体量增长迅猛,但高质量、行业化、合规可用的数据集仍集中于科研、工业、医疗、教育等少数先行领域,长尾行业的数据供给质量参差不齐。「有数据、缺语料」的错配依然存在——原始数据海量沉淀与训练级数据紧缺并存,是当前供给端最真实的写照。
命题二:商业模式的考验
48.2万家企业中,大量中小数据服务商依赖项目制收入,产品化率与订阅化率偏低,抗周期能力有限。产业总规模的快速增长,并不必然等于企业盈利能力的同步改善;如果价值分配长期向模型层和渠道层倾斜,数据服务环节可能出现「增收不增利」的尴尬。
命题三:定价与分配难题
词元为破解「价值难度量、收益难分配」提供了新思路,但词元计价体系、结算规则与收益分配机制仍处起步阶段。原始数据贡献者、数据加工者、模型开发商、平台运营方之间的利益平衡机制尚未定型,制度供给与产业扩张速度之间存在时间差。
命题四:安全与流通的平衡
数据分类分级、个人信息保护、重要数据出境等合规要求日趋严格,合规成本对中小企业构成现实压力。数据要素市场的活力来自流通,而流通的前提是安全可信——如何在「放得开」与「管得住」之间找到动态平衡,是需要长期精调的课题。
命题五:复合型人才缺口
既懂数据治理、又懂大模型训练、还懂行业知识的复合型人才严重稀缺。数据标注师、语料工程师、数据资产评估师、数据合规官等新职业的需求增速远超供给增速,人才瓶颈正在成为制约高质量数据供给的隐形天花板。
命题六:区域竞合与重复建设
各地建设数据产业园区、智算中心、语料基地的热情高涨,但功能定位趋同的现象已经出现。若缺乏全国一盘棋的统筹,新一轮重复建设与产能错配的风险不容忽视。数据基础设施的特殊性在于——建起来容易,喂饱它、用好它难。
换言之,6.78万亿元回答的是「规模」问题,而这六个命题回答的是「质量」问题。规模的扩张可以靠政策与资本在短期内完成,质量的提升则需要制度、技术、市场三方面更长时间的磨合。这也是判断这个产业成熟度时,最容易被欢呼声掩盖的维度。
九、趋势展望:「十五五」数据产业的五个判断
基于报告数据与产业逻辑,软盟资讯研究团队对「十五五」时期数据产业的走向作出五个基本判断。
判断一:规模向十万亿级迈进。以6.78万亿元为基数,若「十五五」期间保持10%至15%的年均增速,数据产业规模有望在2030年前后跨过10万亿元门槛,成为国民经济中名副其实的支柱型产业。考虑到人工智能应用渗透仍处早期,这一测算并不激进。
判断二:AI相关占比继续抬升。数据资源产品中词元服务的权重将进一步扩大,数据产品的形态加速从「库、表、报表」转向「语料、词元、智能服务单元」。数据产业的「AI浓度」很可能从七成向八成逼近,转型迟缓的企业将面临边缘化风险。
判断三:词元从概念走向基础设施。围绕词元的计量、计价、结算与监管体系有望逐步成形,词元可能成为智能时代的「千瓦时」,并催生词元交易、词元质量评估、词元审计等新的细分赛道。谁能率先建立可信的词元计量体系,谁就掌握了智能服务市场的「结算权」。
判断四:公共数据开发利用放量。随着授权运营制度成熟与高质量数据集建设推进,公共数据将成为产业最重要的增量供给来源,医疗、交通、气象、地理信息等高价值领域有望率先突破。公共数据的「水库开闸」,将系统性降低中下游企业的数据获取成本。
判断五:产业逻辑从「要素流通」走向「价值闭环」。数据产业的评价标准,将从交易额、挂牌量等过程性指标,逐步转向智能应用渗透率、行业效率提升幅度等结果性指标。数据要素的乘数效应能否真正穿透到实体经济的毛细血管,将是检验产业价值的最终标尺。
【软盟观察】:既不必仰视,也无需俯视——理性看待6.78万亿元
作为长期跟踪数据要素与人工智能产业的行业观察者,软盟资讯对《中国数据产业发展报告(2026)》的基本判断是:这是一份成色扎实、指向清晰的成绩单,但产业整体仍处于从「规模扩张」转向「质量深耕」的关键过渡期。对成绩不宜妄自菲薄,对问题也不应视而不见。
先说成绩的成色。15.7%的增速、接近万亿元的年度净增量、七成以上的AI相关产值占比,三个数据相互印证,说明数据产业已经不再是政策文件里的概念,而是拥有真实产值、真实就业、真实融资的产业实体。尤为可贵的是,这一轮增长主要由大模型落地带来的市场需求内生驱动,而非单纯依靠补贴与政策采购堆砌,其可持续性的基础明显好于以往任何一轮数据概念行情。48.2万家企业的主动入场,本身就是市场用脚投票的结果。
但客观而言,三点风险同样清晰。其一,七成产值与人工智能深度绑定,意味着数据产业的景气度将随大模型产业周期波动,一旦模型层的投资回报不及预期,结构性波动可能沿产业链向数据层传导,相关企业与投资者需对此有充分的心理与财务准备。其二,市场主体的快速扩容伴随同质化竞争,相当部分中小数据服务商的商业模式尚不稳固,行业或将在未来数年经历一轮筛选与出清。其三,词元等新计量体系仍处早期,「概念先行、规则滞后」的阶段性落差难以完全避免,市场参与者应警惕以新概念包装的估值泡沫。
对不同主体,我们的建议各有侧重。对从业者:与其追逐热点概念,不如深耕垂直行业的数据工程能力——高质量语料、行业数据集、可信数据空间的门槛正在快速抬高,这恰是专业玩家的护城河;对投资者:应严格区分「叙事价值」与「现金流价值」,优先关注订单可见、产品化程度高、客户结构健康的细分龙头;对政策制定者:制度供给的速度需要与产业扩张的速度相匹配,公共数据供给放量与词元计价规则的标准建设,宜快不宜慢。
数据产业的价值,最终不体现在报表的规模数字里,而体现在千行百业因数据与智能而获得的效率提升中。6.78万亿元是一个里程碑,但真正的考验——让数据要素的乘数效应穿透到实体经济的毛细血管——才刚刚开始。软盟资讯将持续跟踪这一进程,与读者共同见证中国数据产业从大到强的下一程。
数据来源说明:本文核心数据引自国家数据发展研究院《中国数据产业发展报告(2026)》及国家数据局在2026中国国际大数据产业博览会期间发布的信息,并参考新华社、央视新闻、人民日报等官方媒体的公开报道;分析部分为软盟资讯独立观点,仅供参考,不构成任何投资建议。
关于文章版权的声明:
https://news.softunis.com/71251.html 文章来自软盟资讯
若非本站原创的文章,特别作如下声明:
本文刊载所有内容仅供提供信息交流和业务探讨而非提供法律建议目的使用,不代表任何监管机构的立场和观点。不承担任何由于内容的合法性及真实性所引起的争议和法律责任。
凡注明为其他媒体来源的信息,均为转载,版权归版权所有人所有。
如有未注明作者及出处的文章和资料等素材,请版权所有者联系我们,我们将及时补上或者删除,共同建设自媒体信息平台,感谢你的支持!
