🏭 产业经济 / 数字经济

去年全国活跃数据总量同比增28.46%

📅 发布日期:2026-06-14🔗 原文链接🎓 5 个论文选题

📄 新闻正文

记者从国家数据局获悉:2025年,全国活跃数据总量为1.67泽字节,同比增长28.46%;企业数据产品和服务数量同比增长29.29%,交易额同比增长39.8%。 今年是"数据要素×"三年行动计划的收官之年,行动计划实施两年多来,全社会数据意识明显提升,数据要素价值加快释放。国家数据局累计发布417个典型案例,11个行业领域的760个"数据要素×"典型场景指引,提前完成打造300个以上场景的目标。(记者 王云杉)

🎓 论文选题(5 个)

选题 1 · 新古典
数据要素纳入生产函数:测算、分解与资源配置效率
研究问题数据作为新型生产要素进入生产函数后,其对全要素生产率(TFP)的贡献度如何分解?数据要素市场的不完全性在多大程度上导致配置效率损失?
理论框架Solow 增长核算框架与 Hsieh-Klenow(2009)资源配置效率模型,将数据要素嵌入 Cobb-Douglas 生产函数,构建包含资本、劳动、数据三要素的宏观增长核算体系。
研究方法增长核算分解 + 反事实模拟。利用省份-行业面板数据,首先估算数据要素产出弹性,再通过 Hsieh-Klenow 方法测算数据要素错配导致的 TFP 损失。
数据来源国家数据局年度活跃数据总量公报、国家统计局投入产出表、各省市数据交易中心成交记录、《中国数字经济发展白皮书》省级面板。
创新点首次将国家数据局官方口径的"活跃数据总量"嵌入宏观增长核算框架,填补数据要素对 TFP 贡献的定量分解空白;引入要素错配视角测算数据配置效率损失。
1. 理论分析与研究假说

将数据视为与资本、劳动并列的第三类生产要素,拓展传统 Solow 模型。数据要素具有非竞争性和边际收益递增特征,与传统物质资本存在本质区别。假说 H1:数据要素对 TFP 的贡献具有显著的正向效应,且贡献增速逐年提高。假说 H2:区域间数据要素配置效率差异是解释 TFP 差异的重要来源。假说 H3:数据交易市场的发育程度对数据配置效率具有正向调节作用——交易越活跃的地区,数据错配程度越低。

2. 识别策略

核心识别挑战在于数据要素与 TFP 之间存在双向因果:高 TFP 地区可能产生更多数据。采用 Bartik 工具变量(Bartik, 1991)策略:以全国层面各行业数据产出增长率与地区初始行业结构的交乘项作为各省数据要素增长的工具变量。该 IV 利用全国行业趋势的外生变化,排除地区层面反向因果干扰。同时控制省份固定效应与年份固定效应,利用系统 GMM 处理动态面板内生性。

3. 计量模型设定

基准模型设定为:ln TFP_{it} = α + β₁ ln Data_{it} + β₂ ln K_{it} + β₃ ln L_{it} + γ X_{it} + μ_i + λ_t + ε_{it}。其中 Data_{it} 为 i 省 t 年活跃数据总量,K 和 L 为资本存量与劳动投入,X 为控制变量(R&D 投入强度、人力资本水平、市场化指数)。进一步建立 Hsieh-Klenow 错配方程:σ²(ln MRPK) 衡量资本-数据边际收益乘积的离散度,以此捕捉数据要素配置扭曲程度。

4. 变量构造与数据

被解释变量 TFP 采用 OP 法(Olley-Pakes, 1996)或 LP 法(Levinsohn-Petrin, 2003)在半参数框架下估算,避免同时性偏误。核心解释变量"活跃数据总量"来自国家数据局公报,按省份分配权重依据数字基础设施指数(5G 基站密度、数据中心机架数、互联网普及率加权合成)。资本存量采用永续盘存法核算,折旧率取 9.6%。样本为 2019-2025 年 31 个省份平衡面板。

5. 稳健性检验方案

(1)替换 TFP 估算方法:以数据包络分析(DEA)的 Malmquist 指数替代参数法 TFP,验证结论不依赖于特定估算技术。(2)改变工具变量构造方式:使用 Shift-Share 设计的替代方案——以相邻省份数据增长率的空间加权平均作为 IV。(3)剔除直辖市样本:北京、上海、天津、重庆的数据经济特征可能具有特殊性,剔除后重新估计。(4)安慰剂检验:随机打乱时间序列,检验"伪处理"是否产生显著效应。

---

选题 2 · 制度经济学
数据产权界定、交易成本与数据市场发育
研究问题数据产权界定的清晰程度如何影响数据交易的交易成本?"数据要素×"行动计划所构建的制度基础设施是否通过降低交易成本促进了数据市场繁荣?
理论框架Coase(1960)产权定理与 Williamson(1985)交易成本经济学。将数据交易视为一种高资产专用性、高不确定性的交易类型,分析产权界定在降低事前缔约成本与事后治理成本中的作用。
研究方法双重差分(DID)与中介效应分析。以各地数据交易所设立时点或"数据要素×"典型场景落地时点为政策冲击,检验制度供给对数据交易额的因果效应,并以交易成本指标为中介变量。
数据来源各地数据交易所(贵阳、上海、北京、深圳等)月度交易数据、国家数据局"数据要素×"典型案例库、各省数据条例(数据产权"三权分置"实施细则)出台时间、世界银行 Doing Business 合约执行效率相关指标。
创新点首次以 Coase-Williamson 框架系统分析中国数据产权"三权分置"制度的交易成本效应;利用"数据要素×"场景推广的准自然实验识别制度冲击。
1. 理论分析与研究假说

数据交易面临三重交易成本:确权成本——数据持有权、加工使用权、产品经营权的界定需要事前谈判;度量成本——数据价值难以标准化评估,导致定价困难;执行成本——数据易被复制泄露,事后违约风险高。基于 Coase 定理,清晰的产权界定是降低交易成本的前提。假说 H1:"三权分置"产权制度的确立通过降低确权成本显著促进数据交易额增长。假说 H2:数据交易所作为专用性治理结构(Williamson 意义上的"统一治理"),通过标准化合约降低度量成本与执行成本。

2. 识别策略

利用"数据要素×"典型场景在各行业的渐进推广构建多期 DID。处理组为被纳入典型场景指引的行业-地区对,对照组为尚未覆盖的行业-地区对。关键假设:典型场景的推广时序与行业-地区的不可观测特征无关——平行趋势检验通过事件研究法进行。以场景指引发布时间为节点,估计政策前后各期的动态处理效应,确保不存在预期效应。

3. 计量模型设定

基准 DID 模型:ln Trade_{ijt} = α + θ Treat_{ij} × Post_{ijt} + γ X_{ijt} + μ_{ij} + λ_t + ε_{ijt}。其中 Trade_{ijt} 为 i 地区 j 行业 t 期的数据交易额。进一步引入中介效应模型:Cost_{ijt} = α₁ + θ₁ Treat_{ij} × Post_{ijt} + Controls + ε;Trade_{ijt} = α₂ + θ₂ Treat × Post + δ Cost_{ijt} + Controls + ε。采用 Sobel 检验和 Bootstrap 法检验中介效应的显著性。

4. 变量构造与数据

被解释变量为各地数据交易所月度交易额(对数)。核心中介变量"交易成本"从三个维度构造:确权成本——以数据登记确权平均时长(天)代理;度量成本——以数据产品标准化程度(挂牌产品中标准化产品的占比)的倒数代理;执行成本——以数据交易纠纷仲裁案件数量代理。控制变量包括地区数字基础设施、GDP 总量、第三产业占比、法律制度环境指数(樊纲市场化指数中的律师人数子指标)。

5. 稳健性检验方案

(1)替换政策时点:改用各省数据条例正式施行日期替代场景指引发布时间,检验不同制度度量方式的一致性。(2)剔除头部交易所(上海、北京)样本:排除极端值对结论的驱动。(3)虚假政策时点检验:将处理组场景推广时间分别提前 1 年、2 年,检验"伪政策"是否产生效应。(4)PSM-DID:通过倾向得分匹配为每个处理组匹配最相似的对照组,缓解自选择偏误。

---

选题 3 · 政治经济学
国家数据局设立与央地数据治理博弈
研究问题国家数据局的设立作为数据治理领域的制度创新,如何重塑中央与地方政府在数据资源管理中的权力配置与博弈格局?央地互动模式对数据要素市场发育产生了怎样的差异化影响?
理论框架周黎安"行政发包制"与 Qian-Roland(1998)财政联邦主义理论。将数据治理视为一种新型治理资源,分析中央集权式数据管理机构(国家数据局)与地方政府在数据要素配置中的委托-代理关系与激励相容问题。
研究方法多案例比较与合成控制法。选择东中西部各典型省份,比较其在国家数据局成立前后的数据政策创新力度与数据市场发育差异,构建省级数据治理积极性指数。
数据来源国家数据局公开文件与政策汇编、31 个省份数据局(大数据管理局)设立时间与机构编制文件、各省数据条例文本(Nvivo 编码分析)、各地数据交易所政府持股比例与治理结构。
创新点以"行政发包制"理论解释数据治理领域的央地关系;将政府数据管理机构设置为制度变量,量化其对数据市场发育的政治经济学效应。
1. 理论分析与研究假说

根据行政发包制理论,中央政府通过"发包"将政策执行任务下放给地方政府,同时保留目标设定和考核权。国家数据局的设立强化了中央对数据资源的集中管控(数据确权、安全、跨境流动),但地方数据局的设立赋予了地方在招商引资和产业培育中的自主空间。假说 H1:国家数据局的设立通过顶层设计统一了数据规则,降低了地方间的制度竞争("逐底竞争"风险)。假说 H2:地方数据局设立越早、行政级别越高的省份,数据交易市场发育程度越高——体现了激励相容效应。

2. 识别策略

核心策略为合成控制法(Abadie et al., 2010):将国家数据局设立较早的省份作为处理组,利用其他省份的加权组合构造"合成控制"反事实。关键识别假定:处理组在政策冲击前的趋势可由对照组线性组合良好拟合。以省级数据局设立时间为政策冲击节点(各地设立时间不同,形成交错 DID 结构),同时控制省级领导的职业背景(是否具有数字经济相关履历)作为工具变量处理内生性。

3. 计量模型设定

合成控制法通过最小化政策冲击前处理组与合成组的预测误差平方和来求解最优权重向量 W*。处理效应估计为:τ_{it} = Y_{it} - Σ_{j∈control} w_j* Y_{jt},其中 t > T₀(政策冲击后)。进一步采用交错 DID 回归:ln Market_{it} = α + β DataBureau_{it} + γ X_{it} + μ_i + λ_t + ε_{it},DataBureau_{it} 为省级数据局是否已设立的虚拟变量。引入交互项检验央地垂直管理强度(国家数据局案例指引数量)的调节效应。

4. 变量构造与数据

被解释变量为省级数据市场发育指数,由 4 个子指标合成:数据交易所年成交额、数据型企业注册数量增速、政府数据开放平台数据集数量、数据相关地方性法规和规范性文件数量。核心解释变量为省级数据局设立虚拟变量与行政级别。控制变量包括:省委书记/省长是否具有数字经济相关履历、省级财政科技支出占比、数字基础设施指数。样本区间为 2018-2025 年。

5. 稳健性检验方案

(1)置换检验(Placebo test):将合成控制法应用于每个对照组省份,构造伪处理效应的经验分布,检验处理组效应的统计显著性。(2)剔除直辖市样本:直辖市的央地关系具有特殊性。(3)替换合成变量:改用 DID 或 DIDM(matrix completion)方法替代合成控制法。(4)改变处理组定义:仅以省级数据局行政级别(正厅级 vs 副厅级)作为处理强度变量,检验集约边际效应。

---

选题 4 · 发展经济学
"数据要素×"三年行动与产业结构跃迁
研究问题"数据要素×"三年行动计划作为产业政策工具,是否在行业层面推动了产业结构从传统要素驱动向数据驱动的跃迁?其作用机制是通过存量改造还是增量培育实现的?
理论框架Gerschenkron(1962)后发优势理论与 Acemoglu-Restrepo(2018)自动化与新任务模型。将"数据要素×"政策置于结构转型的分析框架中,探讨数据要素的引入如何改变产业间的要素配置与新产业的孵化路径。
研究方法行业层面的三重差分(DDD)+ 投入产出网络分析。以被"数据要素×"典型场景覆盖的行业为处理组,未被覆盖的行业为对照组,比较产业结构高级化与合理化的差异演变,并通过投入产出表追踪数据效应在产业链中的传导。
数据来源国家数据局 760 个"数据要素×"典型场景指引、国家统计局分行业增加值与就业数据、2018/2020/2022 年投入产出表、A 股上市公司数字化转型指数(基于年报文本分析)。
创新点以投入产出网络视角捕捉"数据要素×"的产业链外溢效应;区分"存量数字化改造"与"增量数据产业培育"两种结构转型机制。
1. 理论分析与研究假说

发展经济学中的后发优势理论认为,后发国家可以通过引进和模仿先进技术实现跨越式发展。"数据要素×"政策本质上是国家对数据这一通用目的技术(GPT,General Purpose Technology)的推广干预。假说 H1:被"数据要素×"典型场景覆盖的行业其产业结构高级化指数(高技术产业占比)的提升速度显著快于未被覆盖行业。假说 H2:数据要素通过投入产出关联产生前向和后向外溢——数据密集型行业的上游供应商和下游客户行业也同步获益。假说 H3:政策效应主要通过"增量培育"(新数据企业净进入率)而非"存量改造"(传统企业数字化率提升)实现。

2. 识别策略

采用三重差分法(DDD):第一重为行业维度(是否被"数据要素×"典型场景覆盖),第二重为时间维度(政策前后),第三重为地区维度(数字基础设施高低分组)。DDD 估计量可剔除行业固有趋势和地区固有差异,识别政策净效应。以行业-地区面板为分析单元。关键识别假定:在政策冲击前,处理组与对照组在产业结构指标上具有平行趋势。事件研究法检验前提成立性。

3. 计量模型设定

DDD 模型:Y_{ijt} = α + β₁ Treat_j × Post_t × HighInfra_i + β₂ Treat_j × Post_t + β₃ Treat_j × HighInfra_i + β₄ Post_t × HighInfra_i + γ X_{ijt} + μ_{ij} + λ_t + ε_{ijt}。其中 Y_{ijt} 为 i 地区 j 行业 t 期的产业结构高级化指数。Triple interaction 系数 β₁ 捕捉数字基础设施较好地区中,被场景覆盖行业的额外结构转型效应。进一步引入投入产出加权:将下游行业的被解释变量按直接消耗系数矩阵加权,构造"数据效应传导力"指标。

4. 变量构造与数据

核心被解释变量为产业结构高级化指数(高技术制造业和服务业增加值占比)与产业结构合理化指数(泰尔指数的倒数)。处理变量为行业-年份层面的"数据要素×"典型场景覆盖虚拟变量。调节变量为地区数字基础设施综合指数。投入产出传导变量基于 2020 年和 2022 年全国投入产出表,计算各行业的直接消耗系数和完全消耗系数矩阵。样本为 2019-2025 年 31 省份 × 19 个国民经济大类的非平衡面板。

5. 稳健性检验方案

(1)更换结构转型度量:以行业全要素生产率增速替代产业结构指数。(2)排除政策同期干扰:控制同期"东数西算"工程、数字经济创新发展试验区等政策虚拟变量。(3)空间溢出检验:构建空间杜宾模型(SDM),检验邻省数据要素政策对本省产业结构的空间溢出效应。(4)分位数回归:检验"数据要素×"政策在不同产业结构水平分位数上的异质性效应,验证是否存在"马太效应"。

---

选题 5 · 劳动经济学
数据要素扩张的劳动力市场效应:技能偏向与就业极化
研究问题数据要素的快速积累与"数据要素×"行动计划的推进,是否加剧了中国劳动力市场的技能偏向型技术变革(SBTC),从而导致就业极化?不同技能水平劳动者的工资与就业受到何种差异化的影响?
理论框架Autor-Levy-Murnane(2003)任务模型(ALM 框架)与 Acemoglu-Autor(2011)任务分配理论。将数据视为执行认知任务的"数字劳动力",分析其对高、中、低技能任务的替代与互补效应。
研究方法微观个体层面的 Mincer 工资方程拓展 + 行业-职业层面的任务内容变化分析。利用双重差分的行业层面识别,结合中国劳动力动态调查(CLDS)微观数据,估计数据要素渗透对个体工资和就业概率的因果效应。
数据来源中国劳动力动态调查(CLDS,中山大学,2016/2018/2020/2022 波次)、国家数据局行业级活跃数据量、职业信息网络(O*NET)中国适配版的任务内容数据库、中国家庭收入调查(CHIP)。
创新点首次将国家数据局行业级活跃数据量与微观劳动力调查匹配,在中国语境下实证检验"数据替代中等技能任务"的就业极化假说;区分常规认知任务与非常规分析任务的异质性劳动力市场效应。
1. 理论分析与研究假说

Autor-Levy-Murnane(2003)的 ALM 模型将工作任务分为常规任务(routine)和非常规任务(non-routine),计算机技术替代常规任务但补充非常规认知任务。数据要素作为一种数字化的信息投入,可能遵循类似逻辑:替代以数据处理为主的中等技能常规认知工作(如会计、文秘),同时增加对数据分析师、算法工程师等高技能非常规认知岗位的需求。假说 H1:数据要素渗透率越高的行业,中等技能劳动者的就业份额下降越显著——即就业极化。假说 H2:数据要素显著提高高技能劳动者的工资溢价,扩大技能工资差距。假说 H3:数据要素对低技能体力服务业岗位的替代效应较弱(任务互补)。

2. 识别策略

核心识别策略为行业层面的 Bartik 工具变量与微观工资方程相结合。以全国层面数据要素总量增长与地区-行业初始数据使用强度的交乘项(Bartik IV)作为行业数据渗透率的工具变量。个体层面的工资方程使用 Heckman 两步法校正样本选择偏误。在行业-职业层面,通过计算各职业的常规任务强度(RTI,Routine Task Intensity)与行业数据渗透率的交互项,识别数据要素对中等常规任务岗位的因果替代效应。

3. 计量模型设定

个体层面两阶段方程:第一阶段,采用 Mincer 工资方程拓展形式——ln wage_{i} = α + β DataPenetration_{j(i)} + γ X_i + δ OccChar_i + ε_i,DataPenetration_{j} 为个体 i 所属行业 j 的数据渗透率。第二阶段,以行业 Bartik IV 进行 2SLS 估计。就业极化检验设定为:ΔShare_{jk}^{occ} = α + β₁ RTI_k × ΔData_j + β₂ RTI_k + β₃ ΔData_j + ε_{jk},其中 ΔShare_{jk}^{occ} 为 j 行业中职业 k 的就业份额变化,RTI_k 为职业 k 的常规任务强度指数。

4. 变量构造与数据

个体层面被解释变量为对数小时工资和就业状态(二值变量)。核心解释变量为行业数据渗透率:以行业活跃数据量除以行业从业人数(人均数据产出)度量。职业常规任务强度(RTI)参照 Autor-Dorn(2013)方法,基于 O*NET 任务内容维度在中国职业分类体系中进行映射和计算。控制变量包括个体特征(教育年限、经验、经验平方、性别、户籍)、企业特征(所有制、规模)、地区特征(最低工资水平)。数据跨度为 2016-2022 年四个调查波次。

5. 稳健性检验方案

(1)替换任务内容度量:以中国本土开发的职业任务调查数据替代 O*NET 中国适配版,验证 RTI 度量的一致性。(2)排除数字经济核心行业样本:剔除信息技术服务业样本,检验结论是否由少数行业驱动。(3)队列分析:按出生队列分组,利用不同出生队列面临数据技术渗透的时点差异构造队列 DID。(4)边界断点设计:以省级数据交易所设立为断点,比较数据交易所所在城市与非所在城市劳动力的工资差异变化。

---