| 研究问题 | 数据作为新型生产要素进入生产函数后,其对全要素生产率(TFP)的贡献度如何分解?数据要素市场的不完全性在多大程度上导致配置效率损失? |
| 理论框架 | Solow 增长核算框架与 Hsieh-Klenow(2009)资源配置效率模型,将数据要素嵌入 Cobb-Douglas 生产函数,构建包含资本、劳动、数据三要素的宏观增长核算体系。 |
| 研究方法 | 增长核算分解 + 反事实模拟。利用省份-行业面板数据,首先估算数据要素产出弹性,再通过 Hsieh-Klenow 方法测算数据要素错配导致的 TFP 损失。 |
| 数据来源 | 国家数据局年度活跃数据总量公报、国家统计局投入产出表、各省市数据交易中心成交记录、《中国数字经济发展白皮书》省级面板。 |
| 创新点 | 首次将国家数据局官方口径的"活跃数据总量"嵌入宏观增长核算框架,填补数据要素对 TFP 贡献的定量分解空白;引入要素错配视角测算数据配置效率损失。 |
将数据视为与资本、劳动并列的第三类生产要素,拓展传统 Solow 模型。数据要素具有非竞争性和边际收益递增特征,与传统物质资本存在本质区别。假说 H1:数据要素对 TFP 的贡献具有显著的正向效应,且贡献增速逐年提高。假说 H2:区域间数据要素配置效率差异是解释 TFP 差异的重要来源。假说 H3:数据交易市场的发育程度对数据配置效率具有正向调节作用——交易越活跃的地区,数据错配程度越低。
核心识别挑战在于数据要素与 TFP 之间存在双向因果:高 TFP 地区可能产生更多数据。采用 Bartik 工具变量(Bartik, 1991)策略:以全国层面各行业数据产出增长率与地区初始行业结构的交乘项作为各省数据要素增长的工具变量。该 IV 利用全国行业趋势的外生变化,排除地区层面反向因果干扰。同时控制省份固定效应与年份固定效应,利用系统 GMM 处理动态面板内生性。
基准模型设定为:ln TFP_{it} = α + β₁ ln Data_{it} + β₂ ln K_{it} + β₃ ln L_{it} + γ X_{it} + μ_i + λ_t + ε_{it}。其中 Data_{it} 为 i 省 t 年活跃数据总量,K 和 L 为资本存量与劳动投入,X 为控制变量(R&D 投入强度、人力资本水平、市场化指数)。进一步建立 Hsieh-Klenow 错配方程:σ²(ln MRPK) 衡量资本-数据边际收益乘积的离散度,以此捕捉数据要素配置扭曲程度。
被解释变量 TFP 采用 OP 法(Olley-Pakes, 1996)或 LP 法(Levinsohn-Petrin, 2003)在半参数框架下估算,避免同时性偏误。核心解释变量"活跃数据总量"来自国家数据局公报,按省份分配权重依据数字基础设施指数(5G 基站密度、数据中心机架数、互联网普及率加权合成)。资本存量采用永续盘存法核算,折旧率取 9.6%。样本为 2019-2025 年 31 个省份平衡面板。
(1)替换 TFP 估算方法:以数据包络分析(DEA)的 Malmquist 指数替代参数法 TFP,验证结论不依赖于特定估算技术。(2)改变工具变量构造方式:使用 Shift-Share 设计的替代方案——以相邻省份数据增长率的空间加权平均作为 IV。(3)剔除直辖市样本:北京、上海、天津、重庆的数据经济特征可能具有特殊性,剔除后重新估计。(4)安慰剂检验:随机打乱时间序列,检验"伪处理"是否产生显著效应。
---