| 研究问题 | 中国开发的开源人工智能模型是否加速了本土企业在全球AI市场的技术追赶?开源生态对技术差距收敛的作用机制是什么? |
| 理论框架 | 技术追赶理论(Abramovitz, 1986;Gerschenkron, 1962);后发优势假说;开源创新理论(Lerner & Tirole, 2002) |
| 研究方法 | 双向固定效应面板 + 工具变量(IV)+ 中介效应模型;利用开源模型发布时点的准自然实验识别因果效应 |
| 数据来源 | 国家知识产权局专利数据库、智慧芽/PatSnap全球AI专利、Wind行业数据库、GitHub/Hugging Face开源项目数据、企业财报 |
| 创新点 | 从开源生态视角量化中国AI技术追赶速度,区分技术模仿与自主创新,识别开源对全球南方国家的溢出效应 |
基于Gerschenkron的后发优势理论,后发国家可通过技术模仿与制度创新实现跨越式追赶。开源人工智能模型降低了算法获取门槛,使中国企业能够以更低成本接入前沿技术,并通过二次创新形成自主知识产权。Abramovitz的追赶假说进一步指出,技术差距越大,追赶潜力越强。据此提出:H1:开源模型发布后,中国AI企业在全球专利份额和高质量专利占比显著上升;H2:开源生态通过降低研发成本和缩短学习曲线促进技术追赶;H3:该技术追赶效应在计算机视觉和自然语言处理领域强于通用基础模型领域。
利用中国主要开源AI模型(如DeepSeek、Qwen等)发布时点作为准自然实验,构建多期双重差分模型。以全球AI企业为样本,比较中国企业与对照组国家企业在开源发布前后的专利质量和市场份额变化。为缓解内生性问题,采用Bartik式工具变量:以模型开源前各国AI基础研究投入和算力基础设施作为技术采纳潜力的外生代理变量。关键识别假定:开源发布时点对单个企业而言外生;对照组国家未同时经历类似技术供给冲击。
基准回归方程为:
Y_{ict} = α + β OpenSource_t × China_c + γ X_{ict} + μ_i + λ_t + δ_c + ε_{ict}
其中Y_{ict}表示企业i在t年的专利质量(如平均被引次数)或全球市场份额;OpenSource_t为开源模型发布虚拟变量;China_c为企业所在国是否为中国;X_{ict}为控制变量向量;μ_i、λ_t、δ_c分别为企业、年份、国家固定效应。β为核心系数,预期显著为正。中介模型进一步检验研发成本下降和学习曲线缩短的机制路径。
被解释变量包括:AI专利申请量、被引次数加权专利质量指数、模型下载量市场份额。核心解释变量依据国产开源模型在GitHub/Hugging Face的发布日期构造。控制变量包括企业研发投入强度、员工中研发人员占比、前期专利存量、国家层面算力基础设施指数。样本期为2018—2026年,覆盖中美欧主要AI企业,数据来自国家知识产权局、智慧芽、Wind和开源社区。
(1)替换技术追赶测度:以专利创新性指标(如 novelty score)替代被引次数,检验结论对技术质量测度的敏感性;(2)安慰剂检验:随机抽取500组伪开源发布时点,估计系数应围绕0分布;(3)改变对照组:分别以韩国、日本或印度企业为对照组,观察结果稳健性;(4)排除同期政策干扰:控制"人工智能+"行动和地方政府AI专项补贴的影响;(5)使用PSM-DID重新匹配处理组与对照组,降低样本选择偏误。
---