主页 › 范文 › 应用经济 › 本文

资本管制事件数据集与LLM分类框架

摘要

文章构建了新型事件级资本管制措施(CCM)数据集,覆盖196个国家1999-2023年的5198个政策事件,包含行动类型、强度、方向等27个结构化字段。通过两步提示框架(GPT-4.1)从IMF AREAER报告中提取多维政策特征,并微调开源Llama 3.1-8B模型(CCM-Llama)实现自动化分类,在类别分类准确率达90.09%,状态预测准确率99.55%。实证应用表明,限制性资本管制显著减少资金流入,且政策效果存在跨国异质性。

1. 引言

资本管制在国际资本流动研究中至关重要,但现有政策数据集存在显著局限:传统指数(如Chinn-Ito指数)依赖IMF AREAER报告的二元状态指标(是/否),仅能提供低频年度数据,且忽略政策强度、工具类型和实施细节的异质性。这种粗粒度表征将性质迥异的干预措施等同处理,难以捕捉政策动态。文章提出事件级资本管制措施(CCM)数据集,利用基于提示的大语言模型(LLM)从文本中提取多维属性,突破传统数据构建的人力密集型瓶颈。

2. 基于提示工程的政策特征提取

2.1 数据源与处理方法

核心数据源于IMF《汇率安排与汇兑限制年报》(AREAER)1999-2023年文本,涵盖196国家的政策变更描述与生效日期。通过两阶段提示框架驱动GPT-4.1模型:系统提示定义分类模式(如行动类型、强度、方向),用户提示输入非结构化政策文本。关键字段包括:

  • 行动类型:10类动词(禁止/限制/许可/移除等)
  • 强度:限制性/自由化/条件性/中性
  • 方向:资本流入/流出/双向/未定义

模型输出附带原文引用与推理过程,确保可解释性。最终生成5198个事件记录,形成首个日频粒度的资本管制政策数据库。

2.2 数据集特征与典型事实

CCM数据集揭示关键规律:资本市场工具(XI.A.2类别)占比最高(图4),2008年金融危机与COVID-19期间干预频率显著上升。中高收入国家更频繁使用管制措施(图7),且高收入国家政策变动常引领全球趋势。自由化行动中"许可"类最多,而限制性措施以"限额"为主(图6),COVID-19期间"暂停"类政策激增。

3. 微调模型CCM-Llama的自动化分类

3.1 微调框架设计

为支持实时多源政策分类,基于Llama 3.1-8B微调构建CCM-Llama模型。训练数据整合AREAER终版报告与年度变更日志,通过三阶段流程构建29,012条样本:

  1. 国家名称标准化(如"Hong Kong SAR"映射为"Hong Kong")
  2. 训练对生成:结合政策文本与次年状态标签
  3. 对话格式转换,添加IMF类别层级描述(附录表A1)

微调采用自回归语言建模目标,损失函数为:

\[ \mathcal{L}_{\text{LM}}=-\sum_{i=1}^{n}\log P_{\theta}(t_{i}\mid t_{1},\ldots,t_{i-1}) \]

3.2 分类性能评估

在500条测试样本上,CCM-Llama二分类准确率99.55%,层级分类准确率(L3-L6)达72.98%,超越GPT-4.1等基线模型8.88个百分点(表5)。模型在细粒度分类(如XI.A.5.b.对内直接投资)表现突出,证明领域适应对政策文本解析的有效性。

4. 资本管制对资金流动的实证分析

使用EPFR全球资金流数据,以事件研究法检验资本管制效果。回归模型设定为:

\[ \text{Flowpct}_{it}=\sum_{\tau=-6}^{+6}\sum_{k\in\{\mathbb{L},\mathbb{R}\}} \beta^{k}_{\tau}\cdot\mathbbm{1}\{t=\tau\text{ and Intensity}=k\}+\alpha_{i}+ \gamma_{t}+\varepsilon_{it} \]

关键发现包括:

  • 中国限制性流入管制导致3个月内资金流入累计下降8%
  • 澳大利亚管制效果持续4个月,自由化政策无显著影响
  • 美国自由化措施仅产生短期资金流入提升

结果表明限制性政策效果更强,且存在跨国异质性,与制度背景和市场条件相关。

5. 结论

文章贡献包括:首创事件级CCM数据集,突破传统指数低频局限;开发高精度自动化分类模型CCM-Llama;实证验证资本管制效果异质性。该框架可扩展至实时新闻与央行公告分析,为资本流动预警系统提供支持。

相关论文