金融计量学 课程AI 赋能配图

AI 赋能

把大模型与智能工具引入备课、实训与过程评价

梳理 AI 在本课程中的具体赋能场景、工具链与可观测的能力画像。

  • 赋能场景
  • 工具链
  • 教学案例
  • 能力画像

AI 赋能教学

AI 正在改写金融计量的两条线:一是模型线,机器学习与 ARIMA、GARCH、HAR-RV 被放进同一套样本外框架里比较,胜负取决于损失函数与检验设计;二是流程线,大模型已能批量跑通经济学期刊的复现包并逐项核对系数。本课程的立场很明确:AI 负责加速,不负责背书——估计与检验在 EViews 完成,Python 做扩展与交叉验证,每一步结论都要人工复核。

AI 教学场景

将大模型与智能体引入课堂,覆盖从概念理解、代码实现到案例推演的全流程。

机器学习对阵传统计量:波动率预测

同一任务可以有两种答案。用 2013—2025 年高频买卖报价构造日度已实现方差,在滚动样本外框架下比较 HAR-RV、GARCH(1,1) 与随机森林、XGBoost、LightGBM,并用 QLIKE 打分、Diebold-Mariano 检验判断显著性,树模型明显领先:XGBoost 的 QLIKE 为 0.1219,HAR-RV 为 0.1482。

反向证据:经典模型也会赢

换到八个国际股指、2000—2021 年的样本重做,结论会翻转——HAR-RV 在 MSE、MAE、QLIKE 三个指标上全部优于最好的前馈神经网络,且在疫情冲击期排名依然稳定;另有新兴市场研究显示,非对称 EGARCH 在 VaR 回测中的表现优于 LSTM 与 GRU。机器学习不是默认赢家。

高频数据与已实现波动

把五分钟收益加总成日度已实现方差,是打通市场微观结构与风险管理的标准路径:得到的序列既可以做 HAR-RV,也可以喂给树模型或神经网络,最终服务于 VaR、期权定价与组合优化。

因果推断与政策评估

当要回答“某政策是否真的提高了企业绿色转型概率”时,线性控制难以处理高维非线性混淆变量。DoubleML 用机器学习先剔出混淆部分,再用 Neyman 正交得分做推断,给出带置信区间的处理效应,正好落在课程“稳健性检验/异质性检验”实验的延伸方向上。

自动化实证复现

斯坦福大学与香港浸会大学团队用智能体工作流复算了 92 篇工具变量论文、共 215 个设定,端到端成功率 87%;在数据与代码可获取的前提下,论文层面与设定层面的可复现率均为 100%。这是“复刻权威期刊论文”实验的自动化版本。

大模型辅助选题与写作

文献脉络梳理、变量口径对齐、结果段落初稿,交给大模型效率很高;但所有系数必须回到原始回归输出核对,所有引用必须回到原文核对;处理中文金融文献与非结构化文本时尤其容易张冠李戴。

AI 工具矩阵

以下工具可在本课程学习与实验中辅助检索、编码、建模与可视化。

statsmodels

Python 计量基础设施:OLS、ARIMA、VAR、单位根与协整检验、HAC 稳健标准误,语法与 R 风格公式一致,适合对 EViews 结果做交叉验证。

arch

Kevin Sheppard 维护的金融计量库:ARCH/GARCH/TARCH/EGARCH/RiskMetrics,ADF/DFGLS/KPSS 单位根,Engle-Granger 与 Phillips-Ouliaris 协整,Bootstrap 及 SPA/StepM 多重比较。

linearmodels

面板数据与 IV/GMM 库,支持固定效应、随机效应、Fama-MacBeth 回归与聚类稳健标准误,对应课程“面板数据分析与回归”实验。

DoubleML

Chernozhukov 双重机器学习的 Python 实现,支持 PLR/PLIV/IRM/IIVM 四类模型与交叉拟合,配合 scikit-learn 学习器做带统计推断的因果效应估计。

scikit-learn

随机森林、梯度提升、Lasso 等学习器,既充当 DoubleML 的干扰函数估计器,也充当波动率预测的对比基准。

RESSET 锐思数据库 / CNKI

前者提供股票、债券、基金、宏观与衍生指标及财经文本分析平台;后者承担文献检索、变量口径确认与参考文献管理。

实践现场

金融实验室机房内,学生在计算机终端前运行计量软件处理数据
AI 辅助建模最终发生在实验台上:模型由软件估计,系数要能在自己的机器上重算一遍,结论由人来复核。图片由课程站点统一配图。

即学即用的提示词

以下提示词可直接复制到主流大模型,辅助学习与本课程实验(请核验输出、遵守学术规范)。

用 Python 复算 EViews 的 ADF 检验

你是一位计量经济学助教。我有一个 pandas DataFrame,列名为 date、close,存储沪深300指数的日收盘价。请给出可直接运行的 Python 代码:1)对 close 取自然对数后再做一阶差分,生成收益率 r;2)用 statsmodels 的 adfuller 分别对 ln(close) 与 r 做 ADF 检验,输出 ADF 统计量与 p 值;3)把两个检验整理成一张两行的表格;4)依据结果判断“水平序列不平稳、一阶差分平稳”是否成立,并说明如果检验用 c、ct 两种趋势项设定,结论会不会不同。代码请逐行注释,并明确标出 lag 阶数选择方式。

ARIMA 模型的识别、估计与诊断

背景:我在做课程实验 2,数据是一段金融时间序列 y(已取对数收益率,共 800 个交易日)。请:1)画出 y 的时序图、ACF 图与 PACF 图;2)根据 ACF/PACF 的截尾与拖尾特征给出三组候选 (p,d,q);3)用 statsmodels 的 ARIMA 依次估计,输出 AIC 与 BIC 并挑出最优模型;4)对残差做 Ljung-Box 白噪声检验;5)用最优模型做未来 10 期预测并给出 95% 置信区间。请同时指出:为什么金融收益率序列通常 d=0,以及在什么情况下仍然需要考虑 ARFIMA。

GARCH 与机器学习的样本外对比

我要做一个“GARCH vs 机器学习”的对比实验。请给出 Python 思路与关键代码:1)用 arch 库估计 GARCH(1,1)、EGARCH 与 GJR-GARCH,输出条件波动率;2)构造 HAR-RV 所需的日、周、月已实现波动特征;3)用 XGBoost 预测下一日波动率;4)采用滚动窗口做样本外预测,用 QLIKE 与 MSE 评价;5)用 Diebold-Mariano 检验比较两类模型预测差异是否显著。最后请用一段话提醒我:这个实验必须报告哪些设定细节,否则结论不可信。

面板回归、稳健性检验与异质性分组

我在写一篇关于数字金融与商业银行效率的实证短文,数据是 2011—2023 年商业银行非平衡面板。请帮我:1)用 linearmodels 做个体固定效应与时间固定效应的双向固定效应回归,标准误聚类到银行层面;2)列出至少四种可行的稳健性检验(替换被解释变量、缩尾处理、剔除特殊年份、改变聚类层级);3)按银行性质分组回归,并用 Bootstrap 检验组间系数差异是否显著;4)帮我指出这份设计里最可能被审稿人质疑的一处设定。请给出可运行的 Python 代码骨架。

把一篇实证论文的表格复刻出来

目标:复刻一篇公开发表的实证论文中的主回归表(表格内容我会贴给你)。请按以下步骤帮我,并在每一步告诉我你要做什么:1)先列出论文中每个变量的定义、数据来源与样本筛选条件;2)把这张表格翻译成可执行的估计方程;3)写出对应的 Python 或 Stata 代码;4)我跑完之后,你根据我贴的回归输出,逐个系数核对差异并列出可能原因(样本区间、缩尾、聚类层级、缺失值处理)。注意:如果某个变量定义论文里没写清楚,请直接说“原文未说明”,不要替我猜。

AI 伦理与规范

使用 AI 须恪守学术诚信、数据安全与行业合规底线。

AI 生成的代码要逐行验证

大模型会给出语法正确但统计含义错误的代码:默认标准误不稳健、滞后阶数凭空指定、内生变量未做工具变量处理、面板数据忘记聚类。凡是要写进报告的结果,必须在 EViews 或 statsmodels 里重新跑一遍并比对输出。

文献、变量与数据出处不能由 AI 生成

政策名称、数据来源、引用链接常常看起来规范,回到原始数据库核对却发现并不真实;新旧信息混杂还会导致时间线错乱。所有文献条目与变量口径必须回到原文或原始数据库确认。

不要替 AI 的结论背书

同一波动率预测任务在不同样本、不同损失函数下会给出相反的模型排序。不要因为 XGBoost 在这一次赢了 GARCH 就写“机器学习优于传统模型”,必须同时报告样本外设计、损失函数与统计检验结果。

复现不等于公证,过程要留痕

用 AI 辅助复刻论文时,需记录每一步修改、数据来源与参数设置,保证结论可追溯。AI 只能作为执行工具,最终结果与责任归属仍在使用它的学生与指导教师身上。

对标高水平院校 实验项目