真实案例库
下面五个案例按课程实验顺序排列,全部可以直接落成一次上机任务;每个案例写明场景、用到的方法,以及最后要交的东西。
基金净值数据的清洗与质量审计
- 场景
- 从数据库导出的净值数据常常带有停牌期的空行、分红导致的跳变与重复记录,直接建模会得到毫无意义的结果。
- 知识点
- 缺失值识别与处理、重复值剔除、异常值检测(3σ/分位数)、数据类型转换、清洗前后对照表。
- 任务
- 对一只基金近三年的日净值做完整清洗,输出清洗前后行数、缺失比例、异常值数量的对照表,并用不超过 200 字说明每一类异常的处理理由。
小微企业信用风险的 logistic 分类
- 场景
- 用财务比率预测违约概率,是最常见也最容易做错的一类金融 AI 应用:样本极度不平衡,且误判成本并不对称。
- 知识点
- 逻辑回归、样本不平衡处理、特征标准化、分层抽样、混淆矩阵、精确率/召回率/F1/AUC、系数经济含义解读。
- 任务
- 完成模型训练与评估,指出在信贷场景中“召回率优先”还是“精确率优先”,并讨论把不可解释模型用于放贷决策时的公平性与申诉问题。
均线策略的 Python 实现与回测
- 场景
- 短均线上穿长均线买入、下穿卖出,是最容易理解也最容易踩到未来函数的入门策略。
- 知识点
- 移动平均构造、买卖信号生成、次日成交对齐、净值曲线、年化收益、最大回撤、夏普比率、交易成本与滑点。
- 任务
- 写出完整回测脚本并输出绩效指标字典;把换仓时间从收盘改为次日开盘后重跑,用净值差说明未来函数的影响有多大。
财经快讯的情感分析与人工复核
- 场景
- 给百余条财经短句打情感分看似简单,难点在于事实陈述与观点表达的区分,以及否定词、反讽的处理。
- 知识点
- 中文分词与停用词、情感词典构建、分值归一化、人工抽检一致率、误判归因。
- 任务
- 完成 100 条快讯的自动打分并随机抽 20 条人工核对,统计一致率;列出三类误判(事实句、否定句、行业特定词)并给出改进方案。
均线策略的参数优化与过拟合防范
- 场景
- 把 5 日/20 日换成任意组合,总能在历史数据上找到“最优”参数——但这份最优很可能只是噪声。
- 知识点
- 参数网格搜索、样本内外划分、滚动回测、绩效指标对比、过拟合识别。
- 任务
- 在样本内搜索最优参数并检查其在样本外的表现,报告中必须同时给出两段绩效,并写一段不少于 200 字的说明:为什么不能只报最优参数下的收益。