智能风控:从规则判断到实时感知
银行信贷风控正在把客户资料解析、图像识别与风险评估交给 AI 流水线完成。适用于普惠金融场景的智能审贷助手,每天支持三农、信用卡等信审场景超过 3 万笔业务,对十余种图像做识别、提取与分类;招行、蚂蚁等机构的实时风控引擎则在支付环节做毫秒级决策。
把大模型与智能工具引入备课、实训与过程评价
梳理 AI 在本课程中的具体赋能场景、工具链与可观测的能力画像。
国内金融机构的大模型已经跑过了概念验证阶段:工商银行企业级千亿金融大模型体系已赋能 20 余个主要业务领域、200 余个场景,2025 年上半年又新增 AI 财富助理、投研智能助手等 100 余个场景;邮储银行开展了 230 余项大模型场景建设,其智能审贷助手每天支撑超过 3 万笔业务。本课程的定位不是带学生造这些系统,而是拆清楚它们的前三层:数据从哪来、模型怎么建、结果凭什么可信。
将大模型与智能体引入课堂,覆盖从概念理解、代码实现到案例推演的全流程。
银行信贷风控正在把客户资料解析、图像识别与风险评估交给 AI 流水线完成。适用于普惠金融场景的智能审贷助手,每天支持三农、信用卡等信审场景超过 3 万笔业务,对十余种图像做识别、提取与分类;招行、蚂蚁等机构的实时风控引擎则在支付环节做毫秒级决策。
信息过载是投研行业的常态。部分券商自研的 AI 研究员已能处理海量公开信息与研报,把信息整理环节的效率提升 90% 以上;有银行推出的投研 AI 助手融合轻量化大模型与多智能体技术,把原本需要数十小时的百页级报告生成压缩到分钟级。
财富管理端把风险偏好、生命周期阶段与市场动态纳入配置建议,原本只面向高净值客户的调仓逻辑开始普惠化:当系统识别到家庭支出结构变化,会相应调整权益与货币类资产的比例。这类服务的核心难点不是收益率,而是适当性管理与算法透明。
国际资管机构的公开判断很克制:LLM 对量化投资最有价值的不是“给买卖信号”,而是把文本变成可计算的向量——度量公司沟通语气的变化、跟踪业绩说明会的主题漂移、测算当前新闻流与历史上盈利预警前的相似度。这些都可以作为因子,进入学生能复现的回测框架。
大模型在合规侧落地更快:有基金公司把 DeepSeek 蒸馏模型部署到风险中台用于合规审核,公开报道称自动识别精度由 85% 提升至 95%;这类任务规则边界清晰、纠错成本低,是学生实验最贴近产业的切入点。
头部机构的共同做法是把行情、财报等数据接口与 Python 计算环境接到智能体上:模型负责组织分析步骤,确定性代码负责算出结果。有券商联合技术平台孵化的 A 股观察助手即采用这一路径——这正是本课程要训练的核心能力:用可靠的工具链约束不可靠的生成。
以下工具可在本课程学习与实验中辅助检索、编码、建模与可视化。
数据导入、格式转换、缺失值与异常值处理、描述性统计与向量化计算,是后续所有建模的前置环节。
逻辑回归、决策树、随机森林等算法,与 train_test_split、StandardScaler、classification_report、混淆矩阵、ROC 曲线等评估工具的统一接口。
折线图、柱状图、热力图与相关性矩阵,把数据趋势与变量间关系呈现出来。
财经短句与公告文本的切分、停用词过滤与词频统计,是中文金融文本情感分析的基础步骤。
提供股票、基金、债券与研究报告数据,以及财经文本智能分析平台,是全部实验的数据来源。
用于补齐样板代码、解释报错与重构函数;生成的代码必须逐段运行验证后才能进入实验报告。

以下提示词可直接复制到主流大模型,辅助学习与本课程实验(请核验输出、遵守学术规范)。
金融数据的清洗流程
你是一位金融数据分析助教。我手上有一份从 RESSET 导出的个股日行情 CSV,字段为 code、date、open、high、low、close、volume,可能存在停牌导致的缺失、录噪导致的异常与重复行。请给出可直接运行的 pandas 代码:1)读取并检查每列的缺失比例与数据类型;2)给出缺失值的三种处理方案(删除、前向填充、按板块均值填充)并说明各自适用场景;3)用 3σ 与分位数两种规则识别异常值并对比一致率;4)剔除完全重复行;5)输出清洗前后行数、缺失比例与异常值数量的对照表。请勿删除我未指定的列,不要擅自改字段名。描述性统计与可视化
数据是一张 DataFrame,包含某只基金的净值序列 nav 与沪深300指数收益 ret,索引为日期。请:1)输出 nav 与 ret 的均值、标准差、偏度、峰度、最大值与最小值;2)画一张双轴折线图展示净值走势与基准;3)计算两者的相关系数并画联合分布散点图;4)对多只基金的月度收益做相关性矩阵并画热力图;5)用一段话说明:偏度与峰度告诉我什么,为什么金融资产收益常常呈现尖峰厚尾。用逻辑回归做信用风险分类
我在做课程实验 4:用企业财务比率预测违约。数据列为 roa、lev、liquidity、turnover,标签为 default(0/1),正负样本比例约 1∶9。请给出 Python 代码:1)做缺失值处理与特征标准化;2)按分层抽样划分 7∶3 的训练集与测试集;3)用 sklearn 的 LogisticRegression 训练,注意写出 class_weight 的处理方式;4)输出混淆矩阵、准确率、精确率、召回率、F1 与 AUC;5)解释逻辑回归系数的经济含义。最后请提醒我:为什么在信贷场景里,只看准确率会出严重后果。双均线策略编写与回测
数据为个股日收盘价 close(pandas Series,索引为日期)。请写一个完整的 Python 回测脚本:1)计算 5 日与 20 日移动平均线;2)金叉买入、死叉卖出,构造持仓信号列 position;3)按次日开盘成交的方式计算策略日收益,避免未来函数;4)净值曲线与累计收益、年化收益、最大回撤、夏普比率的计算;5)考虑千分之三的双边交易成本后重跑一次并对比结果。请把绩效指标写成一个返回 dict 的函数,便于我做多组参数比较。中文财经文本情感分析与人工复核
我要对 100 条财经快讯做情感打分。请给出 Python 代码:1)用 jieba 分词并加载停用词表;2)用情感词典法给每条文本打分并归一化到 -1 到 1;3)输出最正面与最负面的各 5 条原文及分值与命中词;4)随机抽取 20 条由我人工核对,统计人与词典的一致率;5)列出一致率低于 60% 时应考虑的三类改进方向。请特别提醒:如果某条文本是事实陈述而非观点,打分意义有限,这种情况要单独标注出来。使用 AI 须恪守学术诚信、数据安全与行业合规底线。
业内公开讨论的教训可以归纳为三类:政策名称、数据来源与引用链接看似完备,回到原始库核对却发现并不真实;新旧信息混杂导致时间线错乱;为构建完整叙事而让中间证据链断裂。因此课程要求情感分析实验必须人工抽检复核。
依赖 AI 生成的建议导致决策失误时,责任归属于选择使用它的人与机构。国际资管机构对此的表述很直接:必须有具备批判性判断的专业人士在控制回路里,也只能由人来承担后果。
实验数据必须来自学校订购的合规数据库,禁止爬取未授权的个人金融信息与非公开数据;这既是《个人信息保护法》的要求,也是金融科技从业者的底线合规边界。
参数在历史样本上反复调优后得到的高收益,往往在样本外立刻消失。任何策略实验都必须做样本内外划分或滚动回测,并在报告中同时给出两段表现,不允许只报最优参数下的收益。