天气预报为什么有信息量
如果天气预报说“明天可能晴、可能雨、可能阴”,你其实没有得到多少有用信息,因为不确定性还是很高。若预报说“明天 90% 会下雨”,你就会带伞,因为不确定性明显下降。
熵衡量的正是这种不确定性。金融模型也是一样:如果模型对某类客户总是拿不准,那么这类客户的信息熵就高;如果加入某些变量后风险判断变清楚,说明这些变量提供了信息。
各种结果都差不多可能,难以下判断
概率集中,判断更明确
新证据让不确定性下降
第二章
不确定性度量、信息增益与模型融合
本章从信息熵、交叉熵、KL 散度、JS 散度和互信息出发,解释决策树、随机森林、Boosting 与反欺诈模型融合的理论基础。
本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。
熵衡量概率分布的不确定性。分布越平均,不确定性越高;分布越集中,不确定性越低。
如果天气预报说“明天可能晴、可能雨、可能阴”,你其实没有得到多少有用信息,因为不确定性还是很高。若预报说“明天 90% 会下雨”,你就会带伞,因为不确定性明显下降。
熵衡量的正是这种不确定性。金融模型也是一样:如果模型对某类客户总是拿不准,那么这类客户的信息熵就高;如果加入某些变量后风险判断变清楚,说明这些变量提供了信息。
各种结果都差不多可能,难以下判断
概率集中,判断更明确
新证据让不确定性下降
如果你买一部手机,只听一个人的建议可能有偏差;多看几位熟人的意见、专业评测和用户评论,结论通常更稳。集成学习也是这个思路。
随机森林像让很多棵树分别判断再投票,Boosting 像一组老师轮流批改错题,后一个模型重点处理前一个模型没看好的样本。
一个判断,容易受样本偶然性影响
多个模型独立判断后投票
后续模型重点纠正前面模型的错误
熵可以理解成“拿到这个信息之前,我有多拿不准”。如果一个客户群体违约和不违约几乎各占一半,模型就很难下判断。
某乡镇商户在旺季和淡季现金流差异很大。若模型不区分季节,风险分布会显得很混乱;加入季节变量后,熵可能明显下降。
一个变量让风险分布更清晰,是否一定说明它可以用于授信决策?还需要检查什么?
交叉熵衡量真实分布与预测分布之间的距离,是分类模型中最常用的损失函数之一。
交叉熵惩罚“自信地犯错”。在金融中,自信地把高风险客户判成低风险,比不确定地判断更危险。
如果模型对某小微企业给出 0.02 的违约概率,但后来违约,交叉熵损失会很大。这提醒我们要关注概率校准,而不是只看分类对错。
为什么风控模型需要概率校准,而不能只输出“通过/拒绝”?
金融数据会随宏观周期、监管政策和平台行为变化而发生分布漂移。散度指标可以帮助识别模型何时失效。
分布漂移就是“今天的客户已经不像训练模型时的客户”。金融场景中,这种变化经常由政策、平台规则或宏观周期触发。
如果某地电商平台补贴结束,小微商户流水结构会变化。模型仍按补贴期数据判断,可能低估真实风险。JS 散度可以作为预警指标。
模型上线后,应该按月监控哪些变量的分布变化?
互信息衡量一个变量对另一个变量不确定性的减少程度。它能捕捉非线性依赖,是金融特征筛选的重要工具。
互信息回答的是“这个变量能减少多少不确定性”,不是“这个变量是否有因果作用”。
手机充值频率可能与收入稳定性有关,因此对信用风险有信息量。但它未必是违约的原因,直接用于拒贷时要谨慎。
一个变量预测能力很强,但解释上可能涉及隐私或歧视,应如何处理?
决策树通过不断寻找能够最大幅度降低不确定性的划分变量来建立规则。
决策树的每一次分裂都像在问一个业务问题:先看哪个信息,最能把风险高低分开?
在小额经营贷中,第一层分裂可能是“近三个月流水是否明显下降”,第二层再看“是否有连续逾期记录”。这比直接给一个黑箱分数更容易沟通。
树模型规则越细越好吗?过细的规则可能带来什么问题?
集成学习通过组合多个弱学习器降低方差或偏差。Bagging 侧重降低方差,Boosting 侧重逐步修正偏差。
在小额贷款违约预测中,随机森林可作为稳健基准,梯度提升模型可进一步提升非线性识别能力,但必须配合样本外验证和模型解释。
可以把 Bagging 理解成“多人独立判断后投票”,Boosting 理解成“下一位专家重点纠正上一位专家看错的样本”。
普惠金融客户数据噪声大,随机森林能降低单棵树对偶然样本的敏感性;Boosting 往往预测更强,但更需要防止过拟合。
如果业务部门要求稳定、透明、容易解释,你会优先选择哪类集成模型?
反欺诈不要指望一个模型解决全部问题。更实际的架构是规则、异常检测、监督模型和人工审核共同工作。
某账户突然在夜间出现多笔异地小额转账,异常检测会报警;但是否欺诈还要结合设备、关系网络和客户确认结果。
为什么异常不等于欺诈?误把异常都当欺诈会产生什么后果?