给一班学生分组
如果老师不了解学生,最开始可能不会直接判断谁成绩好,而是先观察:谁擅长数学,谁表达能力强,谁动手能力强,谁需要更多基础训练。分组的目的不是贴标签,而是更有针对性地教学。
聚类在金融中也是这样。我们先不急着判断谁违约,而是先看客户结构:稳定经营型、季节波动型、快速成长型、低活跃型,之后再设计不同产品和风控策略。
暂时不知道真实风险结果
根据行为和特征形成群体
不同群体采用不同服务和监控方式
第四章
无监督学习、客户画像与隐含结构发现
本章围绕无监督学习的金融价值,介绍相似性度量、K-means、K-means++、肘部法则、聚类评估、高斯混合模型和 EM 算法。
本课件中的数学公式已在本地构建阶段预渲染为静态 HTML/MathML,并使用随站点发布的本地字体与 CSS;页面不加载浏览器端公式渲染脚本。
聚类不依赖预先标注的违约、欺诈或流失标签,而是从数据内在结构中发现相似群体。
如果老师不了解学生,最开始可能不会直接判断谁成绩好,而是先观察:谁擅长数学,谁表达能力强,谁动手能力强,谁需要更多基础训练。分组的目的不是贴标签,而是更有针对性地教学。
聚类在金融中也是这样。我们先不急着判断谁违约,而是先看客户结构:稳定经营型、季节波动型、快速成长型、低活跃型,之后再设计不同产品和风控策略。
暂时不知道真实风险结果
根据行为和特征形成群体
不同群体采用不同服务和监控方式
聚类不是为了直接决定谁能贷款,而是帮助我们先看清客户结构。它是“画像工具”,不是“审批按钮”。
同样是小微商户,有人流水稳定但规模小,有人规模大但波动强。聚类可以把这两类客户分开,再设计不同授信策略。
聚类结果出来后,为什么还要用后续违约率或经营表现验证?
不同距离度量对应不同的“相似”定义。度量选择错误会直接导致聚类结果失真。
距离度量决定了模型眼中的“像不像”。选择距离前,先问业务上到底比较规模、结构,还是时间节奏。
两个农户收入总额不同,但一年中的收支季节性非常相似。欧式距离可能认为他们差异大,DTW 或结构比例可能更合适。
如果变量单位不同,例如收入金额和交易次数,为什么必须先标准化?
K-means 通过最小化簇内平方和寻找簇中心,是最经典的聚类方法。
K-means 找的是几个“代表性中心”。它适合快速分群,但不擅长处理形状复杂或异常值很多的数据。
银行可以用 K-means 把小微客户分成稳定经营型、快速成长型、季节波动型和低活跃型,再给出不同服务策略。
如果某个簇只有极少数客户,是新机会,还是异常噪声?如何判断?
聚类没有真实标签时,不能只凭视觉效果判断。需要结合内部指标、稳定性和业务可解释性。
选簇数不是数学题的唯一答案,而是数学指标和业务可解释性的折中。
模型可能建议分成 8 类,但客户经理只能清楚解释 4 类。实际落地时,4 类方案可能更适合培训和执行。
一个聚类方案统计指标很好,但业务人员完全解释不了,是否应该采用?
GMM 把数据视为多个高斯分布的混合,允许样本以概率形式属于多个簇,因此属于软聚类。
GMM 的“软分配”很适合金融客户,因为很多客户并不完全属于某一类,而是处在两类之间。
一个商户既有稳定社区零售特征,又开始出现线上销售增长。GMM 可以给出它属于两类的概率,而不是强行归入一类。
软分类结果如何帮助银行设计过渡型客户服务?
EM 用于含有隐变量的最大似然估计。聚类中的簇标签就是典型隐变量。
EM 可以理解为“先猜隐藏标签,再根据猜测更新参数”,如此反复。它适合标签看不见但结构存在的问题。
客户真实经营类型可能无法直接观察,但交易数据中隐含了类型差异。EM 就是在这些隐藏类型和模型参数之间交替更新。
如果初始猜测很差,EM 会不会得到错误结果?如何缓解?
案例分析时,不要只说“可以聚类”。要说明分群后如何改变授信、定价、营销、复核或风险监控。
农户分群后,季节波动型客户可以采用还款周期更灵活的产品;稳定经营型客户可以降低审核频率;异常迁移客户进入预警名单。
同一个客户从一个簇迁移到另一个簇,可能意味着什么?