裁判文书
民间借贷纠纷判决书里的利率、期限、抵押方式、违约处置,是天然的地区—年份面板原料。
普惠金融 · 2026-09-21
普惠金融最核心的研究对象——信贷配给、金融排斥、融资约束、民间借贷——恰恰最难观察。当大语言模型把读懂一份非结构化材料的成本压到接近于零,数据库第一次可以不必坐等被发现,而是围绕研究问题被主动生产出来;随之要回答的问题也从"有没有数据",换成"原始材料在不在"与"生产过程可不可信"。
普惠金融有一个长期的尴尬:研究对象越往下沉,统计痕迹越稀薄。大型银行的信贷流水、上市公司的财报、交易所的行情,都有现成数据库接着;而小微业主、农户、个体工商户和民间借贷参与者——普惠金融真正关心的对象——很少留下结构化记录。
现有的数据底座大致三层。宏观层是人民银行 2016 年建立、2021 年修订的普惠金融指标体系,覆盖账户拥有率、电子支付普及、贷款渗透等,颗粒度到省一级。微观层是 CHFS、CFPS 这类家庭调查与世界银行 Global Findex 的跨国账户口径:前者能问到信贷申请与被拒的经历,但两三年才有一轮,样本以万计而非以百万计;后者覆盖虽广,落到中国的样本细度却很有限。机构层是银行年报与监管报表,反映的是供给端"投了多少",回答不了需求端"够不够用、贵不贵"。
真正麻烦的是三个看不见。信贷配给(credit rationing)在 Stiglitz 和 Weiss 1981 年的框架里是一种均衡结果:利率停在市场出清水平之下,一部分人想借借不到。它发生在信贷员的桌子上,不发生在任何统计报表里。金融排斥(financial exclusion)是一个过程,从网点撤并到产品门槛设计,散落在公告与条款的只言片语中。融资约束在实证里长期用 SA、KZ、WW 这类代理指数,可它们全都依赖上市公司财报——最缺钱的小微主体恰恰没有财报。更隐蔽的还有"不敢贷"群体(discouraged borrowers):怕被拒绝而根本不去申请,连问卷里"申请被拒"的选项都接不到他们。
所以这个领域的约束从来不是信息不存在,而是信息没有被变成数据。判决书、年报、公文、招聘广告里躺着大量经济事实,只是读它们的成本过去高得离谱。
变化分两步到来。第一步是"读"的成本崩塌。Dell 在 2025 年《Journal of Economic Literature》的综述里系统梳理了深度学习进入经济数据工作的路径:文档数字化、记录匹配、文本分类、海量语料探索。第二步更进一步,是 2026 年 Afonso 等人提出的 Deep Research on a Loop(DRIL):研究者事先规定好每个变量如何取值、按什么规则判定、证据要达到什么标准,AI Agent 据此循环作业——检索公开资料、核对证据、把结果写进数据库,直到数据集收口。作者用这条流程更新了全球税收支出数据,并给出一个分量不轻的判断:哪怕只自动化一部分,实证经济学生产数据的方式也可能被改写。
落到普惠金融,材料清单其实一直摆在那里:
民间借贷纠纷判决书里的利率、期限、抵押方式、违约处置,是天然的地区—年份面板原料。
政府工作报告与监管文件里普惠目标的表述、工具的选择,提供政策力度的语义刻度。
年报 MD&A、问询函回复、债券募集说明书,可提取融资约束与流动性担忧的语言强度。
招聘广告、招投标记录,是小微主体经营活跃度的实时温度计。
银行年报与社会责任报告,记录普惠战略的资源配置权重。
网点撤并与服务条款变更,拼出物理与数字可得性的时间线。
以民间借贷利率为例。学界长期依赖温州民间融资综合利率指数这类监测,点位有限、覆盖受限。而裁判文书网的民间借贷判决书里,每一份都是一个"合同加执行结果"的标本。过去没人做全量提取,不是不可能,而是人工读几十万份判决书不现实。当"读懂一份非结构化材料"的边际成本被压到接近于零,这些材料第一次成为可开采的矿。
于是约束的性质变了。一项研究能不能做,不再取决于数据库是否已经存在,而取决于两件新事:原始材料是否可得,以及把它们转换成数据的方法是否可靠。
数据生产解决"有没有"。"测得准不准"是第二层,也是普惠金融受益最大的一层:那些从来没有天然指标的核心概念,第一次有机会被直接测量。
2026 年,Asirvatham、Mokski 和 Shleifer 提出 GABRIEL 工具,把 GPT 用于定性材料的属性测量(property measurement):让模型按研究者定义的属性给文本打分——比如衡量一篇讲话对创新的拥护程度——再把这些判断转成可分析的变量。作者让 GPT 与人工在超过一千项标注任务上对表,并用这一方法建成了覆盖约 3.7 万项技术的数据库。
这件事的方法论含义在于:概念操作化的载体,从问卷题项变成了编码规则,也就是提示词。写问卷和写编码手册,本质上是同一门手艺——定义概念、给出情境、预防误读。普惠金融里一批经典难题,都可以沿着这条思路重新问一遍:
| 概念 | 传统做法 | 主要局限 | 生产路径 | 原始材料 |
|---|---|---|---|---|
| 信贷配给 | 问卷直问申请与被拒 | 样本小、周期长,漏掉"不敢贷" | 按编码手册分级识别配给证据 | 征信申诉、贷款申请审批记录、访谈文本 |
| 融资约束 | SA / KZ / WW 指数 | 依赖上市公司财报 | 约束语言强度连续打分 | 年报、问询函、募集说明书 |
| 金融排斥 | Findex 账户拥有率等渗透口径 | 测的是渗透,不是排斥过程 | 门槛条款与可得性事件的连续测量 | 网点公告、产品条款、投诉记录 |
| 政策执行力度 | 人工打分、政策虚拟变量 | 主观、二值、难复制 | 支持—约束语义的连续刻度 | 政府工作报告、监管文件 |
| 民间借贷利率 | 温州指数等点位监测 | 点少、覆盖窄 | 利率—期限—抵押结构化全量提取 | 民间借贷判决书 |
表中"生产路径"与"传统做法"的分界线要划清楚:模型只负责执行定义,不负责替你定义。"什么算被配给"这道题,Stiglitz-Weiss 之后四十多年里由理论回答,现在依然要由人来回答——只是答案的形态从"构造一个代理指数"变成了"写一份编码手册"。
编码手册才是这项研究设计的核心资产。问卷时代,题项设计决定测量效度;数据生产时代,这份职责整体迁移到提示词与编码规则上。它值得像问卷一样做预调研、试填和修订——文本变量进因果模型的工程细节,此前在本站 BERT 一文里有专门讨论。
不能想当然。Ludwig、Mullainathan 和 Rambachan 在 2026 年《Annual Review of Economics》的框架里专门区分了两类用法:用 LLM 做预测,与用 LLM 做测量和估计。后一类里,模型输出是一个带误差的观测值。设真实概念为 ,模型给出的变量为 :
如果误差 是经典测量误差——与真值无关、无系统偏向——后果是熟悉的衰减偏误(attenuation bias):
系数向零收缩,结论偏保守但方向不乱。麻烦在于,LLM 的误差通常不经典:换一个模型、改一句提示词、甚至模型悄悄升级版本, 的分布都会整体移动,而且移动方向没有保证。
这不只是理论警告。Yin、Vu 和 Persico 在 2026 年用三个前沿模型在同一套规则下重造"职业 AI 暴露"指标:三个版本的平均暴露水平最大差 3.6 倍,逐职业一致率最低只有 57%;把这些不同版本的指标放进同一套双重差分设计,个体层面估计系数最大相差 2.4 倍,县级分析里甚至出现从显著为负到不显著为正的翻转。同一个"测量",足以翻动一个研究结论。
普惠金融场景还有三处额外敏感:
Ludwig 等的验证框架与 Duan、Pelger 的纠偏工作给出了应对方向:保留人工验证样本校准误差结构,用多模型乘多提示词的组合做稳健性检验,必要时对估计量直接纠偏。这些工具有一个共同前提——承认手里的变量是生产出来的,不是观测到的。
把上面的要素串起来,一个谨慎的研究者可以这样组织数据生产:
把概念写成编码手册:正例、反例、边界情形的归档规则。定义含糊,后面全是垃圾进垃圾出。
来源清单、时间窗、可得性约束,以及最要紧的一点:缺失机制——哪些材料系统性地到不了你手上。
要求模型只依据原文片段作答并逐条引用,禁止调用外部知识;提示词本身纳入版本管理。
分层抽取数百条,双人背对背人工标注,分歧经仲裁后冻结。它是整条流水线的尺子。
冻结模型版本与参数,逐批编码并保存全部原始输出,不做任何中间清洗。
对照金样本报告准确率与一致率;跑多模型乘多提示词矩阵查稳健性;必要时按误差结构纠偏后再进回归。
模型与版本、调用日期、提示词、原始输出、金样本、纠偏方法全部入库。"数据怎么来的"从此是研究设计的一部分。
三条红线:没有金样本不上全量——没有人工基准,任何"高准确率"都无从谈起;模型判定不当事实转述——变量来自编码规则,正文表述必须保留这一口径;不挑结果——稳健性矩阵要么全报告,要么别做。
最后回到分寸。生产数据降低的是"做不了"的门槛:民间利率面板、政策力度指数、排斥强度测量,过去靠一两位博士生几年手工整理,或者根本做不动,现在几周可以跑通初版。但有两件事它没有改变。
一是重要性。可测量不等于值得测量,一个新变量要回答的仍是重要的政策问题:普惠金融资源的配置效率、小微信贷的传导机制、数字化对排斥结构的重塑。二是识别。变量再多,因果结论依然取决于设计,断点、配对、准实验这些老手艺一样不能少。产业界其实在走同一条路:广州落地的"Token 贷"把词元消耗、算力合同这些原本难以核验的信息变成授信依据(本站此前有专门讨论),与研究侧把非结构化材料变成变量,是同一枚硬币的两面。
对研究生来说,这门新手艺的门槛并不高:会写问卷就会写编码手册,懂抽样就懂金样本,学过测量误差就学得会纠偏。真正稀缺的从来不是处理能力,而是三样东西:挑得出重要的问题,写得出干净的概念定义,扛得住审稿人对生产过程的追问。
数据可以围绕问题被生产,是这一轮方法论变化给普惠金融最大的礼物;而判断哪些问题值得为它生产数据,仍然是经济学家的活儿。
加载中…