跳到正文
AI 知识地图 0.18 · 2026-07-30
关于与纠错文字目录 / Search
理解原理

不确定性与校准:让“80% 把握”真的约等于 80% 正确

从置信分数、可靠性图和 ECE,到选择性预测、拒答阈值与分布漂移。

核心命题 校准不要求每个样本都知道自己是否正确,而要求在同类、同分数的一组案例中,声称 80% 置信的案例长期约有 80% 正确。它是分数与经验风险之间的映射,不是语言流畅度,也不是消除错误;一旦任务、切片或分布变化,校准证据就可能失效。
读完你应该能:区分准确率、置信度与校准;手算可靠性分桶和 ECE;理解温度缩放与选择性风险;按错误成本设置转人工阈值。
  1. 定义需要校准的正确事件
  2. 从模型/证据/验证器取得原始分数
  3. 在独立校准集学习概率映射
  4. 用可靠性与评分规则验收
  5. 按错误成本选择阈值
  6. 持续收集成熟标签并监控漂移

1准确不等于知道自己何时会错直觉

两个总体准确率都是 80% 的助手,可以带给人完全不同的风险。助手 A 无论面对什么问题,都一律报告 0.8 的置信度;助手 B 在熟悉案例上报 0.95,在政策冲突类案例上则报 0.35。假如两者最终都答对了 80% 的问题,它们的准确率相同,但可用性差别很大:如果 B 报出的分数可信,运营者就能把所有低置信的回答转给人工处理,在保留大部分自动化的同时显著降低出错带来的损失。A 的所有回答都顶着同一个 0.8,根本无法按风险排序,也就无从分流。这个差别不体现在准确率里,而体现在“模型知不知道自己的把握有多大”上。

校准关心的正是这个问题:模型报出的概率与真实发生的频率是否匹配。如果模型对所有它声称有 80% 把握的问题长期统计下来确实答对约 80%,它就是校准良好的;如果它报 0.8 却只答对一半,它就是过度自信。这里必须把三种能力分开。准确率回答“答对了多少”;区分度回答“能否把会答对的样本排在会答错的样本前面”;校准回答的是另一个问题——“分数本身的数值能否被解释为真实频率”。一个模型可能很擅长排序、把正确答案普遍排在前面,却同时对所有样本都给出偏高的概率;另一个模型可能校准得很好,但准确率很低——例如一个永远报出基准正确率的模型,长期来看它的概率承诺与实际频率天然一致,可是它对任何具体案例都不提供额外信息,毫无分流价值。校准好不代表有用,排序好也不代表分数可解释,三者不是一回事。

从评估的输入输出来看,校准评估接收一组任务答案、模型为每个答案给出的分数,以及最终的正确答案标签;输出则是一个判断:在分数相同的组内,经验正确率是否与模型声称的概率相符。它不回答“模型答对多少”,也不回答“模型能否排序”,只回答“报 0.8 是否长期约等于 80% 正确”。在需要把低置信案例转人工、按风险分配资源的场景中,正是这一个问题的答案决定了助手 B 的价值——也决定了看似同样优秀的助手 A 可能并不安全。

2LLM 的“置信度”从哪里来信号

大语言模型并不会天然输出“这个答案正确的概率”。模型生成“我非常确定”这样的措辞,和某个 token 的对数概率(logprob),都不是任务正确率。前者只是语言风格——模型会模仿自信的语气,并没有受过概率训练;后者只是下一个词在给定上文下出现的可能性,受长度、措辞影响很大,与事实是否正确没有必然联系。要把模型的不确定性变成可用的分数,需要先从多个信号构造原始置信度,再在独立数据上学出“分数 → 经验正确率”的映射。

可以使用的原始信号有几类,各有优劣。序列或选项的对数概率最便宜、取值连续,但受长度和措辞影响,不能直接当作事实正确性。模型的自我报告很容易通过提示词获得,可它本质上是在模仿自信语气,缺乏概率含义。多次采样同一个问题、比较答案的语义一致性,能暴露回答不稳定的案例,但同一个盲点可能让所有采样一致地错,一致性高不代表正确。外部验证把答案连接到证据或执行结果上,能提供独立信号,但验证器本身也有覆盖范围和错误率。模型集成利用不同模型的分歧反映认知不确定性,代价是成本高,且不同模型可能同源、分歧有限。

这些信号可以组合。以退款助手为例,可以把“政策证据是否被召回、资格分类的 margin(分类器给出的分数到决策边界的距离)、金额程序校验的结果、对同一问题多次采样答案的分歧程度”合成为一个风险分数。但这一步得到的分数还不具备概率含义:它只能说“分数越低越值得怀疑”,不能说“93% 正确”。平均 token 概率同样如此,直接声称“答案 93% 正确”没有依据。

真正赋予概率含义的步骤发生在校准环节:在独立于训练数据的校准集上,把原始分数与实际正确频率对应起来,学习从分数到经验正确率的映射。这里的“正确”需要先定义清楚任务事件,例如“退款资格判断正确且引用支持该判断的证据”。输入是 token 概率、多次采样、模型自评、检索覆盖、外部验证器和模型分歧等原始信号,输出是映射之后才能解释为正确频率的校准概率;在此之前,任何单一路径给出的“我很确定”或平均 token 概率,都只能作为风险线索,不能直接当作答案正确概率使用。

信号优势核心盲区
序列/选项 logprob便宜、连续受长度和措辞影响,不等于事实正确
自我报告易提示会模仿自信语气,缺少概率训练
多样本一致性发现不稳定答案同一盲点可一致地错
外部验证连接证据或执行结果验证器也有覆盖与错误
模型集成反映认知分歧成本高且模型可能同源

3可靠性图把概率承诺变成可检验频率机制

有了每个预测的概率分数之后,怎么检验一批 0 到 1 的分数是否名副其实?核心做法是把预测按置信度分桶,然后在每个桶里比较两样东西:该桶的平均置信度 conf(Bₘ) 与该桶样本的实际准确率 acc(Bₘ)。如果模型报 0.8 的那些案例实际答对 80%,报 0.9 的答对 90%,那么把“平均置信度”放在横轴、“实际准确率”放在纵轴画出的点应该全部落在 y = x 的对角线上——这就是理想的可靠性图。曲线整体位于对角线下方,说明模型系统性过度自信:它承诺的概率高于兑现的频率;位于对角线上方则说明模型过于保守,实际表现比它声称的还要好。

分桶比较有一个天然缺陷:桶内结构会被隐藏。同一个 0.7 到 0.8 的桶里可能混着真实概率 0.6 和 0.9 的样本,只要平均后凑巧落在对角线上,图上看不出问题。所以可靠性图需要配合连续校准方法和关键切片一起看。

期望校准误差(ECE)把可靠性图上的偏差汇总成一个数。对每个桶,计算平均置信度与实际准确率之差的绝对值,再按该桶样本占比加权求和:

ECE = Σₘ (|Bₘ| / n) × |acc(Bₘ) − conf(Bₘ)|

其中 n 是预测总数,Bₘ 是第 m 个桶,|Bₘ|/n 是该桶样本占比。ECE 越小,表示在当前分桶方式下,概率承诺与实际频率的平均差距越小。但 ECE 的数值直接依赖桶的数量和边界位置:同样一批预测,切成 10 桶和切成 20 桶会得到不同的 ECE,因此不宜在不同分桶设置之间机械比较数值。除 ECE 外还有惩罚结构不同的指标:Brier 分数 (p − y)² 同时惩罚概率偏差和预测错误;负对数似然对“高置信却出错”的惩罚更重,因为这种情况下的 −log(p) 会非常大。

更重要的是,校准是条件性的。一张总体漂亮的对角线图并不保证所有场景都校准良好:按中文订单、超长订单或新上线政策切出的子集,仍可能各自严重过度自信,只是被总体平均掩盖。可靠性评估必须按会影响风险的条件分组检查。综合起来,评估的输入是 n 个预测及其分桶 Bₘ,输出是可靠性图与 ECE 数值;对每桶取置信与准确的绝对差、乘以样本占比再求和,即得到当前分桶下的平均校准误差。结果的解释要同时注意两点:数值依赖桶边界,且分桶汇总可能掩盖切片层面的失准。

ECE=m|Bm|n×|acc(Bm)conf(Bm)|

4运行示例:十笔退款怎样算 ECE逐步演算

把十笔退款请求的模型分数和最终正确标签放进三组分桶,可以完整地走一遍 ECE 的计算。三组置信度桶的可靠性图显示:高置信桶实际只答对了三分之二,暴露了过度自信,而图的另一条信息是转人工阈值必须基于校准后的风险、而不是原始分数来设定。

分桶统计如下:低置信桶有 3 个样本,平均置信 0.30,其中 1 个正确,准确率 0.333;中置信桶有 4 个样本,平均置信 0.65,其中 3 个正确,准确率 0.75;高置信桶有 3 个样本,平均置信 0.90,其中 2 个正确,准确率 0.667。每个桶的加权差是“准确率与平均置信之差的绝对值”乘以该桶样本占比。低桶:3/10 × 0.033 ≈ 0.010;中桶:4/10 × 0.10 = 0.040;高桶:3/10 × 0.233 ≈ 0.070。三个贡献相加,ECE ≈ 0.120。

这个数字该怎么读?首先,只有十个样本,估计极不稳定,0.120 只是演示计算结果,不能当作精确的生产估计。其次,真正重要的运营发现藏在最高置信桶里:模型对这些案例平均报 0.90 的把握,实际却只有三分之二答对。如果错误退款的代价很高,那么把“0.7 以上自动放行”当作安全阈值绝不成立——原始分数看似很高,分桶后暴露出的正是这一点。计算规则本身很简单:每个桶取 |准确率 − 平均置信| 乘以样本占比,再把各桶贡献相加;输入是十笔退款的分数与正确标签,输出是低、中、高三桶的各自贡献与总 ECE。高桶平均置信 0.90 却只正确 2/3,说明原阈值会放行大量高成本错误,这正是校准评估要传递给运营决策的信息。

平均置信度实际正确率低桶 .30/.33中桶 .65/.67高桶 .90/.67阈值 τ=0.7:高桶自动回答覆盖 30%,选择性风险 33%校准后高桶映射到约 0.67原阈值不再允许自动回答校准修正概率含义,不会修正答案本身
图 1 高置信桶实际只答对三分之二,暴露过度自信;阈值必须基于校准后的风险而非原始分数。
样本数平均置信正确数准确率加权差
30.3010.3333/10×.033=.010
40.6530.754/10×.10=.040
30.9020.6673/10×.233=.070

5温度缩放修正尺度但不创造知识后处理

模型给出的分类概率常常普遍过尖:几乎所有预测都贴着 0.95 以上,即使实际错误率远高于此。不重新训练模型,怎样把这类分数拉回现实?温度缩放是最轻量的做法之一。设分类器输出的 logits 为 z,温度缩放把概率重算为 softmax(z/T):

pᵢ = exp(zᵢ / T) / Σⱼ exp(zⱼ / T)

其中 T 是温度参数,在独立校准集上选取,使校准集的负对数似然最小。T 大于 1 时指数被压缩,分布变软,过度自信随之下降;T 小于 1 时分布变尖,模型会显得更自信。关键性质是:缩放不改变各类别分数的大小顺序,因此通常不改变 top-1 的预测结果和准确率,只调整这些分数的概率含义——它把“最高分是哪个类”保留下来,把“这个把握对应多少真实频率”纠正过来。

温度缩放属于全局线性修正,只能整体软化或锐化。二分类场景可以用形式更简单的 Platt scaling;如果偏差是严重非线性的,可以用 isotonic regression 拟合任意单调映射,但数据少时它更容易过拟合。对自由文本生成,问题更前置:必须先定义清楚要校准的事件,例如“资格判断正确且引用支持该判断的证据”,再对这个事件上的分数做校准。没有明确的正确标签定义,报出来的 0.8 不知道指什么。

无论用哪种修正,数据纪律都不可省:训练集学模型,验证集调系统,校准集学“分数 → 概率”的映射,测试集评估最终表现。用测试集的标签去选温度,等于把测试集泄漏进参数选择,校准结果会再次带上乐观偏置。温度缩放的输入是分类 logits z、独立校准标签和温度 T,输出是 softmax(z/T) 的重标度概率;它只修分数尺度,不创造模型原本没有的知识。事件定义变了,或者线上数据分布变了,就必须重新验证校准是否依然成立。

6选择性预测在覆盖率与风险之间取舍决策

校准给出了每个答案的风险概率,接下来要决定对每个请求做什么:自动回答、转人工、还是拒绝。选择性预测的做法是设定一个阈值 τ,只对分数不低于 τ 的样本自动回答。由此产生两个相互拉扯的指标:覆盖率,即被自动处理的比例;选择性风险,即被自动处理样本中的错误率。τ 升高,覆盖通常下降,同时自动放行的那部分风险也下降。评估时应该画出完整的“风险—覆盖”曲线,而不是只报某个方便阈值下的数字——曲线能暴露在哪个阈值区间每放弃一点覆盖能换来多少风险下降。

阈值到底定在哪里,取决于成本结构。可以把阈值策略的期望成本写出来:

Cost(τ) = P(auto | τ) × P(error | auto, τ) × Cerror + P(manual | τ) × Cmanual + P(reject | τ) × Creject

即自动、转人工、拒绝三类结果的概率分别乘上对应成本再求和:自动处理的代价来自其中出错案例的错误成本 Cerror,转人工付人工成本 Cmanual,拒绝付拒绝成本 Creject。以退款为例,若错误承诺退款的成本是 100、一次人工复核成本只有 4,那么即使大量案例转人工,总账也可能划算;换作低风险的文案润色,错误成本很低,阈值就可以放宽,让更多请求直接自动处理。成本之外还有现实约束:人工审核容量和 SLA。队列已满时不能悄悄自动放行高风险案例,宁可降级为延迟处理或明确拒绝,也不能让系统在高风险门槛上妥协。

多阶段系统还可以把单一阈值拆成多道门,因为单一回答置信度覆盖不了所有风险来源:证据不足时先补充检索再判断,金额校验失败转人工,权限冲突则禁止动作。每道门各管一类风险,比一个总置信度一刀切更可操作。整个选择性决策的输入是校准分数、阈值 τ、错误成本 Cerror、人工成本 Cmanual、拒绝成本 Creject、审核容量与 SLA,输出是每个请求的处置方式(自动、转人工或拒绝)以及阈值下的期望成本 Cost(τ)。选点就是在满足容量和 SLA 约束的前提下,挑一个使期望成本可接受的 τ——风险—覆盖曲线和成本公式分别回答“放弃多少自动化”和“值得放弃多少”这两个问题。

Cost(τ)=Cerror×PerrorAuto+Cmanual×Pmanual+Creject×Preject

7序列概率、语义多样性与系统性高置信错误失败边界

模型可以对生成的每个 token 都报出很高的条件概率,整段答案却仍然是幻觉。原因在于序列概率是各 token 条件概率的乘积,长度越长乘积自然越小,于是长度不同的答案根本无法直接比较;换成平均 logprob 也有问题,它会系统性偏好常见、简短、模板化的措辞,而不是事实正确的措辞。一段退款结论的真假可能完全取决于其中的一个实体名或一个金额数字,而这个 token 在语言上恰恰极其常见——概率最高、事实最错。多次采样也一样不可靠:若干次采样给出同一个错误答案,可能只是训练数据和提示方式诱导出的共享盲点,而不是“模型很有把握”的证据。

因此校准的对象必须从“文本流畅度”换成“任务事件”。资格结论是否正确、引用是否蕴含结论、工具执行是否成功、最终业务状态是否符合预期,应当分别定义标签、分别校准;把整段生成的概率当作整体正确率,等于在度量错误的东西。

几类典型失效模式值得单独应对。长度偏差表现为短答案分数虚高,靠长度归一化和按任务定义事件来纠正。同源盲点表现为多次采样一致地错,需要引入外部证据和异构验证器来打破一致性幻觉。切片错配表现为总体校准良好、少数群体切片却严重失准,需要用分层可靠性和最小样本要求来检查。分布漂移表现为旧阈值下错误率突然攀升,只能靠持续监控、重新校准或主动降级来应对。

序列置信分析的输入是 token 条件概率、文本长度、语义采样结果、任务事件标签和外部证据,输出是按任务事件定义的风险分数。它的边界也很明确:分布外输入、新政策上线、检索索引切换或对抗性提示,都会让旧有的“分数 → 正确率”映射失效。在这些情况下,模型报出的高置信不能构成安全证明,只是旧映射尚未被重新检验的残留读数。

失效表象应对
长度偏差短答案分数更高长度归一并按任务定义事件
同源盲点多次采样一致地错外部证据、异构验证器
切片错配总体校准,少数群体失准分层可靠性与最小样本
分布漂移旧阈值错误激增监控并重新校准/降级

8上线后怎样监控校准是否腐烂运维

校准不是上线时一次性完成的:真实正确标签常常要延迟几天甚至更久才能拿到,而线上风险是实时的。生产监控要做的第一件事是让评估变得可能——每次决策都保存原始分数、校准版本、阈值、处置结果、任务切片和最终标签。有了这些记录,之后任何时点的标签成熟了,都可以回看重算。

标签未成熟时,用代理信号做早期预警:证据缺失、工具执行失败、用户纠正、人工改判,这些信号比最终标签来得快,能提示某个切片可能正在恶化。但它们只是预警,不能替代校准指标;等标签成熟后再重算 ECE、Brier 分数和风险—覆盖曲线。指标要用滚动窗口和置信区间来看,避免因为少量样本的正常波动就频繁改动阈值。

阈值本身应该在发布前就定好并冻结:在冻结的评估集上选定阈值,记录预计的覆盖率和风险,作为上线后的对照基准。发布初期用金丝雀方式抽样,人工复核被自动通过的案例,尤其是分数刚好压在阈值附近的那批——那里是阈值误差最集中暴露的地方。监控必须按切片进行:语言、政策版本、输入长度分别看,不能只盯总体数字,否则少数切片失准会被平均掉。

当漂移或高置信错误超过预算时,动作要明确:收紧阈值、回滚旧的校准映射,或暂停自动动作。最后一点容易做错:重新校准需要新的、有代表性的标签。在没有新标签时单纯把温度调大、让仪表盘上的 ECE 好看,并不能恢复事件定义与数据分布之间的一致性,只是给一个已经失效的映射换了刻度。生产监控的输入是原始分数、校准版本、阈值、决策、切片与延迟成熟的标签,输出是滚动 ECE、Brier、风险—覆盖曲线,以及收紧、回滚或暂停的处置动作;代理信号只承担早期预警的角色。

10把因果链连起来综合

把前面的环节按因果顺序连起来,校准从问题到可验证实践共六步。

第一步是定义需要校准的正确事件。没有这一步,后续所有概率都不知道指什么:要校准的是“退款资格判断正确且引用支持”,而不是“文本流畅”或“平均 token 概率高”。事件定义同时决定了标签该怎么打。

第二步从模型、证据和验证器取得原始分数。token 对数概率、多次采样一致性、模型自评、检索覆盖、外部验证结果、模型分歧,都可以作为信号组合进来,但此时的分数只是风险线索,尚不具备概率含义。

第三步在独立校准集上学习“分数 → 经验正确率”的映射。这一映射只对第二步的信号与第一步的事件定义成立,因此校准集必须独立于训练集和测试集。

第四步用可靠性图与评分规则验收。分桶后比较平均置信度与实际准确率,计算 ECE,必要时用 Brier 分数或负对数似然补充惩罚视角,并检查关键切片是否失准。这一步回答“报 0.8 是否真的约等于 80% 正确”。

第五步按错误成本选择阈值。有了可解释的概率,用期望成本在覆盖率与风险之间取舍:错误成本高就收紧阈值多转人工,错误成本低就放宽阈值多自动化,同时受审核容量和 SLA 约束。

第六步持续收集成熟标签并监控漂移。上线后保存每次决策的分数、阈值、切片和最终标签,标签成熟后滚动重算校准指标;新政策、新语言切片或分布漂移一旦使高置信错误超出预算,就收紧阈值、回滚映射或暂停自动动作,再等待新的代表性标签重新校准。

六个环节环环相扣:事件定义决定分数和标签的语义,独立校准集把分数变成概率,可靠性验收验证概率承诺,成本阈值把概率变成处置决策,生产监控保证这条链在分布变化后依然成立。任何一步断裂——事件定义含糊、校准集泄漏、只报总体不查切片、按原始分数定阈值、用调温度替代重新校准——都会让“80% 把握”重新退化成一句没有频率含义的话。

资料来源与改编说明
访问日期:2026-07-22