跳到正文
AI 知识地图 0.18 · 2026-07-30
关于与纠错文字目录 / Search
理解原理

模型路由与级联:把不同难度请求分给足够的能力

从直接路由、先小后大和质量差预测,到升级阈值、级联延迟、公平风险与在线再校准。

核心命题 模型路由在应用层为每个请求选择完整模型或服务,目标是在质量与风险门槛下减少期望成本。省钱的关键不是小模型占比,而是正确识别哪些请求可以安全下放;路由错误会集中伤害困难、长尾和高风险切片。
读完你应该能:区分选型、路由与 MoE;推导级联成本和升级阈值;评测错误下放与级联延迟;设计校准、漂移与安全回退。
  1. 建立候选逐样本质量与成本基线
  2. 定义高风险强制规则
  3. 训练/校准强模型增益分数
  4. 选择满足切片门槛的阈值
  5. 灰度路由并随机审计下放样本
  6. 版本或分布变化后重校准/回退

1路由把一次选型变成逐请求决策直觉

同一个退款系统里,不同的请求并不等价。一个用户问“退款到账要几天”只需一次对状态表或常见问题库的简单查询;另一个用户声称系统已扣款但订单状态仍是未支付,金额异常且证据相互冲突,这需要推理、核对多处证据,甚至涉及高权限操作。如果整套系统为这两种请求支付相同的计算成本——全部送往最强的模型——那么绝大多数简单查询都在为少数困难案例的定价买单;反过来,如果为了省钱把一切交给小模型,冲突案例就会以更高的概率出错。模型路由要解决的正是在这两端之间建立逐请求的决策:根据当前这次请求本身,而不是根据某个全局常数,来决定它该由谁处理。

先厘清几种容易混淆的选型方式。静态选型是在构建组件时选择一个模型,此后该组件内所有请求都由它处理,决策发生在部署时,与每个请求的内容无关。动态路由则相反:组件内维护多个候选模型,每一次请求到来时,路由器读入该请求的内容、风险规则、各候选模型的能力记录以及运行期的证据,实时决定本次交给小模型、强模型、转人工,还是直接拒绝。这两者的差异在于决策发生的时间和粒度。混合专家(MoE)又不同:它是单个模型内部按 token 选择激活哪些专家,属于模型自身的结构设计,使用方通常并不能在请求之间直接控制“整模型切换”,因此它不替代动态路由,两者作用于不同层级。

路由与能力的关系需要先讲清一个边界:路由不会创造底层模型没有的能力,它只在已有候选之间做分配。如果所有候选模型在某个输入切片上都失败,路由器能做到的至多是从几种失败中挑一种;指望靠路由补上能力缺口是不可能的。因此路由的前提是选型与评测先行——先为每个样本切片确认至少存在一个足够好的候选,建立逐样本的能力基线,再谈在这条基线上做分配优化。

由此可以得到路由的真正目标。它不是“最大化小模型调用率”:如果以这个为目标,系统会被诱导把困难请求错误地下放给小模型,用错误率换取成本。真正的目标是最大化安全可下放覆盖率——在保证错误与风险不越过红线的前提下,尽可能多地把请求交给成本更低的路径。下放请求的含义值得强调:它表示现有证据显示小模型足够处理,而绝不表示该请求天然简单。一个今天被下放的请求,当出现新的证据(例如金额超过阈值、账户进入高风险名单)时,应当立即改走强模型或人工。

最后是路由的输入与输出契约。输入包括当前请求本身、预先定义的风险规则、候选模型各自的能力记录以及运行期证据;输出是本次请求的处理路径:小模型、强模型、人工或拒绝。决策过程中有一条硬性优先级:高风险的硬规则必须优先于概率分数。当一条硬规则(如高权限操作必须人工复核)被触发时,无论概率模型给出的分数如何,路径都必须是人工或拒绝,规则不能被分数覆盖。

2直接路由、级联和并行选择架构

把路由落到工程上,首先面对的是一个问题:是在调用之前就选好模型,还是先让小模型给出回答、再根据回答质量决定要不要升级到更强的模型?对这个问题的不同回答形成了四种基本形态,各自在过程、优势和代价上不同,需要按请求特征组合使用,而不是全站只用一个阈值。

第一种是规则路由。路由器本身是一组显式规则:按领域、按风险等级或按输入长度选择处理路径。它不需要额外训练任何模型,每条决策都能直接解释为“因为命中了哪条规则”,这是它最大的优势。代价是规则的边界很粗:领域之间的重叠、风险判断的模糊地带都需要人工维护规则,请求一旦偏离预设的类别划分,规则就可能给出不合适的路径。

第二种是直接路由。系统在调用生成模型之前,先运行一个轻量分类器,根据当前请求预测合适的档位(例如小、中、大模型),然后只调用被选中的那个。它的好处是困难请求不必先在小模型上浪费一次调用——分类器若判断难度高,第一步就直接走大模型。代价同样清晰:这个决策只能依据调用前的输入本身,而很多请求的难度无法仅凭输入判断,缺少回答、验证等后续信号时,分类器的判断可能不足。

第三种是级联。流程先让小模型 S 完整回答,若它的置信度低,再调用强模型 L 重新处理。级联的优势在于它可以使用首答阶段才产生的信号:首答的置信度、验证器的判断、检索结果是否支撑该回答,这些都比纯输入更能反映真实难度。代价有两层:被升级的请求总耗时更长,因为它要经历 S 的完整回答再经历 L;而且 S 的首答可能“污染”后续处理——若 L 的处理会参考首答或首答已触发了副作用,错误就被带进了强模型阶段。

第四种是并行选择。多个模型同时对同一请求运行,完成后由一个选择器挑选采纳哪个回答。它的优势是墙钟延迟低,因为所有候选并行推进,同时获得多个候选回答便于比较。代价是计算成本随候选数量成倍增长,而且选择器本身也可能犯错——挑错的那个回答并不比单个模型直接回答更可靠。

这些形态适合的信号类型不同。调用前就能拿到的信号适合直接选择;首答和验证信号只有先跑一轮才能得到,适合级联;并行选择则是用成本换取墙钟时间。因此架构选择有一个输入输出结构:输入是决策时点(信号何时可用)、可用信号类型、错误成本与延迟 SLO,输出是这四种形态针对不同请求切片的组合。高风险请求应当用确定规则强制走强模型或人工,不交给概率路由器去“碰运气”;低风险的长尾请求则可以放心使用级联。整个站点应根据不同切片把形态组合起来,而不是统一按一个阈值调度。

还有一条边界必须遵守:当第一阶段可能产生副作用时,不得未经审查就级联。如果小模型的回答会直接触发扣款、发送通知或修改状态,那么“先跑 S 再决定升级”本身就是不可接受的——第一阶段的副作用已经发生,后续升级无法挽回。存在副作用的路径只能在有审查把关的前提下使用。

形态过程优势代价
规则路由按领域/风险/长度选择可解释、无额外模型边界粗、维护规则
直接路由轻量分类器先选 S/M/L困难请求不先浪费小模型仅凭输入可能判断不足
级联先跑 S,低置信再跑 L利用首答、验证与检索信号升级请求更慢且首答可能污染
并行选择多个模型同时跑再选择低墙钟延迟、候选多成本高、选择器也会错

3数学目标必须带切片硬约束机制

如果路由优化的目标只是“最小化平均费用”,路由器会学到一条危险捷径:把所有请求都下放给小模型。平均费用的确降到了最低,但少数高风险的越权错误被淹没在大量简单请求的成功里。这正是平均约束的结构性缺陷——它允许多数简单请求的高分抵消少数关键切片的错放。数学上可接受、运营上不可接受。

因此路由目标的正确写法必须带逐切片硬约束。整体目标是:在满足每个关键切片的质量下限与风险上限的前提下,最小化期望成本。写成约束优化形式:

最小化 E[ c( m(x) ) ],约束:对每个关键切片 k,质量 q(m(x)) ≥ Q₀ 且 Riskₖ ≤ Rₖ。

其中 x 是请求,m(x) 是路由器为该请求选择的模型,c 是处理成本,q 是回答质量,Q₀ 是质量下限,Riskₖ 是切片 k 的风险暴露,Rₖ 是该切片允许的风险上限。切片指语言、领域、风险等级和用户群等维度上的子集。约束是针对每个切片单独成立的不等式,任何一个切片违反约束,整个策略都不可接受;一个切片的高质量不能借给另一个切片去填补。样本数量少的切片尤其要注意:此时点估计不可靠,应当报告区间估计,并采用保守上界作为是否满足约束的依据,宁可少下放,不可低估风险。

与目标函数配套的是训练目标的设定。路由器若学习“预测请求的绝对难度”,学到的信息并没有对准收益。正确的训练目标是预测强模型相对小模型的质量增益:若两者都答对,升级是浪费;若两者都答错,升级毫无收益;只有强模型答对而小模型答错的样本,升级才真正产生价值。所以最有价值的训练信号是“强对小错的样本”。同时,质量标签必须来自独立评分器与人工标注,不能用强模型的自评分当作无偏真值——让强模型既当选手又当裁判,标签会系统性偏向升级,因为模型倾向于认可自己的回答。

还有一个数据层面的陷阱叫选择偏差。线上运行时,强模型通常只在被升级的样本上执行,下放的样本从未让强模型试过,于是我们永远看不到“如果这些样本当初升级了,强模型会不会更好”这个反事实。只用被升级样本训练,路由器学到的增益是偏的。补足的办法有两种:随机探索,即以一定概率把本应下放的请求也升级,换取反事实观察;或者离线双跑,把同一批样本同时给小模型和强模型各跑一遍,直接建立无偏的配对数据。

把这些串起来:路由优化以请求 x、所选模型 m(x)、成本 c、质量 q、质量下限 Q₀、各关键切片风险 Riskₖ 与上限 Rₖ 为输入,输出一个满足全部逐切片硬约束的最低期望成本策略。平均质量的漂亮数字不能抵消少数切片的错放;训练目标应对准强模型的相对收益;下放样本缺失的反事实要用随机探索或离线双跑补足。三者缺一,优化的方向就会偏离“安全可下放”这个真正的目标。

minmEcost[c(m(x))],subject toEquality[q(m(x),x)]Q0,RiskkRk

4级联期望成本和延迟怎样计算推导

级联的成本直觉很容易算错。给定小模型每次调用 ¥0.02、强模型 ¥0.10、升级率 25%,一个常见的直觉是“平均成本介于两者之间,大概按升级率加权”。若所有请求先跑小模型、被判定升级的再跑强模型,且暂时忽略评分器等其他组件,期望调用成本可以精确写出:

ECost = Cₛ + r × Cₗ

其中 Cₛ 是小模型单次成本,Cₗ 是强模型单次成本,r 是升级率。含义是:每一个请求都先支付 Cₛ,因为级联的第一步对所有人执行;升级的那部分请求(比例 r)再额外支付 Cₗ。代入 Cₛ = 0.02、Cₗ = 0.10、r = 0.25,得到 0.02 + 0.25 × 0.10 = 0.045 元。所以在这个调用假设下,平均成本确实是 ¥0.045——它与直觉一致,但前提必须说清:这是“所有请求先跑小模型”的级联核算,不是任意路由形态的通用答案。

对比直接路由可以看清形态之间的差别。若路由器在前置分类器之后只调用一个模型,成本结构变为 Crouter + (1 − r)Cₛ + rCₗ,即先支付分类器成本 Crouter,再按升级率分成两路:比例 (1 − r) 的请求只付小模型,比例 r 的请求只付强模型。当两种形态的期望费用接近时,直接路由显得更划算,因为级联中被升级的那部分请求要承受小模型加强模型的串行尾延迟:它们先等完小模型的完整回答,再等强模型的完整回答,最慢用户的体验明显变差。

延迟的核算与成本结构同构。期望延迟 ETime = Tₛ + Tjudge + r × Tₗ,其中 Tₛ 是小模型延迟,Tjudge 是判定是否升级所需的延迟,Tₗ 是强模型延迟。所有人先承担 Tₛ 与 Tjudge,被升级的比例 r 再额外承担 Tₗ,且这些延迟是串行累加的,没有任何并行重合。

这两条公式成立的前提必须清楚:它们只核算调用本身。真实总成本还包括评分器、重试、检索、人工介入和失败处理,每一项都会改变最终数字;0.045 元这个结果在加入这些组件后并不成立,它只是“给定调用假设”下的值。同理,延迟公式没有计入排队、重试和失败降级路径。

最后一条结构性的约束:级联首阶段应默认无副作用。如果小模型的回答被直接写入与用户的对话历史,或触发了工具调用,那么即使之后升级到强模型,首答留下的内容或已经发生的副作用也无法撤回,构成污染。因此级联的第一阶段输出只应作为候选证据,供后续阶段参考,而不是作为既定事实或外部动作的来源。

ECost=Cs+r×Cl;ETime=Ts+Tjudge+r×Tl

5运行示例:阈值怎样改变覆盖、错误与成本逐步演算

阈值对路由系统的影响不是抽象的,可以直接在一组数字上看清。假设有 1000 笔退款请求,每笔都有一个“需要强模型”的升级分数 g(x),系统按分数从高到低排序:分数达到阈值 τ 的请求升级到强模型,其余下放给小模型。三组候选阈值给出如下结果(升级请求的延迟路径均为“小模型 + 判定 + 强模型”的串行过程):

τ = 0.7 时,升级 150 笔,错放的困难请求 28 笔,质量通过率 91.0%,平均模型成本为 0.02 + 0.15 × 0.10 = ¥0.035。τ = 0.5 时,升级 250 笔,错放 12 笔,质量通过率 93.1%,平均成本 0.02 + 0.25 × 0.10 = ¥0.045。τ = 0.3 时,升级 420 笔,错放 4 笔,质量通过率 94.0%,平均成本 0.02 + 0.42 × 0.10 = ¥0.062。

表格里的规律很清楚:τ 降低意味着更多请求被升级,平均成本上升,错放的困难请求减少,质量通过率上升。τ 升高则相反:更省钱,但更多困难请求被错误下放,整体质量下滑。所以阈值不是在调一个数字,而是在错放、质量与成本三条曲线上移动一个共同的控制点。

现在加入决策门槛:要求质量通过率 ≥ 93% 且错放困难请求 ≤ 15 笔。逐一检验:τ = 0.7 的质量只有 91.0%,不满足;τ = 0.5 的质量 93.1%、错放 12 笔,两条门槛都满足;τ = 0.3 也满足,但成本 ¥0.062 高于 τ = 0.5 的 ¥0.045。因此在满足门槛的前提下,τ = 0.5 是最低成本可行点——阈值选择就是在可行区域里找成本最低的那个点,而不是无脑选质量最高或成本最低的。

但全局数字通过不代表决策结束。假设高风险切片(如金额异常或高权限退款)恰好占这 12 笔错放中的 5 笔,而该切片有自己独立的错放上限,比如不得超过 3 笔,那么 τ = 0.5 在这个切片上已经超标。此时不能靠全局平均掩盖:正确做法是对该高风险切片单独强制升级,即使它的升级分数低于全局阈值。逐切片硬约束再次压过了全局平均。

这套分析的输入是 1000 笔请求、各自的升级分数 g(x)、阈值 τ 以及对应的质量与成本结果,输出是同时满足全局质量门槛、错放门槛与全部关键切片约束的最低成本阈值。还有一个前提藏在图示的反馈回路里:升级分数必须预测的是“升级收益”而非别的量,而下放的样本必须通过抽样双跑或人工审计回流,否则系统永远看不见自己被错放的请求,上面的错放数字就无从统计。

1000 个请求风险规则先拦截路由分数 g(x)预测强模型增益g≥τ → 强模型升级率与成本上升g<τ → 小模型覆盖高但可能错放随机双跑/人工审计补反事实标签并重校准
图 1 路由分数要预测升级收益;下放样本必须抽样双跑或人工审计,否则系统看不见自己错放的请求。
阈值升级数错放困难请求质量通过平均模型成本升级请求延迟
τ=.71502891.0%.02+.15×.10=¥.035S+判定+L
τ=.52501293.1%¥.045S+判定+L
τ=.3420494.0%¥.062S+判定+L

6路由信号必须在决策时可得且可校准特征

路由器的全部智能都来自它使用的信号,因此信号的选择决定路由的上限。要回答的问题不是“哪些特征与难度相关”,而是更严格的版本:哪些特征真正能预测强模型比小模型更有价值。这个问题的答案首先受制于一个时间约束——信号必须在做出决策的那一刻已经可得。

按可得时点,信号可以分成两组。调用前可得的有:输入所属领域、输入长度、语言、风险规则命中、检索命中情况和证据冲突程度。这些在还没调用任何生成模型时就能拿到,适合直接路由。另一组必须先运行首答才能得到:小模型的输出概率(logprob)、多样本之间的自一致分歧、格式校验结果和外部验证器的判定。这些信号适合级联,因为级联本来就先跑了小模型一轮。反过来,训练离线路由器时绝不能使用最终人工标签、未来的工具状态、或只有强模型运行之后才知道的特征——一旦用了,模型在训练时“看到未来”,这就是数据泄漏,离线路由器的评测成绩会虚高,上线后却无法复现。

即便信号可得,也各有盲区。规则与元数据在调用前可得,但新型困难请求往往不落在旧规则覆盖的类别里,而且历史群体特征可能携带代理歧视的风险。小模型的 logprob 在首答后可得,但对流利但错误的内容不敏感,还受长度偏差影响,本身也常常失准。多样本分歧对一致性的错误无能为力——多个样本可以一致地错,而且多跑样本的成本高。检索与验证器在工具执行后才可得,其可靠性受限于验证覆盖范围,并且验证器自己也会出错。历史群体特征在调用前可得,但涉及公平、隐私和分布漂移:训练分布里的群体行为会随时间和政策变化,静态使用会引入歧视与过时判断。

信号选定之后还差最后一步:校准。路由器输出的是一个分数,但分数必须被解释为“升级能修复这一错误的概率”,而不是模型自我感觉的把握。一个模型说“我有 90% 把握”不能直接变成路由阈值 0.9,因为自报置信度未经校准、系统性偏乐观或偏保守都是常态。正确做法是在独立留出的数据上,把分数按切片绘制可靠性图:把分数划分为区间,统计每个区间里“强模型确实修复了小模型错误”的真实比例,再与区间平均分数对照。若某个切片上分数偏高而修复率偏低,该切片的阈值必须相应收紧。这样,路由的输入是决策时已可得的领域、长度、语言、风险、检索、首答或验证信号,输出是经独立集校准的“升级可修复概率”。两个错误方向都要堵住:训练时泄漏未来信息会让分数不可信,校准时忽略切片差异会让全局可信掩盖局部失准。

信号阶段盲区
规则/元数据调用前新型困难与代理歧视
小模型 logprob首答后流畅错误、长度偏差、失准
多样本分歧首答后成本高、可能一致地错
检索/验证器工具后验证覆盖与自身错误
历史群体特征调用前公平、隐私和分布漂移

7错误下放会集中在谁身上安全与公平

一个路由系统可以在全局质量达标的同时,让特定人群持续地只拿到弱模型。平均质量通过率掩盖的是分布问题:错误的下放并不均匀洒在所有用户身上,而是集中在少数切片里。路由器通常在多数语言和常见任务上训练,于是它会把短输入误判为简单——但短的不一定容易,一个浓缩了复杂背景的短请求反而最需要强模型;它会把少数语言上的低置信当作噪声忽略,因为训练数据里这类样本太少,模型学不到它们的难度;它还可能使用地区、账户等级等历史代理特征做判断,使服务质量沿着这些维度出现不公平的差距。

公平评测的做法是逐切片报告,而不是看一个总数字。对每个语言、领域、用户群和风险切片,分别报告下放率、强对小错率(强模型答对而小模型答错的样本占比)、错放率、升级收益以及各自的置信区间。切片样本少时置信区间会宽,这本身就是信息——它告诉你这个切片的估计不可靠,需要更保守的策略,而不是把区间宽当作“没问题”。公平的目标需要说清:不是要求所有群体的升级比例相同,而是要求错误与服务质量不因路由策略产生不可接受的差距。升级比例不同是合理的——不同群体的问题分布本来就不同;不可接受的是某些群体因为路由器的系统性盲区而持续收到错误。

高影响领域有一条更干脆的出路:不依赖学习到的路由。医疗、金融决策、权限写操作以及明确命中的合规关键词,这些场景的代价函数不允许概率路由器犯错,可以直接用确定性规则强制走更强的验证或人工路径。学习路由适合错误可容忍的长尾,确定规则负责错误不可容忍的头部,两者按领域划分职责,而不是让一个模型全盘决定。

还有一个被动的反馈环会悄悄污染公平。被下放到小模型的用户更容易流失,他们的交互从未来的日志中消失;如果只用留下来的交互训练下一版路由器,系统看到的都是“下放后用户还在”的样本,于是错误地认为下放是成功的。路由器就这样学会了越来越激进地下放,而流失用户的证据永远不会出现在训练集里。打破这个环需要主动保留流失前后的对照信息,把“用户离开”本身当作一个可观测的负反馈,而不是当作数据缺失。

所以公平评测的输入是语言、领域、用户群和风险切片,输出是各切片的四组指标加置信区间。平均合格与切片合格是两件事:前者可能隐藏长尾用户持续收到弱模型的事实,后者才决定这个路由器能不能上线。

8路由器上线也需要探索、监控与回退运维

路由器不是一次性交付的组件。它学到的边界建立在一组特定条件之上:路由标签本质上是候选模型之间的相对差异——哪个模型在哪些请求上更强——而不是某个模型绝对能力的静态描述。因此底层模型一换版本、提示词一改、价格一变、检索质量一波动,或者流量构成漂移,原有的最优边界就立即失真。上线时表现良好的阈值,在条件变化后可能同时出现错放上升与成本浪费,而且没有任何报错提示。

应对办法是把治理做成一个持续循环。第一层是记录:每个请求留下路由分数、选择原因、各候选模型版本、升级率、逐切片质量、成本和级联延迟。没有这些日志,任何漂移都无法定位。第二层是版本变更流程:新模型或新路由器先离线双跑,与现行方案在相同样本上并行比较;再以影子模式上线,只记录决策不影响真实流量;最后金丝雀放量。跳过任何一步,变更的影响就只能靠生产事故来揭示。

第三层是主动探索。选择偏差说下放的样本没有强模型的反事实,治理循环就必须制造这种反事实:对少量本应下放的请求,随机改为运行强模型或送人工审计,估计错放率。探索有成本,也有风险,因此必须限于安全可双跑的请求;不可逆的工具调用只能由一条经过批准的路径执行,探索流量不得触发它。

第四层是监控。按时间和切片持续观察分数分布、校准曲线和升级收益:某个切片的分数分布整体偏移说明流量构成变了;校准曲线偏离对角线说明分数的语义正在失效;升级收益下滑说明强模型与小模型的差距在缩小或扩大。质量标签往往是延迟到达的,在真实标签就位前,可以先看证据缺失率、用户纠正率和人工改判率作为代理指标——这三个信号上升通常意味着路由器正在出错。

第五层是回退。当越权错误或错放率超过预算时,立即切到保守规则:全量升级到强模型或转人工,或干脆禁用相关动作。这里的顺序很重要:先用保守模式止血,再重新收集双跑数据、重新校准边界。只移动阈值来“压住”错放数字而不重新收集数据,是用新数字掩盖根因,漂移依然存在,阈值会继续失效。

把这些连起来,在线治理的输入是模型版本、价格、流量、路由分数、选择原因和延迟到达的质量反馈,输出是一组动作:探索审计、重校准、金丝雀或保守回退。随机双跑让系统持续看见下放样本的反事实;漂移信号触发数据重采集而非阈值微调;错放超预算时先禁用危险动作或全量升级。路由器的质量不是上线那一刻的状态,而是这条循环能否持续运转。

10把因果链连起来综合

把前面各环节的约束按因果顺序排列,路由从“一个问题”到“一套可验证的实践”之间只有六步,每一步都为下一步提供前提,任何一步被跳过,后面的步骤就失去根基。

第一步,建立候选模型的逐样本质量与成本基线。路由只在已有候选之间分配,如果某个切片上所有候选都失败,路由器最多选出不同的失败。因此在写任何路由逻辑之前,先按样本逐条记录每个候选模型的表现与成本,确认每个切片至少存在一个够用的候选。这一步失败,后续所有优化都是在错误的能力地图上做分配。

第二步,定义高风险强制规则。医疗、金融决策、权限写操作、明确的合规关键词,这些切片的代价不允许概率路由器犯错,用确定规则强制走强模型或人工。硬规则必须在任何概率分数之前生效,它是整个系统的安全底线,不是可被分数覆盖的软建议。

第三步,训练并校准“强模型相对小模型的增益”分数。训练目标不是绝对难度,而是升级的预期收益:只有强对小错的样本升级才有价值,双对与双错的样本不产生收益。标签来自独立评分器与人工;下放样本缺失的反事实用随机双跑或离线双跑补足;分数在独立集上按切片校准为“升级可修复概率”,拒绝使用未经校准的自报置信度。

第四步,在满足切片门槛的约束下选择阈值。把阈值视为在错放、质量与成本曲线上移动的控制点:过高的阈值省钱但让困难请求错放,过低的阈值修复错放但推高成本与升级延迟。可行区域由全局质量门槛、错放门槛和全部关键切片的独立上限共同围成,阈值取可行区域中成本最低的点。

第五步,灰度上线并随机审计下放样本。路由决策在小流量上验证,同时对少量下放请求随机运行强模型或人工审计,让系统持续看见自己是否错放。探索流量只覆盖安全可双跑的请求,不可逆动作只允许一条经批准的路径执行。

第六步,在版本或分布变化后重校准或回退。路由标签是候选之间的相对差异,任何模型版本、提示、价格、检索质量或流量变化都会移动最优边界。漂移信号触发的是重新收集双跑数据与重校准,而不是微调阈值掩盖根因;错放超预算时先切保守模式——全量强模型、转人工或禁用动作——再从容恢复。

这条链的因果方向是:基线决定候选是否可分配,硬规则决定哪些切片不参与概率分配,增益分数决定分配依据是否可信,切片门槛决定阈值是否可行,随机审计决定运营是否看得见错误,重校准与回退决定系统在变化后是否仍然成立。每一步的输出都是下一步的输入,链条的任何一环断开,剩下的环节只是在更高的层次上重复同一个错误。

资料来源与改编说明
访问日期:2026-07-22