威胁模型

我们防什么、怎么防、防到什么程度。防御边界的诚实披露与检测本身同样重要。

模型替换(substitution)

作弊行为:声称 A 模型,实际转发便宜模型 B。

检测手段:输出分布指纹(n-gram/长度/拒绝模式)与声称模型指纹比对;异源残留探测(把 B 的特征词捞出来);签名缺失核验。

边界:同源近亲模型(如同一底模的不同量化)指纹距离可能落在灰区,需要最小差距(min_margin)避免噪声定罪。

计费虚标(inflated)

作弊行为:多扣 token、按更高价目计费、重复计费。

检测手段:token 计量偏差(声称 vs 实测消耗);价格溢价倍数对照官方目录。

边界:贵不是错——溢价本身只作参考信号,判罚看计量是否诚实。

降智(degraded)

作弊行为:返回缓存的老答案、低 temperature 裁剪、压缩提示词。

检测手段:一致性衰减(同题重复采样自一致率);能力对照官方基线(静态/动态/指令跟随);输出变异系数。

边界:低 temperature 本身是合法参数;判定要求统计显著的衰减幅度而非单次偶发。

上下文裁剪(context truncation)

作弊行为:悄悄截断长上下文,按全量计费。

检测手段:长上下文埋点检索(不同深度档位的召回率);召回率阈值判级。

边界:极深档位受网络波动影响,需要每档多次重试取稳定结果。

检测分流(probing whitelist)

作弊行为:识别检测流量,给检测账号特殊通道;或双峰分流。

检测手段:行为分布双峰检测;同 key 同题跨时间重采的一致性漂移;官方复测通道对照。

边界:高级规避(检测账号体系)只能靠多来源用户样本交叉与官方出资复测缓解,无法根除——所以榜单是多样本聚合而非单报告定论。

混合路由(blended)

作弊行为:高价值请求走真模型、低价值走便宜模型。

检测手段:能力检测的动态题组(避免静态题被针对性路由);输出分布按请求类型分层。

边界:按检测特征分流是最难防的场景;官方基线偏差检测提供第二重证据。

无用量报告(no_usage)

作弊行为:key 无效或站点不可达,返回空内容冒充检测完成。

检测手段:零证据成功被识别为检测失败,自动退还额度,绝不产出分数。

边界:无。这是诚实性设计而非统计检测。

对应的检测项清单见 检测项详解;误判的完整讨论见 局限与误判。