威胁模型
我们防什么、怎么防、防到什么程度。防御边界的诚实披露与检测本身同样重要。
模型替换(substitution)
作弊行为:声称 A 模型,实际转发便宜模型 B。
检测手段:输出分布指纹(n-gram/长度/拒绝模式)与声称模型指纹比对;异源残留探测(把 B 的特征词捞出来);签名缺失核验。
边界:同源近亲模型(如同一底模的不同量化)指纹距离可能落在灰区,需要最小差距(min_margin)避免噪声定罪。
计费虚标(inflated)
作弊行为:多扣 token、按更高价目计费、重复计费。
检测手段:token 计量偏差(声称 vs 实测消耗);价格溢价倍数对照官方目录。
边界:贵不是错——溢价本身只作参考信号,判罚看计量是否诚实。
降智(degraded)
作弊行为:返回缓存的老答案、低 temperature 裁剪、压缩提示词。
检测手段:一致性衰减(同题重复采样自一致率);能力对照官方基线(静态/动态/指令跟随);输出变异系数。
边界:低 temperature 本身是合法参数;判定要求统计显著的衰减幅度而非单次偶发。
上下文裁剪(context truncation)
作弊行为:悄悄截断长上下文,按全量计费。
检测手段:长上下文埋点检索(不同深度档位的召回率);召回率阈值判级。
边界:极深档位受网络波动影响,需要每档多次重试取稳定结果。
检测分流(probing whitelist)
作弊行为:识别检测流量,给检测账号特殊通道;或双峰分流。
检测手段:行为分布双峰检测;同 key 同题跨时间重采的一致性漂移;官方复测通道对照。
边界:高级规避(检测账号体系)只能靠多来源用户样本交叉与官方出资复测缓解,无法根除——所以榜单是多样本聚合而非单报告定论。
混合路由(blended)
作弊行为:高价值请求走真模型、低价值走便宜模型。
检测手段:能力检测的动态题组(避免静态题被针对性路由);输出分布按请求类型分层。
边界:按检测特征分流是最难防的场景;官方基线偏差检测提供第二重证据。
无用量报告(no_usage)
作弊行为:key 无效或站点不可达,返回空内容冒充检测完成。
检测手段:零证据成功被识别为检测失败,自动退还额度,绝不产出分数。
边界:无。这是诚实性设计而非统计检测。