阈值含义
所有阈值实时渲染自检测引擎 /api/checks——本页不做任何硬编码,引擎调参后本页自动跟随。
token 计量偏差
实际消耗与声称计量的相对偏差:normal 以内视为正常浮动,超过 suspicious 判可疑(虚标计费的核心证据)。
token_deviation_normal | 0.03 |
token_deviation_suspicious | 0.05 |
价格溢价
实际价格相对官方目录的溢价倍数:超过 normal 值进入观察,超过 watch 判可疑(贵不是错,虚标才是——溢价本身只作参考信号)。
price_premium_normal | 1.1 |
price_premium_watch | 1.3 |
模型指纹
输出分布与声称模型的指纹距离:小于 match 视为同源证据,超过 mismatch 视为异源替换证据;两者之间需最小差距(min_margin)避免噪声定罪。
fingerprint_match | 0.02 |
fingerprint_mismatch | 0.05 |
fingerprint_min_margin | 0.02 |
输出一致性
同题重复采样的自一致率与输出变异系数:低于 watch 观察、低于 fail 判定(偷工减料的典型表现)。
consistency_watch | 0.85 |
consistency_fail | 0.6 |
consistency_output_cv_watch | 0.15 |
consistency_output_cv_alert | 0.4 |
长上下文召回
埋点检索的召回率:低于 watch 观察、低于 fail 判定(上下文裁剪/压缩的证据)。
context_recall_watch | 0.85 |
context_recall_fail | 0.6 |
双峰检测
行为分布双峰系数阈值:超过该值说明存在"检测账号/普通账号"分流的强信号。
bimodality_threshold | 0.555 |
能力衰减
静态/动态能力相对官方基线的下降幅度:超过 watch 观察、超过 fail 判定(降智/缓存老答案的证据)。
capability_drop_watch | 0.08 |
capability_drop_fail | 0.18 |
官方基线偏差
与平台官方基线样本的偏差幅度:watch 观察、fail 判定。
official_baseline_delta_watch | 0.15 |
official_baseline_delta_fail | 0.3 |
其他阈值
p_value | 0.05 |
min_sample_size | 100 |
cross_endpoint_ratio_spread | 0.05 |
cross_endpoint_accuracy_spread | 0.15 |
cross_endpoint_min_peers | 2 |