局限与误判
把检测的边界说清楚,和检测本身一样重要。这一页列出我们无权下的结论、 降配的真实代价、以及何时应当存疑。
我们检测不到什么
- 检测只覆盖「检测时刻」的样本。站点可能在检测后改变路由策略,历史结论不保证未来行为。
- 无法检测不在请求链路上出现的行为:例如仅对特定账号段、特定地区或特定时段启用的差异化路由。
- 思维签名、logprobs 分布等深度指纹依赖上游模型网关的响应字段;上游不支持时该项只能标记为「无法判定」。
- 我们不对站点的商业信誉、跑路风险做任何判定——那不是技术检测的范畴。
降配的代价(如实披露)
- 快检(Phase 1)与全检(Phase 1+2)使用更少的题量与探针样本。降配的直接代价是统计置信区间变宽。
- 例如题量从 42 降到 20 时,95% 置信区间会放宽到约 23%–70%——这不是缺陷,是统计事实,报告中如实呈现。
- 我们不为了"分数好看"而隐藏降配事实:每份报告都标注其所用档位与证据充分度。
何时应当存疑
- 样本量少于 3 次的聚合分只代表单次观测。榜单对这类站点标注「证据不足」,展示为 —,绝不渲染为红或绿。
- 一次高分不能证明站点长期可信,正如一次低分不能证明站点必然掺水。请结合历史记录判断。
- 「无法判定」≠「通过」。该项证据不足时,我们宁可留空,也不制造虚假的确定性。
被误报了怎么办
- 如果你是站点运营方,认为某结论有误,可免费认领站点并提交申诉;争议报告由平台出资复测,裁决过程与结果(含被驳回的申诉)全部公示。
- 如果你是用户,对报告结论存疑,可用自己的 Key 重新检测复核。