如何正确读一份 AI API 中转站榜单
长文 · 结论只依据公开可复算的数据;文中每个机制都可以在方法论页核对参数。
一、先问榜用什么数据
一份榜单可信的前提是它的每个数字都能被追溯到原始证据。 本站的每次检测都由独立引擎执行、报告含完整检查明细、公开报告带分享令牌可复核; 无法提供原始证据的"评测"本质上只是编辑部观点。
其次看谁出钱。被测站自费送检、或榜单收推广费,都构成利益冲突。 本站的官方样本由平台自费(抽样审计按月公示), 商户检测消耗商户自己的额度与 Key——任何人都可以复现"检测同一家站"的过程。
二、三个数字回答三个不同问题
中位分回答"通常表现怎么样":90 天内全部有效公开检测的中位数。 中位数而非平均数的意义在于抗污染——雇 100 个小号刷高分,拉不动中位数。
排名分回答"这个分数有多少证据支撑":贝叶斯收缩后的置信下界, 再乘以 critical 率惩罚。一个只被测过 2 次的站即使中位分 98,排名分也会被收缩到先验附近—— 这就是为什么我们的榜单上新站不会一夜登顶。
通过率回答"稳不稳定":拿到可信级结论的占比。 中位分高但通过率低的站,意味着表现大起大落。
所以"中位分更高的站排在后面"不是 bug——那通常说明它样本少、或出过严重问题。 把三个数字放在一起读,比任何"综合分"都更难被操纵。
三、刷榜者会怎么打,以及我们怎么挡
- 小号刷分 → 新账号(7 天内)样本权重 0.3×;同域超过 3 个新账号样本直接置零转人工复核。
- 高频轰炸 → 同账号同域 24 小时只计 1 次样本。
- 挑好时段送检 → 榜单聚合用中位数 + 下界,单次好成绩影响有限;官方抽样随时可能撞上坏时段。
- 给竞对刷低分 → 恶意低分同样过中位数稀释;对结论有争议走公示仲裁。
没有任何机制能宣称"绝对防刷"。我们的立场是把参数全部公开、把样本全部可查, 让操纵的成本和痕迹都最大化。
四、读榜礼仪:证据不足不是差评
样本量低于门槛的站,我们标灰"—(证据不足)"。它既不是好也不是坏—— 只是"还没攒够证据"。把证据不足渲染成红色是行业最常见的操纵手法之一:用户分不清 "被测出有问题"和"还没被测过",而运营方可以借此打压竞对或收"去除费"。 我们拒绝这么做,这是写进测试的红线。
五、动手验证
读榜的最终形态是不依赖任何榜:本站每个公开报告都能从检查项明细逐条复核 (检测器说明),榜单排序参数公开可复算 (排序方法论),术语定义无歧义 (术语表)。如果你发现任何页面说的和算的对不上, 那是我们的 P0 级缺陷——请通过公示渠道指出。