指南/掉包模型的学术审计

学术界怎么审计中转站掉包模型:四篇论文的方法与数字

模型掉包已经有可复现的研究方法,但四篇论文测的对象、样本单位和结论边界并不相同。本文核对它们的原始数字,重点回答三个问题:能发现什么、需要多少次查询、哪些结果还不能当作掉包证据。

最后更新 2026-08-16阅读约 11 分钟

先分清两个样本单位

中文圈常见一句话:「CISPA 测试了 28 个中转站,45.83% 的 API 端点存在模型身份不匹配。」其中两个数字分别来自 KBF 和 CISPA,不能拼成一个比例。

数字论文中的口径
28KBF 在 6 个代表性平台的审计中统计了 28 个「平台 × 模型」单元,其中 7 个与参考端点不一致
45.83%CISPA 深入审计 3 个中转站的 24 个端点,其中 11 个指纹验证失败
47.21%CISPA 在 MedQA 上观测到的最大准确率差距;官方端点为 83.82%,三个影子 API 为 36.61%–37.31%

因此,这些研究不能推出「某个比例的中转站都在掉包」。它们能证明的是:研究样本中出现了可重复观测的身份或行为差异。

CISPA:同时测身份和实际能力

Real Money, Fake Models: Deceptive Model Claims in Shadow APIs 先从 ICLR 2024 和 ACL 2024 的论文代码中寻找影子 API。研究者最终找到 17 个服务,其中 3 个进入深入审计,覆盖 8 个模型、24 个端点。

身份审计用了两种方法:

在受控验证中,LLMmap 的准确率为 96.0%,MET 为 88.3%;54 个实际案例中,两种方法有 40 个结论一致,Cohen's κ 为 0.512。对 24 个端点做 LLMmap 后,11 个端点匹配到其他模型,另有 3 个虽然模型标签一致,但余弦距离超过论文设定的正常范围。

能力测试补上了身份指纹看不到的一面:

论文还对价格与准确率下降做了回归,在这 24 个端点中没有发现价格具有预测力。高价不能替代身份和行为核验。

这项研究的观测窗口是 2025 年 9 月至 12 月。作者将其定义为一次限定时间的快照,并记录到服务会更换上游、改变路由或停止运营。另一个边界来自联合分析:有些端点身份指纹通过,敏感领域表现仍明显偏离;有些身份不匹配,个别基准上的差距却不大。身份和行为需要分别检查。

KBF:用稳定的错误答案做指纹

KBF: Knowledge Boundary as Fingerprint 认为输出风格容易受角色提示、检索增强、温度和包装层影响,因此改用「知识边界」:寻找模型能稳定回答、或会稳定答错的数值事实,再把这些回答做成探针。稳定的错误与模型参数相关,比语气和格式更难由外层包装改变。

受控实验覆盖 16 个生产端点。论文定义了 155 组具有经济动机的替换方向,包括更便宜的模型和同价格档模型;KBF 在 p<0.05 下全部标记,16 组同端点对照没有误报。这里的 0/16 只能算初步校准:作者给出的单侧 95% 置信上界仍有 17.1%。扩展到 80 组配置扰动测试后,还出现了 2 次误报,均来自基线本身不稳定的 GLM-4.7-Flash。

成本数字也要分开看:一次性的参考探针生成约 22 美元;探针建好后,对 16 个端点各跑一次的在线审计合计约 0.39 美元,其中 Claude Opus 4.6 约 0.24 美元。

实地部分共审计 11 个匿名平台,论文摘要汇总了其中 6 个代表性平台的 28 个「平台 × 模型」单元,报告 7/28 与参考端点不一致,其中 6 个落在 Claude 端点。这组比例描述的是所选平台和探针,不能当成行业抽样结果。

分组对比比总体比例更有解释力。同一批 7 个平台上,Claude Opus 4.6 的低价组与升级组分别有 5/7 和 1/7 被标记;Claude Sonnet 4.6 分别为 2/7 和 1/7。这个结果只描述这 7 个平台,不能外推成行业比例。

对混合路由,正文给出的范围也比摘要窄:换成差异明显的便宜档模型时,替换比例低于 7% 已能被检出;强模型之间需要约 13%–35% 才达到 80% 检出率,最难的同档配对约到 43% 才超过 95%。方法适合初筛。一次拒绝只表示所选探针与参考端点统计不一致,指控违约仍需重复审计或服务方日志。

IRIS:先估算检测预算

IRIS: Budgeted Black-Box Auditing of Model Substitution and Routing Dilution in LLM Gateways 把部分流量替换写成混合分布:

Q_ε = (1 − ε)·P + ε·R

P = 声称提供的模型
R = 替代模型
ε = 被替换的请求比例

ε=1 是全部替换,0<ε<1 是路由稀释。稀释越少,每次查询遇到替代模型的概率越低。存在易区分尾部时,预算接近 1/ε;难区分的配对会接近 1/ε²

论文用一个商业模型实验给出 AUROC 诊断值:

稀释比例 εAUROC 达到 0.95 时的查询量中位数
40%约 8 次
20%约 16 次
10%约 32 次
5%约 64 次

这组数字描述特定探针与模型配对上的诊断结果,不是「查询 64 次即可保证发现 5% 掉包」。论文用于固定误报率的部署检验会付出更接近 1/ε² 的成本,部分旗舰模型配对在 256 次查询下仍无法可靠识别 5%–10% 的稀释。

IRIS 的探针要求模型生成短随机序列,再从可见字符串提取 179 维特征,包括格式合规、符号频率、转移、游程和位置平衡。分类器使用 300 棵树的随机森林。随机生成没有知识题的标准答案,信号来自端点的采样分布。

在 17 个端点构成的 272 个有向配对中,218 个通过了预审计区分度门槛。对这些配对使用 80 次查询、设置 ε=0.3 时,已知替代模型的平均检出功效为 0.85,诚实流量的平均误报率为 0.0167;未登记替代模型时,检出功效降到 0.78,稀释比例只能给下界。余下 54 个配对因区分度不足被标为不确定,主要集中在同族近亲模型或单次响应指纹不明显的模型。

实地实验分别固定 3 个开放权重模型,比较 OpenRouter 上不同供应商,共采集 1,906 个响应。15 组供应商配对中有 14 组输出分布可区分,差异与量化精度或推理实现有关。这个结果回答的是「两个部署是否产生相同分布」,不能直接证明其中一个部署伪报了模型。

温度也是硬边界。贪心解码反复返回同一输出时,重复采样不再增加证据;探针或替代模型没有登记时,归因和稀释比例估计也会变弱。

Berkeley:纯软件审计没有完整保证

Are You Getting What You Pay For? 给出了对前三种路线的反方结论。论文认为,仅靠输出文本的统计检验查询成本高,难以识别细微替换;依赖对数概率的方法又会受生产推理不确定性影响。因此,纯软件审计无法提供模型完整性的密码学保证。

作者提出用可信执行环境(TEE)验证模型完整性,并报告适度的性能开销。它解决的是「如何获得可验证保证」,代价是需要服务方和基础设施配合。KBF 与 IRIS 改进了黑盒审计的成本和适用范围,但没有把统计线索变成密码学证明。

四篇论文共同留下的边界

可以支持还不能支持
多组研究在特定样本中观测到身份或输出分布差异推算整个中转站行业的掉包比例
CISPA 的 24 个端点中,价格不能预测准确率下降便宜或昂贵的渠道天然更可信
KBF 的 7 个平台出现低价组与升级组差异把 7 个平台的比例推广到其他平台
IRIS 说明低比例稀释需要更多查询固定查询次数可以保证发现任意替换
统计不一致值得继续查日志和历史记录只凭一次指纹结果认定服务方违约

实际核验时,不要用模型自述作为判据;系统提示和代理都能改写自述。如果要做黑盒探针,应先保存官方参考端点的同条件样本,再固定模型版本、温度、提示和输出限制。单次准入测试只能确认当时的端点表现,后续还要查看持续监控基线模型版本漂移

论文测的是一个时间窗口,日常使用要看后续是否变化

LinkyMonitor 对同一条链路持续发起已知请求,把资源特征、Token 用量与请求行为的偏离留成可复核的历史。它给的是线索和变化,不是对渠道的认证。

申请试用

论文出处

本文数字均取自各论文的公开版本,如与后续修订版不一致,以论文为准。