指南/准入测试为什么不够

中转站准入通过了,后面还可能换模型

一批固定题在接入前跑得很好,不能证明业务上线后还会走同一批资源。中转站掌握每次请求的上游路由;技术上可以让新账号在准入阶段使用质量较好的上游,放量后再把部分流量切到便宜模型,客户端的 model 字段和返回格式照旧。要查这种变化,准入题得在上线后继续跑,并和官方端点做同期对照。

最后更新 2026-08-16阅读约 9 分钟

一份准入报告,只覆盖报告里的时间

常见的准入流程并不草率:申请一个新密钥,跑一批固定问题,测试流式输出、工具调用和长上下文,再拿几道题和官方结果对照。测试全过,延迟也好看,于是开始充值、改配置、放业务流量。

问题出在时间范围。假设准入发生在下午 2 点到 3 点,下面两行路由都能让那份报告显示「通过」:

阶段中转站内部路由(示意)客户端看到的内容
新账号准入测试请求全部转给标称模型原模型名、原响应格式、质量正常
业务放量后大部分请求仍走标称模型,少量请求转给便宜模型模型名和格式不变,质量偶尔下降

这张表只说明中转层有这种操作空间,不指向某一家服务。中转站在转发前能读取密钥所属分组、请求时间和模型参数,再选择上游;拿到响应后,也能重新包装成同一套 JSON。客户端没有一个可信字段可以证明这次请求最终由哪一个模型生成。

公开研究已经观测到上游变化和模型身份不一致。CISPA 在 2026 年审计的 17 个影子 API 中,有 11 个使用 OneAPI、NewAPI 一类聚合系统;这些系统提供密钥管理、请求路由和自动重试。研究者还记录到服务方频繁更换上游来源,却没有向用户提供详细通知。

在进一步审计的 24 个端点中,11 个没有通过模型指纹验证,部分任务与官方端点的准确率差距达到 47.21%。论文没有证明某家服务专门优待准入测试;它提供的证据足以说明,上游来源会变,接口名称也不能担保模型身份。详见 Real Money, Fake Models 和站内的四篇论文审计汇总

单次测试漏掉了「以后」和「一部分」

整批更换最容易理解:准入测试发生在切换之前,样本再漂亮也看不到未来。多跑几次只能增加当时的样本,无法验证一周后、充值后或晚高峰时还会不会走同一批资源。

更难查的是部分流量换模型。假设每次请求独立,有 10% 的概率被转给便宜模型,连续测试 5 次仍有约 59% 的概率一次都碰不到。若路由按账号或时间黏在同一资源池,请求之间并不独立,半小时内连跑 50 次也可能只测到一条路由。

2026 年的 IRIS 论文把这种做法称为「路由稀释」。在论文一组较容易区分的商业模型上,替换比例为 40%、20%、10%、5% 时,AUROC 达到 0.95 大约需要 8、16、32、64 次查询。这个数量关系不是通用保证:作者也报告,部分能力接近的模型在替换比例只有 5%–10% 时,即使查询 256 次仍难以识别。

准入测试最大的空白,是测试结束以后没有继续取样。再增加接入当天的题量,补不上这个时间缺口。

用户看到的往往只是「最近偶尔变笨了」

便宜模型不一定每题都失败。摘要、改写、简单问答和常见代码补全可能照常完成,差异留到长上下文、多项约束、工具调用或专业领域才出现。业务输入每天都在变化,很难把某次失败和模型切换直接对应起来。

部分流量替换还会制造一种很别扭的体验:同一段代码、同一个账号,上午回答正常,下午漏掉约束,重试又恢复。没有保留固定输入和准确时间时,这类问题很容易被记成生成随机性、网络波动或「今天状态不好」。

接口层也不会主动报出切换。请求里的 model 是用户提交的名称,响应里的模型字段可以由中转站填充,账单继续按原名称计费。字段没变,只能证明接口仍在使用那个名称。

准入题要留在生产周期里继续跑

准入结束后不要丢掉测试集。它是上线后的第一份对照样本。要让两次结果能比较,至少保留下面这些条件:

运行频率由可接受的发现时间决定。希望 6 小时内发现持续切换,最长采样间隔就不能超过 6 小时;只关心每月对账,没必要按分钟运行。频率高低不是重点,覆盖业务时段并保留可比较的历史才有用。

先排除配置变化,再谈模型掉包

看到固定任务变差后,第一步是核对请求版本标识。prompt、参数、客户端版本或发起区域变过,先为新配置另起基线。配置没动,再看异常是否连续出现,以及是否集中在某个账号、分组或时段。

接着看组合信号。固定能力题持续退化,同时出现输入 token、缓存字段、终止原因或响应结构变化,比单个答案变差多一层信息。不同账号在同一时段稳定分叉,也值得检查分组路由。延迟无论变快还是变慢都很弱:便宜模型可能更快,上游扩容和网络排队也会改变速度。

官方同期对照仍然一致,中转站却连续偏离时,可以运行模型指纹或更有区分度的任务集。问模型「你是谁」没有用,简单知识题也容易被不同模型答对。KBF 使用知识边界附近「稳定答对或稳定答错」的数值题,IRIS 使用随机数和短字符串的采样分布,都是为了从输出里找比自述更难伪造的信号。具体方法、成本和误报边界见模型掉包的学术审计方法

黑盒监控能写到哪一步

「固定配置从某天开始持续偏离过去范围」是观测事实。「上游路由或模型版本发生变化」是需要复查的解释。「运营方故意换成廉价模型」涉及意图,还需要服务方日志、合同约定或其他独立证据。

统计不一致不是定罪 模型指纹、Usage 和能力题共同变化,可以把排查范围缩到上游路由;它们仍不能单独证明具体替换成了哪一个模型,更不能证明运营方为什么切换。

变化发生后,先冻结对应时间段的请求、响应和账单,再记录影响比例与持续时间。事实、线索和判断分开写,后续才能和服务方对账。具体读法见如何读懂一条变化记录

持续监控仍有盲区

固定探针运行久了,可能被识别并单独路由到好资源。轮换等价题目、改变运行时间、覆盖多个生产分组,可以增加识别成本,但无法消除对抗性路由。采样真实业务更接近用户体验,又会带来隐私、数据留存和结果不可比的问题,不能直接保存客户 prompt。

官方移动别名也会在模型字符串不变时更新后端版本。此时官方和中转站可能一起变化,原因未必来自中转站。持续监控提供的是变化时间、影响范围和原始样本,不是一张永久有效的渠道证书。

准入测试适合回答「这个接口现在能不能用」。长期使用还要回答另一个问题:从接入到今天,这条路由有没有变过。

把准入题留到上线以后

LinkyMonitor 持续重放固定探针,记录模型行为、Usage、响应结构与变化时间,让接入后的路由偏离有历史可查。

申请试用