工具怎么工作的

这个工具做的事很简单:拿你给的接口地址和密钥,往那个接口发几道题,然后看回答本身像不像它声称的那个模型。

看的是回答,不是接口自己说了什么

接口返回的字段是可以随便写的。中转站想让返回里写着 claude-opus-4-7,改一行代码就行,改完你从字段上看不出任何区别。所以那些字段只当线索,不当证据。

真正当证据的是回答本身——这部分是模型算出来的,转发的人改不动:

  • 写作风格:每个模型遣词造句都有自己的习惯,换一个模型,习惯就变了。
  • 知道的事情截止到什么时候:每个模型的训练数据都有个时间点,问它那之后发生的事,它答不上来。这个边界在哪,不同模型不一样。
  • 临场出的题:现编的题目,网上搜不到答案,也没法提前缓存好。
  • 计费时 token 怎么切:不同厂商切分文本的方式不同,这个体现在计费数字上。

你的密钥去哪了

密钥只在这一次请求里用一遍,用完就没了。不写数据库、不写日志、不做统计。服务器上唯一留下的东西是一个数字:一共跑过多少次检查。

即便如此,最稳妥的做法还是:用一个临时的、额度很小的密钥来测,测完到中转站后台删掉它。这对任何要你贴密钥的网站都适用,不只是这里。

结果怎么读

结果说的是这一次请求拿到了什么,不是给这个站下判断。同一个站,不同渠道、不同时间点,结果可能不一样——中转站后台随时能切换上游。

「对不上」也不等于对方在骗人。上游临时调整、渠道刚好在切换、你选的模型名跟这个渠道对不上,都会导致这个结果。想确认的话,隔一段时间再测一次,或者换个模型名试试。

回到自查工具