铭鸿体育资讯网

同一个模型换个主机就掉 20 分:一个跑了 1800 万条消息的运营者把网关的坑

同一个模型换个主机就掉 20 分:一个跑了 1800 万条消息的运营者把网关的坑列了出来「到今天我经手了 1800 多万条消息,大约三分之一走 OpenRouter 上的开源模型。」说这话的是一位跑了两年多 AI 助手的运营者 Olly,他在 09-07 把自己这一路踩的坑写成清单。

最扎心的一条是:同一个模型,不同主机不是同一个东西。模型是权重,provider 是 OpenRouter 把你路由过去的那家公司,同一个 deepseek/deepseek-v4-flash-0731 背后大约有 20 家公司在服务。按 OpenRouter 自己跑的按主机榜(09-07 读数、滚动 32 天均值),同一份权重:DeepSeek 首方 90% 的 GPQA、81% 的 TAU(工具调用),DigitalOcean 是 75% 和 58%;多数主机在工具调用上比首方低 5 到 7 分,四家在知识类基准上直接掉悬崖,而 7 月时 Fireworks 的 TAU 只有 46 分,差 30 分。

还有几类更隐蔽的:页面写着支持图片输入的模型,有些主机根本读不到图,却照样返回 200;reasoning.effort 参数人人接受,但在 digitalocean、gmi-cloud、mancer、venice 上基本不起作用;fp4 主机在 fp8 主机群里排在中间,按精度筛不是质量代理——三家 GPQA 最差的主机里,fp4、fp8、什么都没声明各占一家;7 月的 StreamLake 只占他约 20% 的流量,却贡献了 92% 的空补全。他甚至固定了三家「最可靠」的主机并关掉回退,两周后一家开始 429、一家已经不再提供该模型、流量全压到第三家,第三家也开始 429,服务直接中断。

这是单一运营者的视角,榜单是平台自己跑的滚动统计,厂商名和分数会逐月变化,不能当成永久结论。

我的判断:网关省的是接入成本,不是质量方差。选型要按自己的工作负载看主机级榜单,把「200 但没内容」当成失败去重试,冗余按主机设计而不是按模型名设计。