平台概念
Failover 与高可用
多 vendor 自动故障转移
Failover 是 ModelSite 相比直连单一厂商的核心价值——同一模型后端可接入多个上游 vendor,某个上游故障时路由层自动切换,单厂商故障不会中断你的服务。
工作原理
- 一个模型 ID 在平台后端映射到一个或多个上游 vendor(如 Claude 可来自 Anthropic 官方 + 多个代理通道)。
- 每次请求,路由层按策略(负载、延迟、健康度)选一个上游。
- 若上游返回
5xx/ 连接错误 / 超时,路由层标记该上游进入冷却(cooldown),立即切换到下一个可用上游重试。 - 整个过程对调用方透明——你只感觉到偶尔略高的首 token 延迟,而不会看到失败。
对调用方的影响
| 场景 | 你看到的 |
|---|---|
| 某上游偶发 5xx | 透明重试,调用成功(延迟略增) |
| 某上游持续故障 | 自动冷却,切到健康上游 |
| 所有上游都失败 | 才返回 5xx(罕见) |
计费一致性
无论命中哪个上游,按该模型的统一牌价计费——你看到的价格不因后端切换而变化。实际上游、延迟、token 用量记录在用量日志。
与客户端重试配合
平台 failover 已覆盖多数上游异常。客户端只需对 429(限流)和极少数 503 做轻量退避,无需为上游故障自建复杂重试。
关键业务想进一步兜底:对实时流量保持合理并发,避免单 Key 打满 RPM 触发 429(429 不走 failover)。