定义
AI API 网关是放在多个大模型厂商前面的一层中间服务,对外只暴露一个稳定的接口地址。你不需要为 Claude、GPT、DeepSeek、Qwen、Kimi、GLM 各开一个账号、各管一把 Key、各充一次余额——客户端只连一个 base_url,网关负责鉴权、选上游线路、转发请求,并把回复按厂商原本的格式返回。
QuantoPort 就是这样的网关:一个 Key、一个余额,同一台主机上提供 OpenAI 兼容、Anthropic 兼容与 Responses 三种接口。
一次请求实际发生了什么
- 鉴权:校验你的 Key,并检查这个 Key 关联的余额。
- 选路:按请求里的模型名选择上游厂商和接口格式。
- 转换:如果你用 OpenAI 的格式请求 Anthropic 系模型(或反过来),网关在收发两个方向各做一次格式转换。
- 流式或缓冲:服务端推送(SSE)原样透传,流式客户端不需要改代码。
- 计费:按厂商返回的用量统计输入与输出 token,从同一个余额里扣。
- 对账:控制台里可以看每个 Key 的用量、消费和剩余额度。
为什么用网关,而不是每个厂商各开一个账号
| 关注点 | 每家用一个账号 | 用一个 AI API 网关 |
|---|---|---|
| 密钥 | 每家一把 Key,分别轮换 | 一个 Key 通调所有模型 |
| 计费 | 多个余额、多种币种、多张账单 | 一个余额,一次充值 |
| 客户端代码 | 每家一套 SDK 和请求格式 | OpenAI / Anthropic 兼容的 base_url |
| 换模型 | 改代码、换凭证 | 改请求里的模型名 |
| 开通门槛 | 逐家注册,各有地区与支付限制 | 一次开通、一条支付通道 |
计费方式
按 token 计费,价格是厂商官方价的一个比例。QuantoPort 对外公示的比例是:
| 模型家族 | 相对官方价 |
|---|---|
| Claude / GPT | 官方价 6.6 折 |
| DeepSeek / Kimi | 官方价 8.8 折 |
| GLM-5.3 | 官方价八折 |
| GLM-5.2 | 官方价七折 |
| Qwen | 官方价 |
充值额度永不过期,最低充值 $10,支持 USDT(TRC-20 / BSC / Solana)。每个 Key 的实时模型列表随时可以用 GET /v1/models 查;OpenAI 兼容客户端的 base_url 是 https://quantoport.com/v1,Anthropic 兼容客户端是 https://quantoport.com。
网关改变不了什么
网关不是模型。它不训练、不微调、也不自己托管它转发的模型,也无法超过上游厂商的上下文长度、限流和能力边界。模型名称只表示兼容性。QuantoPort 与 Anthropic、OpenAI、DeepSeek、阿里等厂商没有关联,也不代表它们的认可。
常见问题
网关会比直连官方慢吗?网关多一跳网络和一次格式转换。对聊天类流式任务,首字延迟的差异相对模型推理时间很小;而它省掉的是维护多套厂商接入的时间。
已有的 OpenAI 或 Anthropic 客户端能直接用吗?可以。把 base_url 指向网关、换成网关的 Key,请求格式不变,其他代码不用动。
怎么知道现在有哪些模型?用你的 Key 调 GET /v1/models。这份列表是按 Key 实时生成的,比任何静态目录页都准。
厂商改了接口怎么办?由网关吸收这次改动,你的客户端继续调同一个地址。