① 怎麼選模型
| 任務 | 推薦 | 理由 |
|---|---|---|
| 最難推理(科研/數學/架構) | Claude Opus 5 / GLM-5.3 | 思維鏈最深,Opus 5 帶 1M 上下文 |
| 日常編碼(IDE Agent/評審) | Claude Sonnet 5 / DeepSeek V4 | 速度與質量最佳平衡 |
| 海量任務(分類/抽取/批處理) | Haiku 4.5 / DS V4 Flash / Qwen Flash | 成本低數倍,指令跟隨依然強 |
| 中文工作流(內容/長文件/本地化) | Qwen 3.8 / Kimi K3 / GLM | 中文理解最強 |
| 視覺/多模態 | Qwen 3-VL Plus | 影象理解,價格遠低於旗艦視覺 |
| Codex/GPT 生態 | GPT-5.5 / 5.4 | OpenAI Agent 框架原生適配 |
心法:正式工作從中間檔(Sonnet 5 / DS V4)起步,任務確實難再升 Opus 級,重複性任務降 Haiku/Flash 檔——賬單可省約 10 倍,質量損失常為零。
② 三種協議
| 協議 | 端點 | 適用 |
|---|---|---|
| OpenAI Chat | /v1/chat/completions | OpenAI SDK、Cherry Studio、多數工具 |
| Anthropic Messages | /v1/messages | Claude Code、Anthropic SDK、Cursor |
| Responses | /v1/responses | Codex CLI/擴充套件、新版 OpenAI SDK |
③ 賬單怎麼算
每次請求計量五類 token:輸入(1×)、輸出(約 5×輸入)、快取寫入(1.25×輸入)、快取讀取(0.1×輸入——最大的省錢槓桿)、思考 token(按輸出計)。技巧:保持 system prompt 穩定以最大化快取命中;流式與非流式同價;控制台用量明細精確到 token。
④ 為什麼走閘道器而不是直連?
⚡ 一把 Key 全模型
不用為每家廠商單獨註冊、單獨充值、單獨看面板。Claude、GPT、DeepSeek、Qwen、Kimi、GLM 共享一個餘額。
💳 無需海外信用卡
USDT 在 TRC-20 / BSC / Solana 三條鏈充值,$10 起充或 $10,000 一視同仁。
🎯 長期固定折扣
Claude/GPT 6.6折,中國 7–8.8 折——折扣是政策,不是會過期的促銷。
🛡 每 Key 獨立控制
每個專案一把 Key、獨立限額,控制台一鍵凍結或刪除。
⑤ 省錢心法
- 保持 system prompt 穩定——快取讀取只有新輸入的 1/10 價格,這是最大的省錢槓桿。
- 從中間檔起步——Sonnet 5 / DeepSeek V4 能扛住大多數正式工作,賬單比旗艦低約 10 倍。
- 重複性任務降檔——分類、抽取、批次處理用 Haiku / Flash 檔,質量損失常常為零。
- 看用量明細——控制台每次呼叫都有 token 級記錄,錢花在哪一目瞭然。
⑥ 術語速查
| 術語 | 通俗含義 |
|---|---|
| API Key | 你的金鑰憑據,請求頭 Authorization: Bearer sk-tp-… |
| Base URL | 填入工具的閘道器地址,如 https://quantoport.com/v1 |
| 上下文視窗 | 模型單次請求可見的最大 token(1M ≈ 整個程式碼庫) |
| SSE / 流式 | 逐 token 輸出,讓對話與 Agent 介面"即時" |
| 工具呼叫 | 模型請求你的程式執行函式——Agent 的基礎 |
| 思考/推理 | 先想後答的模型;更強但每 token 更貴 |