2026/10 全球 LLM Token Plan 深度比較報告

Token Plan 深度比較報告

資料基準日:2026-10-04|時區:Asia/Taipei|幣別:USD / CNY

2026 年的 Coding AI 市場已明顯分成四層:模型原廠訂閱(Claude Code、Codex、Kimi、GLM、MiniMax)、多模型 Coding/Token Plan(火山方舟、阿里百煉、百度千帆)、AI IDE(Cursor、Copilot、JetBrains、Kiro、TRAE、Qoder、CodeBuddy、Windsurf/Devin),以及 provider-neutral agent harness/gateway(Cline、OpenRouter、Qwen Code、Hermes)。中國市場尤其已不是「廉價 API」而已,而是形成很成熟的固定月費 → 專用 API key → Claude Code/OpenCode/Cline/Hermes 的供應鏈。

我的主要判斷如下。

第一,純「訂閱含量」的性價比冠軍,目前更偏向中國 Token/Coding Plan,而不是美系 $20 plan。 MiniMax 現行 Plus/Max/Ultra 為 $20/$50/$120,官方直接給出約 1.7B/5.1B/12.5B M3-equivalent monthly tokens,Ultra 還標示約 6–7 個 Agent concurrency;這種透明程度非常適合 Hermes。

第二,Frontier-quality 層仍應保留 OpenAI 或 Anthropic,而不是把所有 Coding 都換成低價模型。 OpenAI 現行 GPT-6.1 Sol API 是 $2/$10 per MTok input/output;Claude Sonnet 5 同樣是 $2/$10,Opus 5 為 $5/$25。因此難題規劃、architecture、final review 與高風險 refactor 仍值得升級模型,但讓它們承擔每一次 repo search/test loop 非常昂貴。

第三,中國方案最大風險不是 nominal quota,而是 429、TPS 與「名義 request ≠ 實際 agent workload」。 awesome-coding-plan 的實測資料顯示火山、MiniMax、百煉、Kimi、GLM 的實際 throughput 差異很大;中國 Linux.DO 使用者也反覆回報火山與 GLM 在某些時段會出現 429、retry、速度下降。這些是社群樣本而非 SLA,但對 Heavy Agent 比「每月幾萬 requests」更有意義。

第四,對 Heavy Hermes,我不建議單押 Claude Max 20x、Codex Pro、Cursor Ultra 任何一個方案。 更好的 architecture 是:

高容量 Token Plan 做 worker + 一家 frontier subscription 做 planner/reviewer + 第二家 PAYG frontier 做 failover + local model 處理低價值工作。

在本文的基準模擬中,6-Agent Hermes 若完全 PAYG,frontier-heavy 模型組合約要 $2,205/月;將 80% 工作路由到 MiniMax M3 類廉價 worker 後,同一合成 workload 約降到 $328/月。而若能實際吃到 MiniMax Ultra 的 subscription quota,再搭配 Claude Max 5x 或 Codex Pro 作升級層,預算可以進一步落到約 $220–320/月級別,但前提是經過實測確認 5h/week throttling、context multiplier 與 6-agent concurrency。這是模型化估算,不是廠商保證。

另一個重要修正:Anthropic 曾宣布要把 claude -p / Agent SDK 與 subscription quota 拆開,但截至目前官方支援文件表示該變更已暫停,Agent SDK、claude -p 與第三方使用仍會消耗訂閱額度;因此不能把 Max $100/$200 理解為「interactive quota + 額外同額 SDK credit」。

市場地圖與比較方法

2026 AI Coding Supply Chain模型原廠 SubscriptionMulti-model Coding / Token PlanAI IDE / Coding ProductAgent Harness / GatewayOpenAI CodexClaude CodeGLM Coding PlanKimi CodeMiniMax Token Plan火山引擎方舟阿里百煉百度千帆OpenRouterNVIDIA NIMCursorGitHub CopilotJetBrainsKiro / Amazon QTRAEQoderCodeBuddyWindsurf / DevinReplit / ZedClineQwen CodeOpenCodeHermesOpenAI / Claude / Gemini / GrokQwen / GLM / Kimi / DeepSeek / MiMo / MiniMax顯示程式碼

最容易造成誤判的是把四種類型混成一張「$20 plan」榜單。例如 Cline 本身是 harness,ClinePass 才是 $9.99 subscription;OpenRouter 本質是 PAYG gateway;Qwen Code 是 Agent frontend,而百煉 Coding Plan 才是 inference subscription;NVIDIA NIM 則提供開發用途 free serverless endpoint 與 self-host deployment,與 Claude Pro 不是同一種商品。

為了讓後面的「US$100 有效容量」不完全失真,我定義一個 Equivalent Agent Hour,EAH:

1\ EAH = 8\ model\ calls \times (50K\ input + 8K\ output)

也就是:

1\ EAH=400K\ input+64K\ output=464K\ tokens

這不是宣稱一個真人小時必然使用 464K token,而是一個方便跨 API、subscription、agent loop 做同尺度比較的分析單位。大型 repo、MCP、tool descriptions、重新讀 context 都會把它往上拉;prompt caching、RAG/repo map 則會向下壓。

本文人民幣換美元統一採 分析匯率 ¥7.1 = US$1,只是為了 normalized comparison,不是匯率預測。

全球與中國 Coding Plan 訂閱比較

下表中的「—」代表沒有可比的固定 subscription、未公開固定值,或該欄不適用。BYOK ✅ 表示可以真正自帶 provider/model key;◐ 表示只能在部分功能、協定或特定 provider 上使用。

Provider / Plan月費/年費重點Quota / Overage並行 / BYOK2026 判讀
OpenAI Codex / ChatGPTPlus $20;Pro 自 $100 起,Codex 文件明列 $100/$200 Pro capacityLocal + cloud 共用 allowance;依模型計次,另可能有 weekly limit;可買 creditsMulti-agent;◐ API/CLIGPT-6/6.1 世代後,quota 必須按模型看,不能只看「messages」
Anthropic Claude CodePro $20,年繳 $200;Max 5x $100、20x $200rolling 5h + weekly;超額 usage credits 按 API ratesubagents;◐ Console API所有 Claude/Code activity 共 pool;SDK quota 分拆計畫目前暫停
Google GeminiConsumer AI plan 為地區化 subscription;Coding 更適合以 Gemini API/CLI 衡量API PAYG;Managed Agents/CLI 另有 quota✅ API/Vertex2026-09 Gemini 3.8 Flash 強化 software engineering / agentic work
xAI Grok無獨立「Coding Plan」可與 Claude Code 直接等同比較API PAYG✅Grok 4.7 主打 500K context 與 coding/agent workload
MiniMax Token Plan$20/$50/$120;年繳約 $180/$450/$1,080約 1.7B/5.1B/12.5B M3 tokens/mo;5h + weekly + RPM/TPM;不 rollover3–4 / 4–5 / 6–7 agents;✅目前最適合用來做 Hermes 高容量 worker pool 的方案之一
Cline / ClinePassCline OSS $0;Pass $9.99/mo官方描述為 API rate 的約 2–5x usage,但不公布簡單固定 token ceiling✅ 極強優點是 provider-neutral;缺點是 quota 不透明
OpenRouter無固定個人訂閱;PAYGStandard credit purchase fee 5.5%;BYOK 前 $25K list-price inference/月免 BYOK fee,之後 5%✅最適合作為 failover/routing layer,而非靠 subscription 套利
CursorPro $20;Pro+ $60;Ultra $200included model usage + on-demand overage◐ BYOK價值主要在 IDE/context/indexing,不是 raw-token 最便宜
GitHub CopilotPro $10;Pro+ $39;Max $100約 $15/$70/$200 total AI Credits;可加購非 generic BYOKGitHub/PR/IDE workflow 強,但 expensive model 會快速吃 credits
JetBrains AI / JunieAI Pro 月繳約 $10、年繳折算 $8.33/mo;Ultimate 約 $30 / $25/mo10 / 35 AI credits/30d;可 top-up✅ BYOK/local對既有 JetBrains + local model 使用者特別合理
ZedPro $10/mo含 $5 hosted-token credit;超額約 API list +10%✅很適合把 editor 與 inference 解耦
ReplitCore 約 $20;Pro 約 $100subscription allowance + PAYG◐優勢在 code→deploy→DB 全生命週期,而非純 repo agent
Windsurf / Devin2026 產品線持續整合;Pro 級約 $20、heavy tier 約 $200daily/weekly/model budget—更接近 IDE + cloud-agent command center;quota 應逐月驗證
Amazon Q / KiroQ Developer Pro 約 $19;Kiro $20/$40/$100/$200Kiro 1K/2K/5K/10K credits;overage $0.04/credit—新 workflow 應優先評估 Kiro,而非只看舊 Q IDE 模式
火山引擎方舟Lite 約 ¥40、Pro 約 ¥200;活動價可低至 ¥9.9 起Lite 約 1,200/5h、9K/wk、18K/mo;Pro 約 5x多模型;非 generic BYOKDeepSeek/GLM/Kimi/Doubao/MiniMax 一 key,多 Agent 很有吸引力;實際 token multiplier/TPS 更重要
智譜 GLM Coding Plan現行定價已從舊 ¥49/149 架構轉向新方案/points;Z.ai 已導入 GLM-5.3points-based,input/cache/output 分別扣點GLM ecosystem任何仍引用「¥49 Lite / ¥149 Pro」的比較表都應視為歷史 snapshot
Qwen / 阿里百煉現行 Pro ¥200/mo;首月活動可 ¥39.9;舊 Lite 已停售6K/5h、45K/week、90K/month;複雜問題約 10–30+ calls多模型 endpoint;Hermes 支援Quota 規則目前是中國方案中相對透明的一家
百度千帆 Token PlanMini/Lite/Pro/Max ¥9.9/40/200/600;有首購折扣1.4K/6.6K/45K/165K points/moOpenAI/Anthropic-compatible2026 已由舊 Coding Plan 轉向 Token Plan,官方稱取消舊三層限流
騰訊 CodeBuddy最近公開方案約 ¥99 / ¥199 / ¥999 級credits + autocomplete/agent tasksmanaged models本輪官方 pricing 頁抓取逾時,故不納入定量排名,購買前應重新核帳號內價格
Kimi Code¥49/99/199/699;年繳有折扣Code 有 rolling 5h + weekly;另有 shared Agent credits / Extra UsageAgent:1/2/2/4;Swarm:0/2/4/8K2.7 Code 2026-09 更新後降低 thinking-token 消耗
DeepSeek無需用 subscription 才有價值;主力為 PAYG API2026-08-17 起 V4 系列導入 peak/off-peak 動態價格✅V4-Pro launch reference 為 $1.32/$3.96 MTok,但現行實際價格須按時段看
Xiaomi MiMo約 $6/$16/$50/$100;年繳折算約 $5.28/$14.08/$44/$88credit-based;官方主打無 5h/weekly cap;離峰有較低 multiplierHermes/Cline/Qwen Code 等很值得納入 6-agent burn-in test,但 credits→有效 tokens 要自行量測
NVIDIA NIMDeveloper serverless endpoints 免費;production/self-host 另計free endpoint 無 production SLA✅ self-hostNVIDIA 現行 catalog 已有 Kimi K3、DeepSeek V4、Nemotron,並直接提供 NemoClaw for Hermes Agent
TRAE官方已有 Pricing 入口,但動態頁面未提供本輪可重現完整 quotamanaged plan◐應視為 AI IDE,不應與 raw token plan 直接比價格;本文不猜測未核實 quota
Qoder官方採 credit metering;近期 snapshot 約 Pro $20 / 2K creditscredits;Quest/IDE/CLI 共 ecosystem◐ 可接百煉官方已確認 Desktop/CLI/JetBrains 與 Model Studio integration;價格變動較快

這張表也解釋了為何 awesome-coding-plan 很有價值卻不能直接當最新 price sheet:它保存了極有價值的 TPS、實測 token、429 與歷史 plan 資料,但 GLM、百煉、MiniMax 等方案在 2026 中後段都已調整。正式採購時應採「官方頁決定價格/規則,community benchmark 決定是否真的好用」的雙層方法。

API Token 成本與每 US$100 有效容量

最值得放進 Hermes router 的現行 API 價格如下。價格均為每 1M token;人民幣模型換算美元僅使用本文固定分析匯率。

模型InputOutput基準 EAH 成本US$100 可買 EAH
OpenAI GPT-6 Astra$10$50$7.2013.9
OpenAI GPT-6.1 Sol$2$10$1.4469.4
OpenAI GPT-6 Luna$0.10$0.50$0.0721,389
Claude Sonnet 5$2$10$1.4469.4
Claude Opus 5$5$25$3.6027.8
Gemini 3.8 Flash$0.75$3.75$0.54185
xAI Grok 4.7$2$6$1.18484.5
MiniMax M3約 $0.30約 $1.20約 $0.197508
Kimi K2.7 Code¥6.5 ≈ $0.92¥27 ≈ $3.80≈ $0.610164
DeepSeek V4-Pro$1.32*$3.96*$0.781*128*

OpenAI 現行官方頁列 GPT-6 Astra $10/$50、GPT-6.1 Sol $2/$10、GPT-6 Luna $0.10/$0.50;Anthropic 現行 Sonnet 5 為 $2/$10、Opus 5 為 $5/$25。 Google 2026-09 推出的 Gemini 3.8 Flash 定價為 $0.75/$3.75。 xAI Grok 4.7 則為 $2/$6。

* DeepSeek 的數字是 V4-Pro 發表時的 reference rate;8 月中之後已導入 peak/off-peak variable pricing,所以不能把 $1.32/$3.96 當成全天固定長期價格。

基準 workload:US$100 可購買的 API EAHOpus5SolSonnet5Grok4.7DS-V4*KimiGemini3.8FMiniMaxM3Luna140013001200110010009008007006005004003002001000EAH / US$100顯示程式碼

這張圖絕對不能解讀成「Luna 比 Opus 強 50 倍」。 它只量「raw agent work capacity」,沒有 capability adjustment。最佳 Hermes architecture 的目標正是利用這個差距:讓 Luna/MiniMax/Gemini Flash/DeepSeek 類模型做搜尋、boilerplate、test loop、分類、摘要,把 Opus/Sonnet/Sol 留給真正需要 reasoning 的節點。

對 subscription 再做一次 normalized proxy,可以看到更驚人的差距。以下不是 SLA,而是「官方 advertised token ceiling」或 awesome-coding-plan 社群實測 token extrapolation:

Plan資料類型月容量 proxy換算 US$100 的 EAH信心
MiniMax Plus $20官方 advertised1.7B M3-equivalent tokens~18,300 EAH中高;仍受 5h/week/concurrency 限制
Claude Pro $20community measurement~1.588B tokens/mo extrapolated~17,100 EAH低~中;quota 非官方固定值
阿里百煉 Pro ¥200官方 calls90K calls/mo~15,975 EAH*中;假設 20 calls/EAH
火山 Lite ¥40community measurement~320M tokens/mo~12,200 EAH低~中;模型倍率會變
Kimi Allegretto ¥199community measurement~1.428B/mo~11,000 EAH低;受 429/weekly window
Codex Plus $20community measurement~616M/mo~6,640 EAH低~中;模型與 quota 可變

社群 benchmark 的 Claude、Codex、火山、Kimi、MiniMax 等 token extrapolation 均來自 awesome-coding-plan,所以應拿來做「候選方案篩選」,而不是採購保證。 阿里則是官方直接公布 90K monthly calls,但官方同時提醒一個簡單問題可能消耗 5–10 calls、複雜問題 10–30+,因此我用 20 calls/EAH 只是模型假設。

換句話說,subscription plan 的理論 $/token 可以比 API 低一個甚至兩個數量級,但你真正購買的是「受 rate limit 控制的共享 inference capacity」,不是一桶可任意瞬間抽乾的 tokens。

真實使用者評價、TPS、429 與穩定性

目前最有價值的非官方資料不是「哪個模型回答比較聰明」,而是 TPS、429、retry 與實際能燒多少 token。

awesome-coding-plan 的測試 snapshot 中,火山方案觀察到約 86.6 TPS、MiniMax 約 52.6 TPS、舊百煉測試約 52.5 TPS;Kimi 約 28 TPS,GLM 某測試約 26.8 TPS。repo 同時特別強調:「429 往往比名義 quota 更重要」,並記錄 Kimi/GLM 在某些週期的 capacity、429 或循環問題。這些數字受模型版本、地點、時段、prompt 與 provider routing 影響,不能當 universal benchmark。

中文社群對火山的評價尤其能說明為何「18000 requests/月」不足以判斷價值。2026 年 4 月 Linux.DO 有使用者回報 GLM route 慢、retry、429,以及 Lite 5h 額度比表面 request count 更快消耗;到 6 月也有使用者回報模型倍率改善、體感可得到約數億 tokens。也就是說,同一產品會因模型 multiplier、促銷與 capacity provisioning 在幾個月內大幅變化。

GLM 也有很明顯的「版本斷代」問題。2026 年 5 月的中文社群整理仍記錄 ¥49/149/469 舊式 prompts quota,但 GLM-5.3 發布後官方已改成 points-based quota,input、cached input、output 分別計點。因此目前看到舊版「GLM Pro ¥149、每週約 2,000 prompts」時,不應再視為最新正式方案。

ClinePass 的早期 Reddit 評價則呈現典型「opaque quota」問題:有人回報不到兩天消耗掉 98% weekly quota;另一位使用 GLM 的案例則宣稱一個 5h session 得到約 61M tokens。兩者可以同時成立,因為模型、context、cache、reasoning 與計費權重可能完全不同;因此「generous limits」不等於可預測。

Claude/Codex 的使用者比較也類似。近期 Claude Code Reddit 有 $20→$100 使用者討論 context/thinking throttling 的不可預測性,也有使用者長時間並行比較 Claude Code 與 Codex 後認為兩者在 agent behavior、effort 與 quota 體感上不同。這些是自選樣本,不能用來證明官方偷偷減量,但足以說明 subscription 的「有效容量」不應只看 5x/20x。

至於 Hacker News,本輪檢索沒有取得足夠新鮮且能量化 2026 plan quota/TPS 的 thread,因此我沒有為了滿足來源數而把舊 HN 意見硬塞進數值模型。本文的 community quantitative layer 主要採 GitHub、Reddit 與 Linux.DO;價格與 quota 則仍以官方來源優先。

使用情境成本、Hermes 架構與驗證建議

成本模型採每月 22 個工作日。Light = 1h/day、單 Agent;Daily Professional = 4h/day,為反映偶爾 background agent,我假設平均 1.5 effective agents;Heavy Hermes = 8h/day × 6 agents。基準 EAH 是前述 400K input + 64K output。

ProfileEffective Agent-hours/月InputOutputTotal tokens
Light228.8M1.408M10.2M
Daily Professional13252.8M8.45M61.25M
Heavy Hermes1,056422.4M67.58M489.98M

我再設三種 model mix:

Frontier-heavy = 70% Sonnet 5 + 30% Opus 5;
Balanced = 70% Gemini 3.8 Flash + 20% Sonnet 5 + 10% Opus 5;
Cost-optimized = 80% MiniMax M3 + 15% Gemini Flash + 5% Sonnet 5。

價格基礎取自 Anthropic、Google、MiniMax 的現行價格資訊。

ProfileFrontier-heavyBalancedCost-optimized
Light$45.94$22.57$6.83
Daily Professional$275.62$135.43$40.98
Heavy Hermes$2,204.93$1,083.46$327.82

這回答了最重要的一個問題:multi-agent architecture 最有價值的成本優化不是 prompt 少寫幾個字,而是 model routing。 Heavy workload 只要把 frontier 比例從 100% 降到 20% 以下,就可能把 inference bill 從四位數美元壓到數百美元。

Context sensitivity 更關鍵。若每 agent-hour 都有 8 turns:

Context 假設Tokens / Agent-hourHeavy FrontierHeavy BalancedHeavy Cost-optimized
Small:20K in / 5K out200K$1,102$542$162
Base:50K / 8K464K$2,205$1,083$328
Large Repo:150K / 12K1.296M$5,145$2,528$778

所以大型 repo 的真正殺手是:

\text{Agents} \times \text{Turns} \times \text{Repeated Context}

而不是單次 output token。

這也解釋為何 prompt caching、repo map、symbol-level retrieval、context compaction、分離 planner/worker、避免六個 Agent 各自重讀整個 repository,可能比換一家便宜 20% 的 provider 更重要。

我會為 Hermes 採用以下 routing:

搜尋、分類、測試、boilerplateFeature / RefactorArchitecture / Hard bugYesNoHermes Task Router工作難度 / 風險Low-cost Worker PoolMiniMax M3Gemini FlashDeepSeek / MiMoQwen / Local LLMPrimary Coding ModelGPT-6.1 Sol / CodexClaude Sonnet 5Kimi / GLMFrontier EscalationClaude OpusOpenAI Astra / high reasoningTests + Static AnalysisPass?Frontier Review GateMerge / PRProvider GatewayMiniMax Token Plan阿里百煉 / 火山OpenRouter fallbackDirect API顯示程式碼

對你指定的 8h/day、6 Agents、large repo 情境,我的首選不是 $200 Claude Max 20x 單押,而是:

Layer建議原因
High-volume workerMiniMax Ultra $120 優先實測官方 nominal 12.5B M3-equivalent tokens、6–7 agent concurrency,規格與 Hermes 很吻合
Frontier coding/reviewClaude Max 5x $100 或 Codex Pro 起跳 tier,先選一個避免同時支付兩個昂貴 subscription;另一家用 API failover
中國 multi-model backup百煉 Pro ¥200 優先於盲買多家6K/5h、45K/week、90K/month 規則清楚,且一 key 可跨 Qwen/Kimi/GLM/MiniMax 等
Gateway/failoverOpenRouter500+ models、自動 provider routing;不應當主要 subscription 套利層
Agent HarnessHermes / Cline / Qwen Code把模型與 Agent runtime 解耦,才能隨 quota/價格切 provider
Localrepo search、classification、summary、test triage不值得讓 frontier API 重複付 context tax

因此我會把 Heavy Hermes 起始採購組合設在約:

MiniMax Ultra $120 + Claude Max 5x $100 ≈ $220/月

再保留 $50–100 PAYG emergency budget 給 OpenAI/OpenRouter/其他 provider,形成約 $270–320/月 的實驗性 production budget。

若實測發現 MiniMax 在六 Agent 下因 rolling quota/TPM 不能維持吞吐,就把 worker capacity 分散成:

MiniMax Max/Ultra + 百煉 Pro + MiMo/DeepSeek PAYG

而不是直接升到更多昂貴 frontier subscription。

最後,真正決定採購前應做一個 7 天 Hermes Provider Bake-off,而不是繼續看 marketing quota:

Test固定條件要記錄的 KPI
Repo benchmark同一組 20 個真實 issueaccepted patch rate、human rework
Context test20K / 50K / 150K inputinput/cache/output tokens、$/task
Parallel test1 / 3 / 6 agentsTPS、TTFT、429、retry、成功率
Quota test連跑 >5h + 跨 weekly reset真正 cutoff、reset 行為、模型 multiplier
Failover故意觸發 provider 429recovery time、context loss
Quality gate同一 frontier reviewerbugs caught、tests passed、review rejection
最終 KPI所有資料$/accepted patch 與 successful agent-hours/$100

這比「每月 token 數」更接近真正的商業指標。最終你應該優化的不是:

\boxed{\text{Cheapest Token}}

而是:

\boxed{ \frac{\text{成功完成且通過 Review 的 Coding Tasks}} {\text{總月費 + API Cost + Retry Cost + Human Rework}} }

截至 2026-10-04,我會把市場排序理解為:MiniMax / 百煉 / 火山 / MiMo 是 capacity layer;OpenAI / Anthropic 是 intelligence & review layer;OpenRouter / Cline / Qwen Code / Hermes 是 abstraction & routing layer;Cursor / Copilot / JetBrains / Kiro / Qoder / TRAE / CodeBuddy 則主要競爭 developer experience。

這四層分開採購,通常比尋找一個「全能 Coding Plan」更適合真正的 multi-agent software engineering。


探索更多來自 大衛的觀察日記 的內容

訂閱即可透過電子郵件收到最新文章。

發表迴響