Open-weight 模型佔 AI Gateway 56% 代幣量,Astra 兩倍 Fable 5.1 成本
Open-weight models take 56% of token volume, Astra doubles Fable 5.1 spend
Open-weight 模型 在 AI Gateway 8 月份佔據 56% 的代幣量,首次超過所有封閉模型。
- 代幣成本:平均每代幣價格較 5 個月前下降 23.2%,中位團隊每代幣支付 7.6% 更低。
Open-weight models已占據主導,價格下降顯著,Astra快速滲透顯示新模型在企業生產中的高效性。
AI Gateway 生產指數 — 2026年9月
每個月,AI Gateway 在生產應用與 AI 實驗室之間傳輸數兆個 token。這些流量讓我們能觀察今日企業中 AI 使用的實際情況,我們每月在此發布。請參閱 6 月、7 月 與 8 月 的生產指數報告。
2026年9月摘要
9 月指數報告涵蓋截至 2026 年 8 月收集的 AI Gateway 數據。
開放權重模型首次佔據大部分 Gateway token,從 12 月的 7% 上升至 8 月的 56%。
平均 token 價格比五個月前低不到一半。8 月每 token 價格下降 23.2%,為連續第三個月下降,且中位數團隊支付較前低 7.6%。
Anthropic 最強模型 Fable 5 在一個月內失去三分之二的 Gateway 開銷份額。Opus 5 價格為其一半,份額翻三倍。Anthropic 保留了 64% 的總開銷。
Gemini 3 Flash 自 5 月以來已失去 95% 的 Gateway token 份額,且失去的量中超過四分之三流向其他實驗室的模型。
最新指數更新
本月報告涵蓋至 8 月的數據。我們在各版之間加入重要發展。
9 月 17 日:OpenAI 在 9 月 3 日推出 Astra,在兩天內佔 OpenAI 開銷的三分之一,並且是 Fable 5.1 Gateway 開銷份額的兩倍。Astra 在前十二天內佔所有 Gateway 開銷的 7.7%,而 Fable 5.1 在兩天前以相同價格推出,佔 3.7%。
9 月 18 日:Jev 現已成為 AI Gateway 歷史上 採用最快的模型。在首 24 小時內,近 13% 的付費團隊使用它,GPT-5.6 系列的兩倍,Fable 5.1 的六倍以上。
開放權重模型首次佔據大部分 token 量
8 月,開放權重模型在 AI Gateway 上運行 56% 的 token,標誌著首次佔據大部分量。
2025 年 12 月,它們處理的 token 少於十分之一,僅八個月後,它們的 token 量已超過所有封閉權重模型的總和。
雖然 frontier 仍佔大部分開銷,但開放權重的美元份額正在加速。隨著開放權重模型變得更強大,客戶將更多生產工作負載轉移至它們。
開放權重模型採用的增長促使 8 月整個 Gateway 的平均 token 價格下降 23.2%,為連續第三個月下降,也是自 4 月以來最陡峭的。兩個月中運行超過 1,000 萬 token 的團隊中,中位數團隊每 token 支付較前低 7.6%,是 7 月 2.9% 下降的兩倍以上。
團隊現在可以用相同預算獲得更多推論,並僅將 frontier 模型保留給值得付費的任務。
Frontier 走向平穩,因為 Fable 開銷轉向 Opus 5
合理使用 frontier 模型的生產工作負載並不總是需要最昂貴的那一款。它們需要的是足夠好的模型。
Fable 是 Anthropic 售出的最強模型。Opus 是其下層級,token 價格約為 Fable 的一半。當 7 月 1 日美國對 Fable 5 的出口管制解除並恢復存取時,其 Gateway 開銷份額飆升至 13.2%。同月末,Opus 5 上線。
在八月,Fable 5 在閘道支出中的份額降至 4.9%,而 Opus 5 的份額上升至 22.5%。使用 Fable 的團隊中有九成減少使用量,且比其他任何模型更將工作負載轉移至 Opus 5。Fable 的額外功能不值得雙倍價格。
團隊離開了 Anthropic 最昂貴且功能最強大的模型 Fable,但實驗室仍保留了閘道支出的絕大多數,因為這些工作負載降級至 Opus 5,而非轉至其他實驗室。
自十二月以來,Anthropic 每月從 AI 閘道支出中至少拿走 61 美分,八月則為 64 美分。其模型自十二月以來每月在支出排名中持續佔據前兩名,即使佔位模型不斷變換。
客戶忠誠度跟隨模型特性,而非實驗室。
實驗室忠誠度不隨品牌,而是隨模型特性,且一致性能贏得信任。
當新模型保留了前代模型中用戶重視的特性時,實驗室能保留客戶;若未保留,客戶便會轉向其他供應商。
Claude Opus 5 上線時,幾乎獲得了 Fable 損失的兩倍,因為它以一半價格處理相同工作負載。Z.ai 推出 GLM-5.3-Flash 之後五天內,其日交易量已是 GLM-5.2 的三倍。
Google 在新模型上難以留住客戶。由於新產品在功能或價格上未提供相對優勢,Gemini 3 Flash 的大部分工作負載轉移至 OpenAI、Anthropic 與 DeepSeek。
離開 Gemini 3 Flash 的量約一半流向較便宜的模型,主導者為 GPT-5.6 Luna,其每個 token 的成本不到 Gemini 3 Flash 的一半。另一半大部分則轉向更高價位的模型,主導者為 Claude Opus 5 與 Sonnet 5,分別約為 Gemini 3 Flash 的九倍與三倍。
轉向更合適模型的趨勢導致同一時期 Google 的閘道 token 量份額從 30% 降至 5%,其中 Gemini 3 Flash 造成 25 個百分點中 22 個的損失。
特別報告:Astra 在 48 小時內佔據 OpenAI 支出的三分之一,並在上線時以 2:1 的比例超越 Fable 5.1。
GPT-6 Astra 於 9 月 3 日在 AI 閘道上推出,價格與 Fable 5.1 相同,且是 GPT-5.6 Sol 價格的 2.5 倍。兩天後,它佔 OpenAI 模型在閘道上的每三美元支出中就有一美元。其支出份額自此以來保持在 28% 至 39% 之間。
在 OpenAI 的模型組合中,Astra 與 Sol 處理了 27% 的 token,但從 9 月 4 日至 16 日的支出佔比達 71%。Luna 與 Nano 處理的 token 超過兩倍,但支出僅約為其中的 1/9。
Anthropic 於 9 月 1 日推出 Fable 5.1,距 Astra 兩天。在每個模型上線後的前十二天內,Astra 占所有閘道支出的 7.7%,超過 Fable 5.1 的 3.7% 的兩倍,且被兩倍多的團隊使用。
OpenAI 的較便宜模型承載其交易量,而 Astra 在 Fable 之上的早期領先顯示它亦能吸引最高價位的團隊。兩者共同使 OpenAI 能在規模與高端支出上與其他前沿實驗室競爭。
敬請期待下個月的報告。
同樣在八月的數據中
Google 的 Nano Banana 首次在圖像支出上領先,佔 50%,而 GPT Image 為 44%,即使 GPT Image 在生成圖像數量上重新領先,為 46% 對 39%。
Google 的 Veo 在視頻支出上升至第二名,佔 20%,較七月的 15% 上升。Seedance 在生成視頻數量與視頻支出兩項均保持第一。
xAI 的 Grok Imagine 所產生的影片佔比自 6 月以來已腰斬以上,從 42% 降至 31% 再到 19%。
先前的 AI Gateway 生產指數報告
關於本報告
本報告使用截至 2026 年 8 月透過 Vercel AI Gateway 傳輸的匿名化彙整流量數據。
關於測量的幾點說明:
Token 數量包含輸入、輸出、推理、快取輸入與快取建立 Token。
花費是使用各實驗室公佈 定價進行估算;實際帳單可能會有所不同。平均每個 Token 的價格是以估算花費除以 Token 數量計算。
關於流量流向的陳述是比較相同團隊之間的變動。它們不會追蹤模型之間的個別 Token。
開放權重(Open-weight)分類遵循目前的 AI Gateway 模型清單,該清單比早期報告中使用的定義更廣。
所有數據均使用可取得的最新資料;先前的月份可能會隨著方法更新而進行修正。
Source: Vercel Blog · vercel.com