跳到正文
cloudflare blog· Michelle Chen·· 2 小時前精選AI 評分71

推出 Clef:開源決策模型與全新 RL 微調平臺

Introducing Clef: our open-source decision models, and new RL fine-tuning platform

AI 導讀
  • Clef 是 Cloudflare 釋出的開源決策模型,支援影像與文字分類,擁有 64k 上下文視窗,延遲低於 40 ms。
  • Clef‑Flash 為更快版本,平均延遲 38.8 ms,適合即時決策。
  • 模型已上架於 Workers AI,並可在 Hugging Face 下載本地部署;同時提供 RL 微調服務,幫助客戶針對特定領域提升準確度。
推薦理由

本文展示了 Cloudflare 的 Clef 決策模型與 RL 微調平臺,可幫助使用者在邊緣實現低延遲、可定製的分類決策,並支援在 Hugging Face 上本地部署,適合需要快速迭代的企業。

正文 · AI 翻譯

在過去幾週,關於決策模型如 Typesafe AI’s Jev System One 模型的討論熱烈。雖然分類器模型已存在一段時間,Jev 將一種全新的決策模型概念帶入 AI 世界——一種能以低成本、快速且一致產生有界結構化輸出的模型,可在需要決策時加入工作流程。這些模型足以處理任何輸入集合,而無需不斷重新訓練以納入新的分類類別。這與大型語言模型(LLM)世界形成對比,LLM 大多非決定性,但足夠開放以推理、生成文本及工具呼叫,適用於代理工作負載。 

今天,我們發布了兩款由 Cloudflare 訓練的決策模型,Clef 和 Clef-flash,託管於 Workers AI。Clef 目前在對比 Jev Decision Index 時表現最佳,您可在 live benchmark demo site 檢視完整結果。這些模型更聰明、更快,且完全相容 Jev-API,方便您輕鬆試驗這些託管模型。我們已在 Apache 2.0 授權下將這些 models on Hugging Face 完全開源,供您本地執行並自行實驗。 

最後,我們很高興推出全新的強化學習(RL)產品,讓客戶也能針對其使用案例微調 Clef。

什麼是決策模型?

決策模型進行分類以協助代理根據特定機率決定行動。例如,您可以輸入一則客服訊息(輸入),並詢問其是否緊急以及應由哪個團隊處理。決策模型會回傳帶機率的型別答案(輸出),您的程式可利用這些資訊路由工單、觸發升級或交給人工。這意味著對於代理決策,人工不必再始終參與 — 代理可程式化收集上下文、做出決策並執行任務,必要時再交由人工。

在 Cloudflare,我們已在威脅情報團隊測試新 Clef 模型,以協助分類網站域名。將域名交給 Clef(使用 Browser Run)即可快速辨識該域名所屬類別——例如,它可能以 95% 的機率將某域名分類為時尚網站,85% 為電子商務,<1% 為釣魚等。此分類流程,Clef 模型耗時 2.2 秒完成取回、渲染及分類。相比之下,我們最快的通用 LLM gpt-oss-120b 在相同工作流程中耗時 4.7 秒,且僅返回兩項分類。作為使用者,您可以想像 2 倍延遲與結果節省如何協助我們提升威脅情報工作流程,並更快識別惡意或合法域名。將此推廣至任何需要快速程式化決策的使用案例,即可解鎖強大的代理工作流程,能自主決策、推理並執行。

在音樂理論中,譜號是放置在五線譜起始處的符號,用於為線與空格指定特定的音高。決策模型類似於譜號,因為它有助於定義上下文的範疇以及其後續的「音符」(即動作)。我們將 Clef 作為我們決策模型族的名稱,因為它具有相似功能,而 CF 亦呼應 Cloudflare。

Clef 與其他決策模型有何不同?

儘管市場上已越來越多決策模型,Clef 擁有一些獨特特性,使我們對向公眾發布感到興奮。首先,它配備了視覺編碼器,能夠輸入影像並進行視覺內容分類。這與目前僅做文字分類的 Jev 不同。其次,我們的模型擁有 64k 的上下文視窗(相較於 Jev 的 32k),允許使用者為模型提供更多輸入狀態以進行分類。

第三,我們的模型準確且強大,在多項品質基準上與市場上其他決策模型競爭。以下列出了一些對決策重要的評估,這些評估由Jev Decision Index 定義,我們也對市場上一些較受歡迎的模型進行了評分。請查看下錶的基準,或於我們的即時決策指數示範網站 檢視分數:

基準

Clef

Clef-flash

Jev

DiffusionGemma Jev

Kev 9B

Laya

BFCL · case exact

98.47

98.76

95.75

96.52

94.51

38.13

ToolRet · nDCG@10

69.19

66.43

65.28

61.21

64.26

12.69

API-Bank · accuracy

91.93

93.11

88.19

83.66

56.30

11.41

Home appliances · case exact

82.95

97.73

52.27

42.05

25.00

0.00

When2Call · accuracy

72.37

65.58

80.97

75.44

49.62

11.94

BANKING77 · macro-F1

94.20

90.93

79.74

74.28

84.83

14.29

CLINC150+OOS · macro-F1

97.43

66.77

89.27

83.49

79.03

3.19

BRIGHT · nDCG@10

45.91

39.26

47.52

42.94

38.53

19.90

Amazon ESCI · macro-F1

57.48

57.39

55.21

53.37

49.22

24.40

PhishNChips · accuracy

79.60

75.05

62.55

85.35

50.75

50.15

We also ran benchmarks across Typesafe 的自有評估套件 and our Clef models fared well, beating Jev in 3 out of 4 areas. Notably, our Clef-flash performs exceptionally well, given how much faster it is.

工作流程

Clef

Clef-flash

Jev

發票處理

64.7

57.1

61.8

客戶服務

76.3

77

76.0

安全事件

62.9

61.7

61.7

代理追蹤可觀測性

68.5

69.8

71.6

在我們執行的 43 個評估基準中,我們的 Clef 模型在延遲方面優於其他決策模型(除了 Laya,雖然速度很快但在上述基準中犧牲了品質):

基準

Clef

Clef-flash

Jev

DiffusionGemma Jev

Kev-9B

Laya

中位延遲  · ms

209.3

38.8

524.1

84.4

51.4

5.8

p95 延遲 · ms

238.6

122.4

536.0

211.2

187.9

222.5

在模型本身延遲優勢之外,我們的 Clef 模型部署於 Workers AI。由於它們託管在 Cloudflare 的基礎設施上,我們能夠利用邊緣 GPU,降低網路延遲並加速決策。這意味著您可以將 Clef 放入代理決策的熱路徑,並將其與 Workers AI 上的某個 LLM 結合,以執行操作。 


Clef 也能產生嚴格型別化的輸出,類似 Jev,並且完全 API 相容,因此你可以非常輕鬆地進行切換。較大的 Clef 模型是你更強大的精準模型,而 Clef-Flash 模型則適合延遲敏感的決策。這些模型已經企業級可用,我們保證不會閱讀、儲存或在你的請求或回應上進行訓練(除非你想使用我們的微調產品,詳情請參閱下文)。你可以立即開始使用 Clef 模型,從我們的 開發者檔案 開始,或試玩 Hugging Face 倉庫中的開源模型。

如果你想為特定工作負載調整 Clef,我們也提供微調服務——首先作為前線工程師(FDE)團隊的實務夥伴,之後再提供自助微調平臺,讓客戶能夠在 Cloudflare 上訓練並重新部署模型。

我們如何訓練 Clef

在 Jev 釋出的同一週,我們 發布了一些實驗,這些實驗是針對我們自己開發的決策模型。示範說明瞭我們如何將 DiffusionGemma 模型調整為輸出確定性機率,透過公開大型語言模型產生的 logprobs。最初的方法建立在 Matt Mastracci 的獨立研究之上,他在機器學習 (ML) 社群中活躍,分享新概念並 向 vLLM 推送拉取請求以增強 DiffusionGemma 的支援。

Clef 在此概念上進一步發展,但採用不同的基礎模型作為骨幹。我們目前使用 Qwen 作為基礎模型,並進行後續訓練以符合決策模型的使用情境。推理時,Clef 只使用 Qwen 進行 prefill,然後並行評分有效的 schema 選項。決策步驟為非自回歸式,故不會逐字生成中間文字,使 Clef 的速度顯著快於自回歸 LLM。Clef 與 Clef-flash 並非透過生成中間文字產生結構化答案,而是直接從內部骨幹表示中提取 schema 選項。此方法依賴專門的兩階段注意力路由流程:每個有效選項會提取與提示相關的上下文,允許各欄位引數跨欄位注意並回傳至原始 payload,然後再進行評分。藉由利用詞彙先驗,模型能在選項間保持語義意圖。最終,該架構結合了選項特定證據路由、跨欄位聯合注意力以及 schema 限定評分。

我們將 Qwen3.8-27B 固定為 Clef,Qwen3.5-9B 固定為 Clef-flash,並同時最佳化路由頭與 rank‑256 低秩介面卡。我們的後續訓練使用標籤平滑交叉熵來處理有效的 schema 輸出,並結合 Brier 損失以精細調整機率校準。此訓練利用我們自有的內部合成資料集,隨機排列欄位順序、提示與 schema 結構。我們亦開發了「Reinforcement Learning for Calibrated Decisions (RLCD)」作為次要最佳化目標,對相鄰的序數選項給予部分分數,對完全精準的記錄輸出給予獎勵,並施加參考懲罰以防止分佈漂移,從而提升準確度與泛化能力。

這意味著我們能夠在 Clef 上取得幾項新穎成果:提升模型在分類上的準確度,限制其僅輸出機率而非文字生成,並使其速度快於 Jev 及基礎 Qwen 模型。

微調如何擴充套件 Clef 的功能

我們聽到許多內部使用案例,需要將 Clef 模型微調後整合進 Cloudflare 的代理工作流程。例如,內部團隊希望有一個分類模型能評估 Trust & Safety 申請、協助我們分流 Cloudflare 支援請求,甚至嵌入於我們的 Bot 產品中,以判斷爬蟲是好機器人還是壞機器人。

這些使用案例極其具體,我們擁有多年標記決策,可用於訓練專用分類器。微調模型時,可能會犧牲部分通用效能,以換取特定領域的更高準確度。由於 Cloudflare 擁有超過 15 年跨不同領域的網路資料,我們能針對這些具體使用案例微調模型,使其比通用 Clef 模型更準確、更快速。我們已與內部團隊合作,探討如何在微調後訓練 Clef,打造強大的機器學習模型,提升 Cloudflare 的影響力並改善工作流程。這些內部團隊與使用案例將成為新 FDE 微調團隊的下一個任務,也為我們的強化學習(RL)產品奠定基礎。

我們的新 RL 服務

我們提供一項服務,協助客戶與我們的 FDE 團隊親手微調 Clef,以符合其工作負載。藉此,我們將從實務經驗中學習,打造一個自助平臺,讓客戶能在 Cloudflare 上捕捉資料、微調並重新部署模型。

這其實已經等待已久——我們一直在打造 AI 平臺,確保擁有適合的基礎元件,以便開發自訂 RL 產品。對 Jev 的興趣顯示對快速、小型、特定分類模型的需求,我們選擇將其作為起點,開始嘗試 RL 環境。

為此,我們利用已在 Cloudflare 平臺上構建的基礎元件:

  • Cloudflare AI Gateway – 將所有 AI 流量透過 AI Gateway,並自動為您的使用案例建立請求資料集
  • Cloudflare Workers AI – 對基礎 Clef 模型生成回放(rollouts)
  • Cloudflare Containers – 用於評分與重放代理行為的 RL 沙盒
  • [NEW] Trainer – 更新微調 Clef 模型的權重
  • Cloudflare Workers AI + BYO Model – 在 Workers AI 上重新部署微調後的模型

這結合了我們正在進行的 AI 平臺多項工作,包括 AI Gateway 可捕捉您的 AI 流量,讓您利用自己的請求/回應資料;Containers 用於 RL 沙盒;以及自 取得 Replicate 以來持續進行的 Workers AI Bring Your Own Model(Cog)工作。

今天就試試看

我們很高興今天從 Workers AI 團隊推出首個由 Cloudflare 訓練的 ML 模型。雖然我們還處於起步階段,還有許多改進在路上,但這是我們 AI 平臺團隊辛勤工作的精彩首秀。我們相信 Clef 能改變我們使用代理的方式,這自然符合 Cloudflare 成為代理雲的使命。

如果您有具體使用案例並且已經是這些產品的客戶 — 我們很樂意與您聊天,並作為設計合作夥伴一起在此領域進行實驗。

嘗試在 Workers AI 上託管的 Clef 模型,下載 Hugging Face 上的權重 如果您想自行探索,並在有微調使用案例需要協助時聯絡我們。

我們的機器學習團隊在影響力上不斷成長,從模型最佳化到模型訓練研究。若您有興趣加入我們的使命,檢視我們的職缺。 

來源:cloudflare blog · blog.cloudflare.com