跳到正文
cloudflare blog· Michelle Chen·· 2 小時前精選AI 評分72

推出 Clef‑omni 全多模態決策模型,並加速 Clef、降價 Clef‑flash

Introducing Clef-omni with full multimodality, plus a faster Clef and a cheaper Clef-flash

AI 導讀

Clef‑omni 是 Cloudflare 推出的全多模態決策模型,能同時處理音訊、影片、影像與文字。

  • 多模態支援:音訊(wav/mp3)、影片(mp4/webm)與文字、影像可在單一 API 呼叫中完成決策,省去語音轉文字或影像分割的流程。
推薦理由

全新多模態決策模型 Clef‑omni 以單一 API 支援音訊、影像與文字,顯示 Cloudflare 在開源決策模型領域的快速迭代與成本最佳化。

正文 · AI 翻譯

在上週 釋出 Clef 與 Clef-flash 之後,Cloudflare 的開放權重決策模型,我們決定再帶來更多禮物。今天,我們推出 Clef-omni,它能同時接受音訊、影片、文字與影像輸入。我們也把 Clef-flash 的價格降至低於 Jev,並提升了 Clef 的速度。

雖然對 Cloudflare 來說模型領域仍處於早期,但創新與迭代已根植於我們的 DNA,且我們將這些原則應用於一切工作。實際上,Clef 的故事在不到一週的時間內完成。我們決定在星期五傍晚在決策模型領域做些事,週末訓練模型,並於星期四推出。即使時間如此緊湊,我們仍能為社群交付表現優異、品質高、開放權重的模型——想像未來我們還能做到什麼。

今天,我們很高興能以新的增量與改進持續推動 Clef 系列模型的勢頭。這只是起點,我們將持續變得更好、更快、更便宜、更具創新性。

Clef-omni 能接受音訊、影片、影像與文字輸入

我們的新 Clef-omni 模型能接受音訊、影片、影像與文字輸入。這改變了決策模型的範式,自 TypeSafe 推出 Jev 以來,決策模型大多僅以文字為主。使用 Clef 時,我們支援影像與影片畫面陣列,但 Clef-omni 能同時接受音訊(wav 或 mp3)與影片(mp4 或 webm)以及文字與影像。

不必建立串接的模型管線來將語音轉文字,或將影片拆分為音訊與影像通道,你只需呼叫一個模型即可跨任何模態進行決策。我們現在離能以音訊、視覺與文字三種通訊方式一同與世界互動的模型又近了一步。

請參閱我們針對新 Clef-omni 模型的開發者檔案。我們亦在 HuggingFace 上發布了模型 open-weights。快速起步,以下是如何向 Clef-omni 傳送新模態輸入的方式:

Clef-omni 擴充套件了我們的開放權重決策架構,原生支援多模態工作流程。我們以 Qwen3-Omni-30B-A3B-Instruct 混合專家(MoE)為基礎構建,該模型已能在單一管線中直接處理文字、影像、音訊與影片。但我們採用主要的理解骨幹,並移除文字轉語音的輸出元件。在實際運作中,Clef-omni 會對完整負載執行快速預填階段,同時評分所有模態與有效引數選項。

由於 Clef 模型不是大型語言模型(LLM),我們跳過輸出 token 的產生,從而消除對進入檔案進行語音轉文字或字幕的開銷。媒體元素直接對映到統一序列,影片與音訊與視覺畫面同步以進行聯合處理。Clef-omni 接著利用兩階段注意力路由,直接從內部嵌入中提取候選值:每個有效選項都會從輸入中收集關鍵證據(無論它們隱藏於文字片段、視覺元素或音訊流中),再由欄位向量跨注意於整個上下文以計算信心分數。我們加入內建詞彙語法以保留選項語義,從而能在每種型別輸入上提供快速、受架構限制的評分。

我們使用與 Clef 相同的技術訓練模型——凍結 Qwen3 主幹,訓練低秩介面卡 (LoRA),並採用我們標準的後訓練方法:結合標籤平滑交叉熵損失與 Brier 分數校準。結果是一個具有韌性、設計上能在任何模式變化、欄位順序和提示結構下成功的模型。

這為 Clef 模型系列帶來多項核心升級。已校準、受模式約束的決策現在可在單一 API 呼叫中無縫處理文字、圖片、音訊以及同步影片。速度亦快。純文字決策中位數回應時間約 130 毫秒,影像輸入約 150 毫秒,音訊片段則需幾百毫秒。即使是完整的 21 秒帶音影片也能在約 1.5 秒內完成評分,全部在一次 API 呼叫中完成。

我們的基準測試顯示,即使加入新模態和 MoE 架構,模型在各項基準上仍表現強勁。

基準測試

Clef-omni

Clef

Clef-flash

Jev

BFCL · case exact

98.2

98.47

98.76

95.75

ToolRet · nDCG@10

66.6

69.19

66.43

65.28

API-Bank · accuracy

92.7

91.93

93.11

88.19

Home appliances · case exact

69.3

82.95

97.73

52.27

When2Call · accuracy

63.3

72.37

65.58

80.97

BANKING77 · macro-F1

94.8

94.20

90.93

79.74

CLINC150+OOS · macro-F1

97.7

97.43

66.77

89.27

BRIGHT · nDCG@10

42.0

45.91

39.26

47.52

Amazon ESCI · macro-F1

57.8

57.48

57.39

55.21

PhishNChips · accuracy

73.2

79.60

75.05

62.55

我們也針對 TypeSafe evals 進行基準測試,以展示 Clef-omni 的表現。

工作流程

指標

Clef-Omni

Clef

Clef-flash

Jev

Invoice processing

Exact actions

60.2

64.7

57.1

61.8

Invoice processing

Primary action

82.0

86.2

73.3

83.1

Customer service

Exact actions

71.6

76.3

77.0

76.0

Security incidents

Exact actions

61.7

62.9

61.7

61.7

Agent trace observability

Primary action

65.8

68.5

69.8

71.6

Clef-flash 模型現在更便宜

我們聽取了您的回饋——您希望有一個足夠經濟實惠的決策模型,能整合進任何工作流程。我們進行了一些最佳化,現在可以以更低價格提供 Clef-flash。我們希望 Clef 能在所有代理工作流程中擴充套件決策能力,現在的定價也鼓勵這一點。

我們已將模型最佳化至 Clef-flash 現在 更便宜 於 Jev,同時保持高效與高品質。請隨時檢視 developer docs 以取得最新定價資訊,包括影像與音訊模態如何轉換為輸入 token 以計費的更多細節。

  • Clef-flash – 原本每 1M 輸入 token $0.09,現在 $0.038 per M input tokens
  • Clef – 仍為 $0.24 per M input tokens
  • Clef-omni – 今日啟動,價格為 $0.15 per M input tokens

然而,為了實現更低價格,我們必須削減 Clef-flash 的上下文視窗。Clef-flash 的託管版本現在的上下文視窗為 24k,取代先前宣稱的 64k。Hugging Face 上的模型權重未被改動,且已訓練以支援 256k 的上下文視窗,若您選擇自行託管。

根據使用資料,我們發現僅 0.24% 的請求超過 24k 輸入 token。基於此,我們決定將 Clef-flash 的上下文視窗降至 24k,以提供更易於接受的入門價格。Clef 模型仍維持 64k 的上下文視窗,並鼓勵需要更大上下文的使用者改用 Clef 而非 Clef-flash。

Clef 模型現在更快

速度也更快,Clef 模型在 Workers AI 上的託管版本已進行新最佳化。由於我們所做的大部分最佳化都在服務基礎設施層面,而非模型權重或架構,並未釋出新的模型權重。以下是我們的新速度:

輸入大小

之前:中位數 / 95% 分位數 (毫秒)

現在:中位數 / 95% 分位數 (毫秒)

中位數加速

≈800 tokens

262 / 438

152 / 351

1.7×

≈3,400 tokens

616 / 777

305 / 531

2.0×

≈16,000 tokens

2,721 / 3,250

1,635 / 1,805

1.7×

我們的一項最佳化是將服務模型移至 SGLang。我們與 SGLang 團隊合作,並提交拉取請求以整合 Clef(PR #42721),該功能將在 SGLang 0.5.22 釋出。您也可以自行託管 Clef,因為我們已釋出權重,新 SGLang 啟動指令可在我們的 updated Hugging Face repo 以及 SGLang cookbooks 找到。

人們如何使用 Clef?

在 Cloudflare,我們已經有團隊嘗試使用 Clef 作為能夠分類一般領域的模型。觀察團隊採用 Clef 最酷的地方在於檢測與分類的能力已進入模型層級,任何人都可以開始將決策模型納入其使用案例。以前,即使是零樣本分類器,小型模型也可能無法在任何領域上進行分類,除非進一步調整。您可能需要組建專門的機器學習團隊來協助在特定領域上訓練,並收集資料語料庫以訓練更好的模型。現在,您只需呼叫模型,即可即時精確解析輸入資料。

以下是 Cloudflare 團隊使用 Clef 的幾個亮點:我們的公開 GitHub 文件倉庫使用 Clef 立即 detect and close spam issues。EmDash,我們的內容管理系統,moderates plugin libraries for phishing。我們的資料遺失防護團隊正在掃描資料以尋找潛在的個人身份識別資訊(PII),如政府身份證。以及我們的威脅情報團隊正在使用 Clef 幫助偵測惡意網域。

試試看!

我們很高興為您帶來 Clef 系列模型的更多功能,包括音訊和影片等新模態,以及以更低價格和更快速度提升模型可存取性。Clef 完全符合 Jev-API,並可透過 AI Gateway 取得,您只需改變模型 ID 就能立即試用 Clef。檢視我們的 developer docs 以獲取更多資訊。

感謝您對 Cloudflare 首批模型的熱愛與熱烈回應——我們正專注於為您帶來更多。試用我們的 Clef 系列模型,並告訴我們您的想法。

來源:cloudflare blog · blog.cloudflare.com