跳到正文
返回模型榜

排名怎麼算

綜合多家公開評測,瞭解排名背後的證據與方法。

0—100

共同的證據,清楚的順序。

綜合多家公開評測,在完整排名中儘量減少與已知成績的衝突。綜合榜和四類榜單都最多展示前 30 名。

共識指數把支援原排名的證據差異換算為 0—100,方便比較,不是正確率或能力差距的百分比。支援接近時可以同分,名次仍由完整證據決定。

  1. 01

    先確認,是同一個模型

    統一各家榜單的名稱和版本。同一模型的不同推理檔位只選一個代表配置,選擇規則預先確定,不挑最高分。匿名測試代號和混用其他模型完成任務的成績排除;已正式公開的 Preview 版本可以參加。

  2. 02

    讓真正測過的模型相互比較

    只比較同一評測中的真實成績。雙方都有公開誤差時,誤差範圍內的微小差異更接近平局,不當成確定勝負。沒有測到,就沒有這一場比較。

  3. 03

    先定票權,再彙總共同意見

    每項評測使用預先確定的預算。綜合榜至少要求三家評測機構、三個證據家族與三個專項覆蓋;同一來源重複抓取或展示切片,不會憑空增加票權。

  4. 04

    尋找衝突最少的完整排名

    不同評測的意見可能衝突。我們選擇違背共同證據淨票權最少的一條順序,再單獨計算展示指數。缺測不補零分,也不猜測未公開的成績。

A BALANCED VIEW

綜合測試、真人盲選、專項評測,一起看。

綜合評測佔 30%,真人盲選佔 10%,各項專項評測合計佔 60%。新增評測先核對公開說明中的重疊關係,再從對應份額中分配;缺失份額不轉給其他評測。

  • 综合评测30%AA Index
  • 真人盲选10%Arena Text · Arena 创作盲选
  • 编程与设计12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · 编程综合
  • 写作与表达9%LiveBench · 语言与指令 · Creative Writing v3 · Longform Writing
  • 数学与推理12%LiveBench · 推理与数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
  • 知识与事实6%SimpleQA Verified · GPQA Diamond
  • 视觉理解6%Arena Vision
  • 工具与办公6%APEX-Agents 1.1 · τ³-Banking
  • 中文与多语言6%AA 中文/多语言
  • 行业专业任务3%Vals Finance Agent

程式設計、推理、知識、專業辦公分別尋找真實評測,分類分獨立計算。視覺理解與多語言證據繼續保留在綜合榜;調整分類名稱不會增加同一份成績的投票權。綜合分不等於分類分的算術平均。分類通常至少有兩項有效評測、五個可比較型號才展示。知識目前由 Epoch 的兩套評測支援,並明確說明同機構的侷限。創作偏好、網頁開發等證據繼續用於綜合榜,首版不單設審美和寫作榜。

你可能還想知道

為什麼有的模型證據較少,也能上榜?
評測數量與能力是兩件事。綜合榜至少需要三家機構與跨能力證據。多數分類要求兩家機構,知識採用同一機構的兩項評測並明確說明。缺測不記零分,但仍可能造成偏差。
“證據敏感”是什麼意思?
刪去一項評測或一家機構、將單項權重上下調整 20%、或改變誤差處理後,名次範圍達到三名或以上、某些情景失去參評資格,或有對照未完成,就會提示證據敏感。詳情頁的情景範圍不是 95% 置信區間,不包含未知成績。
前面的模型一定在兩兩比較中獲勝嗎?
不一定。A 可能勝 B,B 勝 C,C 又勝 A。完整榜單要權衡這些衝突;非相鄰名次可能與單獨比較不同。數學最優表示按當前規則的總衝突最少,不表示已證明所有真實工作中的能力順序。
為什麼排名可能和我的體驗不同?
榜單彙集公開評測,反映這些證據支援的綜合能力。實際體驗還受產品版本、推理檔位、工具環境和長任務穩定性影響。我們會用新評測檢驗舊排名;分數接近時,不應把一兩名之差理解成明顯強弱。
新模型什麼時候會出現?
888news 每天檢查四次上游結果。只有評測方實際釋出了新模型的成績,才能用於排名;網頁重新整理、價格更新或我們的抓取時間,都不算重新評測。
某家榜單暫時打不開,會怎樣?
仍有效的來源快照可繼續使用。相同評測版本內,臨時漏行最多沿用最近七天已核驗的記錄;仍在公開榜中保留的有效成績,不因數值長期不變被刪除。官方撤回、更正、換版會相應失效或替換,不保留歷史最高分。整輪計算失敗時保留上一輪有效榜及原時間。
綜合指數會和專項評測重複計分嗎?
我們根據公開的題庫與方法說明檢查重疊,並限制相關來源的總份額;無法確認的相關性仍是侷限。當前 AA 指數佔 30%;Arena 整體文本與創作專項共享原有 10% 真人偏好份額,各佔 5%。兩項有重疊投票,因此仍算同一個證據家族,不假裝是兩家獨立評測。
價格或速度會影響排名嗎?
都不會。價格只供你瞭解 API 的使用成本,統一按每百萬 Token 展示,並保留廠商官方來源。它不代表訂閱費用。
檢視計算細節與當前版本

方法版本:2026.09-public-consensus-v15。採用加權不完整 Kemeny 排序。每對共同參評模型彙總淨支援 M;目標是最小化所有被排反的淨支援之和。整數最佳化返回最優狀態和目標上下界,只有完整通過驗證的結果才用於正式釋出。

雙方有明確標準誤時,淨支援取 2Φ(分差 / 合成標準誤) − 1,預設零協方差;其他比較只取原始領先方向。未知誤差並非零誤差,小分差按序數處理仍是侷限。票權針對潛在模型對,覆蓋型號多的來源會使用更多比較位置,不能把名義預算解讀為最終名次的精確貢獻率。

展示指數保留原排序:逐對反轉相鄰模型的先後,允許其餘模型重排,計算最少增加的逆向淨支援。沿原排名累加這些非負支援差,再相對固定參照組用 sigmoid 對映到 0—100。替代順序同樣最優時保留零間距,顯示保留一位小數,不人為設定最低分差。指數不參與反向排序;入榜集合、參照型號與證據變化仍會影響指數,分差不等於真實能力距離。同代價求解固定型號 ID 次序;整數最佳化使用 HiGHS 求解器(highs 1.15.3),誤差換算的正態分佈函式與 SciPy norm.cdf 採用同一演算法;來源、協議、參評資格和每輪計算輸入均儲存版本。未連線到共同證據網路時不釋出跨分量的假精確順序。

固定參照型號:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。參照組用於指數尺度,不指定任何廠商應排第幾;不同分類的指數不直接比較。

檢視每一份評測證據 →