排名怎麼算
綜合多家公開評測,瞭解排名背後的證據與方法。
0—100
共同的證據,清楚的順序。
綜合多家公開評測,在完整排名中儘量減少與已知成績的衝突。綜合榜和四類榜單都最多展示前 30 名。
共識指數把支援原排名的證據差異換算為 0—100,方便比較,不是正確率或能力差距的百分比。支援接近時可以同分,名次仍由完整證據決定。
- 01
先確認,是同一個模型
統一各家榜單的名稱和版本。同一模型的不同推理檔位只選一個代表配置,選擇規則預先確定,不挑最高分。匿名測試代號和混用其他模型完成任務的成績排除;已正式公開的 Preview 版本可以參加。
- 02
讓真正測過的模型相互比較
只比較同一評測中的真實成績。雙方都有公開誤差時,誤差範圍內的微小差異更接近平局,不當成確定勝負。沒有測到,就沒有這一場比較。
- 03
先定票權,再彙總共同意見
每項評測使用預先確定的預算。綜合榜至少要求三家評測機構、三個證據家族與三個專項覆蓋;同一來源重複抓取或展示切片,不會憑空增加票權。
- 04
尋找衝突最少的完整排名
不同評測的意見可能衝突。我們選擇違背共同證據淨票權最少的一條順序,再單獨計算展示指數。缺測不補零分,也不猜測未公開的成績。
綜合測試、真人盲選、專項評測,一起看。
綜合評測佔 30%,真人盲選佔 10%,各項專項評測合計佔 60%。新增評測先核對公開說明中的重疊關係,再從對應份額中分配;缺失份額不轉給其他評測。
- 综合评测30%AA Index
- 真人盲选10%Arena Text · Arena 创作盲选
- 编程与设计12%Arena WebDev · DeepSWE v1.1 · TapTap Maker · LiveBench · 编程综合
- 写作与表达9%LiveBench · 语言与指令 · Creative Writing v3 · Longform Writing
- 数学与推理12%LiveBench · 推理与数学 · FrontierMath v2 · Tiers 1–3 · FrontierMath v2 · Tier 4 · Chess Puzzles · Mystery Game Puzzles
- 知识与事实6%SimpleQA Verified · GPQA Diamond
- 视觉理解6%Arena Vision
- 工具与办公6%APEX-Agents 1.1 · τ³-Banking
- 中文与多语言6%AA 中文/多语言
- 行业专业任务3%Vals Finance Agent
程式設計、推理、知識、專業辦公分別尋找真實評測,分類分獨立計算。視覺理解與多語言證據繼續保留在綜合榜;調整分類名稱不會增加同一份成績的投票權。綜合分不等於分類分的算術平均。分類通常至少有兩項有效評測、五個可比較型號才展示。知識目前由 Epoch 的兩套評測支援,並明確說明同機構的侷限。創作偏好、網頁開發等證據繼續用於綜合榜,首版不單設審美和寫作榜。
你可能還想知道
為什麼有的模型證據較少,也能上榜?
“證據敏感”是什麼意思?
前面的模型一定在兩兩比較中獲勝嗎?
為什麼排名可能和我的體驗不同?
新模型什麼時候會出現?
某家榜單暫時打不開,會怎樣?
綜合指數會和專項評測重複計分嗎?
價格或速度會影響排名嗎?
檢視計算細節與當前版本
方法版本:2026.09-public-consensus-v15。採用加權不完整 Kemeny 排序。每對共同參評模型彙總淨支援 M;目標是最小化所有被排反的淨支援之和。整數最佳化返回最優狀態和目標上下界,只有完整通過驗證的結果才用於正式釋出。
雙方有明確標準誤時,淨支援取 2Φ(分差 / 合成標準誤) − 1,預設零協方差;其他比較只取原始領先方向。未知誤差並非零誤差,小分差按序數處理仍是侷限。票權針對潛在模型對,覆蓋型號多的來源會使用更多比較位置,不能把名義預算解讀為最終名次的精確貢獻率。
展示指數保留原排序:逐對反轉相鄰模型的先後,允許其餘模型重排,計算最少增加的逆向淨支援。沿原排名累加這些非負支援差,再相對固定參照組用 sigmoid 對映到 0—100。替代順序同樣最優時保留零間距,顯示保留一位小數,不人為設定最低分差。指數不參與反向排序;入榜集合、參照型號與證據變化仍會影響指數,分差不等於真實能力距離。同代價求解固定型號 ID 次序;整數最佳化使用 HiGHS 求解器(highs 1.15.3),誤差換算的正態分佈函式與 SciPy norm.cdf 採用同一演算法;來源、協議、參評資格和每輪計算輸入均儲存版本。未連線到共同證據網路時不釋出跨分量的假精確順序。
固定參照型號:claude-fable-5、gpt-5-6-sol、kimi-k-3、qwen-3-8-max、gpt-5-4、claude-opus-4-8、claude-sonnet-5、grok-4-5、gemini-3-5-flash、glm-5-2、claude-sonnet-4-6、qwen-3-7-max、kimi-k-2-6、deepseek-v-4-pro、qwen-3-6-plus、minimax-m-3、gpt-5-4-mini、grok-4-3。參照組用於指數尺度,不指定任何廠商應排第幾;不同分類的指數不直接比較。