跳到正文
openrouter blog·· 2026-08-03精選AI 評分72

Ori Eval:協助你為專案選擇最佳模型

Ori Eval: Find the Best Model for What You're Building

AI 導讀

Ori Eval 是 OpenRouter 推出的自動化模型評估工具,能在你自己的程式碼與提示上跑測試,快速找出最適合專案的模型。

  • 工作流程:由 Ori 代理掃描程式碼,詢問你重視的指標(成本、速度、準確度等),自動產生 .eval.ts 測試檔並在 CI 或 GitHub Actions 執行。
推薦理由

Ori Eval 提供自動化模型評估,幫助團隊快速定位最佳模型並持續跟蹤更新,降低手工評測成本;其簡易整合方式讓開發者可即時驗證模型變化,提升開發效率與產品品質。

正文 · AI 翻譯

隨著越來越多的應用程式加入 AI 功能,選擇適合你正在構建的內容的模型仍然同樣困難,甚至更難,因為你可以從 500 多個模型 中挑選。

實際上,這種選擇往往沒有系統化的方法:可能是社群媒體的推薦、基準排行榜,或是對某個模型目前最強的直覺感覺。

這些資源確實有用,但都存在同樣的限制。基準測試只測量固定的任務集,推薦則反映他人的應用。兩者都無法告訴你模型在你的應用、你的 harness、你的資料以及你的提示下的表現。

同時,每週都有新模型推出,手動重新評估的成本足以讓許多團隊延遲決策,或保留已不再適用的模型。

在 OpenRouter,我們對模型瞭若指掌。

我們學到的事是,沒有絕對最好的模型——只有最適合你正在構建的內容的模型。

Ori Eval 能幫你找到那個最佳模型,並證明給你看。

開始時,告訴你的代理:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

Ori Eval 會像一位親切且經驗豐富的工程師朋友,帶領你選擇最適合你正在構建的內容的模型——不需要評估經驗。

總結

  • Ori Eval 會在你自己的提示下執行代理,檢查其呼叫的工具,並以 LLM 評審對開放式答案進行評分。
  • Ori 在執行期間將 harness 與模型固定。環境保持不變,因此如果評估結果發生變化,你就知道變化只能歸因於模型的變更。
  • Ori Eval 透過 OpenRouter 路由,因此模型比較涵蓋所有模型和實驗室。
  • 你不需要知道如何撰寫評估。Ori Eval 會找出程式碼中所有呼叫模型的位置,詢問你重視什麼,並寫出評估檔案。
  • 評估檔案即程式碼。將其在 CI 中執行以阻止回歸,並在有新模型發布時重新執行。
  • 開始時,告訴你的程式碼代理:run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started。

提問,得到答案(附證明)

要使用 Ori Eval,只需告訴你最喜歡的程式碼代理:

執行 curl -fsSL https://openrouter.ai/skills/spawn-ori-eval 並依照輸出中的說明操作

你的代理將請求交給 Ori Eval。Ori Eval 探索你的程式碼庫,並回報問題。在執行任何評估之前,它會與你合作,幫助確定你重視的因素——成本、效能、延遲、速度、工具呼叫準確度等。然後它挑選符合你需求的最新 5 個模型,並與你確認。

在收集完所有必要需求後,Ori Eval 會寫出一個 review.eval.ts 檔案,並並行執行你的代理對候選模型的測試,最後返回一張表格:

模型捕獲p50$/PR結果
anthropic/claude-opus-594%38s$0.041通過
openai/gpt-5.6-sol92%44s$0.038通過
moonshotai/kimi-k390%31s$0.019通過
z-ai/glm-5.286%26s$0.008通過
google/gemini-3-pro84%52s$0.062失敗(成本)

建議附帶理由:假設在您的模型成本標準內,最高的錯誤偵測率,以及如果錯誤審查量增加時的價值選擇。

如果您從未寫過評估,別擔心

撰寫優質評估並不容易,這就是為什麼我們為您處理那個繁瑣的部分。

Ori Eval 會掃描您的程式碼庫,找出所有模型執行的位置,並告訴您發現的資訊:使用案例範圍、精確檔案,以及您目前使用的模型。接著它會詢問您希望評估覆蓋哪些範圍,以及您最在意的是什麼:準確度、速度、成本,或其他?

一旦 Ori Eval 完成問卷,便根據您的回答生成評估檔案並執行。

就這麼簡單。

分數穩定,連續執行

因為 Ori Eval 是一個代理,整個執行期間它可以鎖定 harness、模型與工作量。它還預先調校好:我們已經挑選了最適合評估工作的 harness 與模型,您不必再做選擇。

評估檢查三項內容

一個 eval 檔案是 *.eval.ts 檔案,使用 bun test 執行。它會檢查代理呼叫的工具、避免使用的工具,以及答案品質:

const run = await agent.run("dinner in Lisbon?");
run.tool("search").toBeCalled();
run.tool("delete_file").toNotBeCalled();
run.toComplete();

對於開放式答案,LLM 作為評審會對輸出進行評分。Ori Eval 幫助您設定評分標準與最低分數,甚至可以評估棘手的開放式問題。

每個錯誤都能成為可測試的目標

用簡單的語言告訴 Ori Eval 一個錯誤:比如說,客服代理在不先確認訂單的情況下就發放退款——這是一個相當大的問題。

Ori Eval 會寫一個 eval,斷言 lookup_order 被呼叫。評估失敗證明錯誤存在。您隨後修正代理,評估就會通過。該斷言會保留在測試套件中,讓您永遠能捕捉到它。

阻止回歸,並在情況變更時重新執行

將 ori eval 加入 GitHub Actions 工作流程。它的退出碼像 bun test,因此失敗的評估也會使建置失敗,回歸永遠不會進入正式環境。

因為 Ori Eval 所寫的僅是程式碼,您也可以輕鬆安排定期執行。早期 beta 測試者之一現在每月進行模型比較。當新模型推出且效能優於您程式碼庫中的現有模型時,系統會自動開啟 PR,您只需合併即可,享受所有好處而不必額外考慮。

開始使用

告訴您的編碼代理:

run curl -fsSL https://openrouter.ai/skills/spawn-ori-eval and follow the instructions in its output to get started

就這樣。

此功能會安裝 Ori(我們預先調校的編碼代理),要求您登入、進行面試,然後執行評估。如果您使用 OpenRouter MCP server,請改執行 /spawn-ori-eval,並略過 URL。

手動安裝 Ori:

curl -fsSL https://openrouter.ai/labs/ori/install.sh | bash

然後執行 ori login。執行評估還需要 Bun。

在 Ori Eval page 或 Ori Eval docs 瞭解更多資訊。

來源:openrouter blog · openrouter.ai