LLM 中如何選擇最佳圖片輸入細節層級
Choosing the Optimal Image Input Detail Level in LLMs
OpenRouter 團隊對 OpenAI 與 Google 最新模型的圖片細節引數進行基準測試,發現在推理模型中將圖片設為低解析度(low)反而會因模型需花費更多思考力而增加總成本並降低準確率。
評測顯示推理模型使用低解析度圖片反而會增加思考負擔並拉高總成本,讀者可據此調整視覺任務的圖片細節與推理引數。
如果你在圖片輸入上設定 detail: low 以降低成本,你可能無法獲得預期的改善。我們對 OpenAI 與 Google 最新模型的圖片細節引數進行了基準測試,並發現細節層級、推理與成本之間存在一些令人驚訝的關聯。
例如,當我們在 MMMU-Pro Vision 上對 gpt-5.5 的 low 與 auto 圖片細節進行基準測試時,低細節的分數低了 13.8 分(65.2% 對 79.0%),且每個問題的成本更高(5.1¢ 對 4.5¢)。該模型透過多花 1.6 倍的思考來補償降樣的圖片。這些推理 Token 的成本超過了在輸入端節省的圖片 Token。

我們在推理模型的圖片處理中發現了一條更有效的降本路徑:傳送更清晰的圖片(auto 或 high),並改為調整推理強度。
自動細節(Auto detail)在每個模型上都能產生更好的結果,且有時成本更低
我們在 low 和 auto、溫度 0、一個 Epoch 的設定下,運行了來自 OpenAI 和 Google 的五個模型。每個模型在自動設定上的得分都更高。

| 模型 | 細節 | 準確率 | 成本 / 問題 | 推理 Token / 請求 |
|---|---|---|---|---|
| gpt-5.5 | low | 65.2% | 5.1¢ | 1,180 |
| gpt-5.5 | auto | 79.0% | 4.5¢ | 730 |
| gpt-5.4-mini | low | 46.1% | 0.08¢ | 0 |
| gpt-5.4-mini | auto | 55.8% | 0.14¢ | 0 |
| gpt-4.1 | low | 40.1% | 0.43¢ | 0 |
| gpt-4.1 | auto | 57.5% | 0.66¢ | 0 |
| gemini-3.5-flash | low | 77.9% | 2.96¢ | 2,876 |
| gemini-3.5-flash | auto | 80.1% | 2.80¢ | 2,602 |
| gemini-3.1-pro | low | 75.5% | 9.53¢ | 6,344 |
| gemini-3.1-pro | auto | 78.4% | 11.12¢ | 6,964 |
低細節會讓 gpt-5.5 思考更久
根據 OpenAI 的視覺檔案,無論原始尺寸為何,detail: low 會提供給模型一個低解析度的 512x512 圖片版本,並以固定的少數 Token 成本計費。雖然這節省了輸入 Token,但也意味著有用的微小細節可能無法在降維中保留下來。
在 gpt-5.5 上,低細節產生的每個請求 1,180 個推理 Token,相較於自動設定的 730 個,跳升了 1.6 倍,此外完成 Token 也多了 39%(489 對 351)。該模型花費額外的力氣去辨識那些它無法再清晰讀取的小字與圖表。

輸出 Token 的計費高於圖片 Token,因此較便宜的輸入成本被抵消了。同一個模型在低細節下詢問相同的問題,每個問題的成本比自動設定貴了 0.6¢。你花費更多,分數卻更低。
在進行推廣之前的一點警告:Token 的模式因模型而異。gemini-3.5-flash 在低細節下也使用了更多推理 Token(2,876 對 2,602),但 gemini-3.1-pro 使用的略少(6,344 對 6,964),且其低細節執行成本更低。
gpt-5.4-mini 和 gpt-4.1 不具備推理能力,因此它們在這兩種設定下的思考 Token 都停留在 0。由於沒有輸出的部分需要增長,因此輸入端的節省得以保留(詳見下文)。
從更清晰的圖片中你可以獲得什麼樣的準確率提升?
從低切換到自動設定,根據模型的不同,可以帶來 2 到 17 個百分點的準確率提升。

OpenAI 模型獲得的提升最大,因為它們的低細節設定將每張圖片都降維至 512x512,且只需少量的固定 Token 成本(gpt-4.1 為 85 個 Token)。Gemini 的低解析度每個區塊保留大約 273 個 Token,因此它從更清晰的基準開始,流失的較少。
這些提升集中在圖片型別上。該資料集有 76% 是文字與 OCR,另外 19% 是截圖,因此大多數問題本就接近模型的極限,隨著細節調整幾乎沒有變化。最明顯的跳躍出現在圖表上:gemini-3.1-pro 在自動細節下,這些專案的準確率從 78.6% 攀升至 91.7%。無論哪種方式,圖表始終是最難的類別,大約維持在三分之一的正確率(基於 21 個問題的小樣本)。

以下是其中一個問題,這是一個 2239×1279 的機械工程圖,要求你從四個幾近相同的正投影檢視中選出正確的主檢視:

這四個候選檢視的差別僅在於剖面線與隱藏線的位置。在 auto 細節模式下,gpt-5.5 選擇了正確答案 B。在 low 模式下,同一張圖會縮減為 512px 的縮圖,這些細線會糊成一片,模型在經過較長的思考鏈後選擇了 C。較長的推理無法彌補清晰度不足的影像。
推理層級對成本有最顯著的影響
細節層級和推理工作量看起來在做類似的事,但在我們的執行中,它們的結果截然不同。改變細節層級使準確率大幅波動 2 到 17 個百分點,而費用幾乎沒有變動。改變推理工作量則使費用波動了 50 到 75%,而準確率在 1 到 2 個百分點之間震盪,屬於誤差範圍內。

將 gpt-5.5 限制在 reasoning=low,低細節成本從每題 5.1¢ 降至 1.7¢,降幅達 67%,而準確率變動了 1.3 個百分點(從 65.2% 降至 63.9%)。在 gemini-3.1-pro 上,自動執行成本從 11.1¢ 降至 2.7¢,準確率上升了 1.5 個百分點。因此,如果您想要更便宜的影像處理管線,請限制推理工作量並保持影像清晰。
低細節對非推理模型仍然划算
在非推理模型上,低細節的作用正如您所預期。gpt-5.4-mini 在 low 模式下的成本為每題 0.08¢,而在 auto 模式下為 0.14¢,便宜了大約 40%,因為沒有推理迴圈來拉高費用。代價是準確率,從 55.8% 下降到 46.1%。
延遲的表現也是如此。gpt-4.1 在 low 模式下的平均每請求延遲為 960ms,而 auto 模式為 1,148ms;gpt-5.4-mini 則是 1,348ms 對比 1,776ms。低細節將影像限制在較小的固定提示詞 Token 成本(gpt-4.1 上為 85 個 Token),因此在模型開始寫入之前需要讀取的內容少得多。由於沒有推理迴圈來拉長尾端延遲,較短的預填充時間表現為更快的回應速度。
為您的工作負載選擇合適的細節層級
這取決於您的模型是否具備推理能力:
- 推理模型(gpt-5.5 及類似模型):保留
auto或high,並使用推理工作量來控制成本。在我們的執行中,低細節在每個推理模型上的得分都較低,且在其中三個模型中的兩個上成本更高。 - 非推理模型(gpt-5.4-mini 及類似模型):低細節可以降低成本並縮短延遲,但對於文字密集的影像,準確率會降低。
無論哪種方式,與更昂貴的輸出 Token 相比,細節設定對最終成本的影響要小得多。在大多數情況下,您最好將影像細節保持在 auto,並調整推理設定。
OpenRouter 的 image input API 在各模型之間是統一的,而像細節層級這類模型特定的引數會透過供應商選項傳遞,因此您無需更改整合即可調整這些設定。
我們的測試方式
- 基準測試:MMMU-Pro Vision (
MMMU/MMMU_Pro, vision config, test split),1,730 道十選項視覺推理題。 - 模型:gpt-5.5, gpt-5.4-mini, gpt-4.1, gemini-3.5-flash, gemini-3.1-pro,每個模型皆在
low與auto細節下測試,temperature 為 0,執行一個 epoch。 - 細節設定:OpenAI
image_url.detaillow/auto;Gemini 每個零件mediaResolution。無最大 Token 限制。 - 影像型別:由 gpt-5.4-mini vision 分類(文字/OCR、螢幕截圖、圖表、圖形、插圖、照片)。已針對 Gemini 模型計算各型別的準確率;OpenAI 的各型別儲存格在此次執行中未進行評分。
- 指標:評估日誌中的準確率;Token 與延遲來自 OpenRouter 生成紀錄。
- 成本:以每道題目的成本回報,即總執行成本除以該次執行中所評分的題目數量。透過這種方式進行標準化,能確保規模略有不同的執行之間的比較公平。
來源:openrouter blog · openrouter.ai