跳到正文
openrouter blog·· 16 天前精選AI 評分63

DeepSeek V4 模型支援影像輸入嗎?

Does DeepSeek V4 Have Vision?

AI 導讀

DeepSeek V4 系列並非單一模型,其中僅 DeepSeek V4.1 Flash 與 DeepSeek V4 Flash Vision Exp 支援原生影像輸入,其餘 Pro 與 Flash 檢查點皆為純文字模型。

推薦理由

文章梳理了 DeepSeek V4 系列各模型對影像輸入的支援情況與呼叫方式,讀者可據此選擇原生多模態模型或搭配前置視覺模型來處理影像任務。

正文 · AI 翻譯

DeepSeek V4 不是單一模型。在我們的目錄中,它是一個包含 V4.1 Flash、V4 Pro 0813、V4 Flash 0731、V4 Flash Vision Exp、兩個較舊的 0423 checkpoint,以及一個 Flash “latest” 別名的系列。名稱告訴你等級和釋出時間,但不說哪些模型接受影像。

本指南將逐一介紹這個系列的每個模型,使用我們目錄中的精確 slug,並展示兩種在影像上使用 V4 的方法。第一種將影像送到能讀取影像的 V4 模型。第二種則在純文字 V4 模型前執行獨立的視覺模型。

簡單回答,按模型分類

兩個 V4 模型接受影像。DeepSeek V4.1 Flash 能原生讀取影像,適合新影像工作。DeepSeek V4 Flash Vision Exp 也能讀取影像,DeepSeek 將其標記為實驗性。

我們目錄中其他所有 V4 slug 都是文字輸入、文字輸出。包括 V4 Pro 0813、V4 Flash 0731、兩個 0423 checkpoint,以及 ~deepseek/deepseek-v4-flash-latest 別名。將 image_url 部分送到這些模型之一會失敗,因為模型未將 image 列為其輸入模態。

Diagram of the DeepSeek V4 family on OpenRouter split by input modality. V4.1 Flash and V4 Flash Vision Exp accept text and images. V4 Pro 0813, V4 Flash 0731, V4 Pro 0423, V4 Flash 0423, and the flash-latest alias accept text only.

哪些 V4 模型存在以及它們接受什麼

表格列出了我們目錄中每個 V4 模型,並在模態欄位中回答此問題。價格為 2026 年 9 月 29 日的目錄每百萬 tokens 之定價,若列出的價格有更多位數則四捨五入至三位小數。

模型Slug輸入價格(輸入/輸出)上下文影像輸入
V4.1 Flashdeepseek/deepseek-v4.1-flash文字、影像$0.30 / $1.201,048,576是
V4 Flash Vision Expdeepseek/deepseek-v4-flash-vision-exp文字、影像$0.216 / $0.6471,048,576是,實驗性
V4 Pro 0813deepseek/deepseek-v4-pro-0813文字$0.395 / $3.4901,048,576無
V4 Flash 0731deepseek/deepseek-v4-flash-0731文字$0.018 / $0.3201,310,720無
V4 Pro 0423deepseek/deepseek-v4-pro文字$0.928 / $1.8561,048,576無
V4 Flash 0423deepseek/deepseek-v4-flash文字$0.076 / $0.1531,048,576無

這兩個 0423 slug 沒有日期字尾。deepseek/deepseek-v4-pro 與 deepseek/deepseek-v4-flash 是原始的 2026 年 4 月 V4 版本,只有較後的 checkpoint 在 slug 中帶有日期。

這六個模型僅回傳文字。每個模型頁面會列出目前價格、上下文長度與輸入模式,這些數值會隨著供應商與 checkpoint 變化而調整。請在將 slug 投入正式環境前閱讀該頁面。

~deepseek/deepseek-v4-flash-latest 別名會重定向至 V4 Flash 系列中最新的模型。撰寫時它解析為 Flash 0731,且僅列出文字為輸入模式。請勿使用此別名進行影像請求。直接固定 deepseek/deepseek-v4.1-flash 或 deepseek/deepseek-v4-flash-vision-exp。

V4.1 Flash 原生支援影像輸入

DeepSeek V4.1 Flash 是首個基於 DeepSeek Causal Encoder‑Decoder 架構構建的模型。它在輸入時啟用 8B 引數、輸出時啟用 16B 引數,基於 552B 引數的骨幹。影像理解是該架構的一部分,視覺與文字嵌入從預訓練開始即共同訓練。它在 DeepSeek 端點上擁有 1,048,576 令牌的上下文視窗,最大輸出為 384,000 令牌,並支援工具呼叫、response_format、以及結構化輸出。

使用影像呼叫它與你目前的聊天請求相同,只是將影像部分加入訊息內容。TypeScript SDK 將請求主體巢狀在 chatRequest 下,並使用 camelCase 欄位名稱,因此影像部分在 SDK 中為 imageUrl,在網路傳輸中為 image_url。

import { OpenRouter } from "@openrouter/sdk";

const openRouter = new OpenRouter({
  apiKey: process.env.OPENROUTER_API_KEY,
});

const result = await openRouter.chat.send({
  chatRequest: {
    model: "deepseek/deepseek-v4.1-flash",
    messages: [
      {
        role: "user",
        content: [
          { type: "text", text: "What error state is this screenshot showing?" },
          { type: "image_url", imageUrl: { url: "https://example.com/screenshot.png" } },
        ],
      },
    ],
    stream: false,
  },
});

if (!("choices" in result)) {
  throw new Error("Expected a non-streaming response");
}

console.log(result.choices[0]?.message.content);

url 欄位接受公開影像 URL 或 base64 資料 URL。請先傳送文字部分,再傳送影像部分。影像輸入指南涵蓋 base64 格式、支援的影像型別,以及一次請求傳送多張影像的方法。

V4 Flash Vision Exp 為實驗性選項

DeepSeek V4 Flash Vision Exp 是 V4 Flash 0731 的實驗性視覺版。它新增影像理解功能,同時在文字任務上保持與基礎模型相同的表現。於 2026 年 8 月 21 日釋出,直到 2026 年 9 月 10 日 V4.1 Flash 釋出為止,它是唯一接受影像的 V4 模型。

它接受與上方範例相同的請求,只是將 model 欄位改為 deepseek/deepseek-v4-flash-vision-exp。它擁有 1,048,576 個 token 的上下文視窗,並支援工具呼叫、response_format 以及結構化輸出。

DeepSeek 將此模型標記為實驗性。除非你有特別理由測試實驗模型,否則請使用 V4.1 Flash 進行新的影像工作,並在使用時鎖定精確的 slug。

將視覺模型放在文字專用 V4 模型前面

V4 Pro 0813、V4 Flash 0731 與 0423 版本不接受影像。若要讓其中一個模型對影像進行推理,請先執行視覺模型,將其文字輸出傳遞給 V4 模型。V4 模型永遠不會看到畫素,它只會閱讀描述。

兩個接受影像與影片輸入的模型為 Qwen3.8 27B 位於 qwen/qwen3.8-27b 與 Kimi K3 位於 moonshotai/kimi-k3。我們的 vision models collection 列出所有接受影像輸入的目錄模型。

import { OpenRouter } from "@openrouter/sdk";

const openRouter = new OpenRouter({
  apiKey: process.env.OPENROUTER_API_KEY,
});

const imageUrl = "https://example.com/screenshot.png";
const userTask = "Explain the error and propose a fix.";

// Step 1: a vision model reads the image and returns a text description.
const seen = await openRouter.chat.send({
  chatRequest: {
    model: "qwen/qwen3.8-27b",
    messages: [
      {
        role: "user",
        content: [
          {
            type: "text",
            text: "Describe this screenshot for a reasoning model. Report only what is visible.",
          },
          { type: "image_url", imageUrl: { url: imageUrl } },
        ],
      },
    ],
    stream: false,
  },
});

if (!("choices" in seen)) {
  throw new Error("Expected a non-streaming response");
}

const description = seen.choices[0]?.message.content;

if (typeof description !== "string") {
  throw new Error("Expected a text description from the vision model");
}

// Step 2: a text-only V4 model reasons over the description.
const reasoned = await openRouter.chat.send({
  chatRequest: {
    model: "deepseek/deepseek-v4-pro-0813",
    messages: [
      {
        role: "user",
        content: `Image notes:\n${description}\n\nTask: ${userTask}`,
      },
    ],
    stream: false,
  },
});

if (!("choices" in reasoned)) {
  throw new Error("Expected a non-streaming response");
}

console.log(reasoned.choices[0]?.message.content);

將 qwen/qwen3.8-27b 換成 moonshotai/kimi-k3 以將 Kimi K3 放在影像上,或將 deepseek/deepseek-v4-pro-0813 換成 deepseek/deepseek-v4-flash-0731 於文字回合。

兩次呼叫的成本高於一次。於 2026 年 9 月 29 日,Qwen3.8 27B 的價格為每百萬輸入 token $0.025、每百萬輸出 token $4.40,Kimi K3 的價格為 $3.00 與 $15.00。你還需額外支付 V4 模型的費用。當你需要文字專用 V4 模型或影片輸入時,請使用此模式,而非預設以 V4 讀取影像的方式。

使用哪條路徑

將路徑與你所需的模型及可用輸入對應。

  • 靜態影像或檔案,Flash 級別的品質已足夠。一次呼叫將其送至 deepseek/deepseek-v4.1-flash。
  • 靜態影像,且你想測試實驗模型。一次呼叫將其送至 deepseek/deepseek-v4-flash-vision-exp,並鎖定 slug。
  • Pro 級別在影像上的推理。沒有 V4 Pro 模型接受影像。請先執行視覺模型,將其文字輸出傳遞給 deepseek/deepseek-v4-pro-0813。
  • 影片輸入。沒有任何 V4 模型接受影片。使用能接受影片的模型,例如 Qwen3.8 27B 或 Kimi K3,將其文字輸入傳遞給 V4 模型。video inputs guide 介紹了請求格式。
  • 混合文字與影像流量。將純文字請求保持在你已使用的文字模型上,並將影像請求送至 V4.1 Flash。

若影像未經預警就送達,請檢查程式碼中的訊息內容,並在傳送請求前選擇模型。Provider routing 在你指定的模型供應商之間做選擇。它不會切換到其他模型,因此無法將影像請求轉為僅文字模型,而改為視覺模型。

如何自行檢查模型的模態

模型頁面與模型 API 是 slug 接受哪些模態的真實來源。每個模型頁面列出其輸入與輸出模態。模型 API 會在每個模型上返回與 architecture.input_modalities 相同的資料。

curl -s https://openrouter.ai/api/v1/models \
  | jq -r '.data[] | select(.id | startswith("deepseek/deepseek-v4")) | "\(.id)\t\(.architecture.input_modalities | join(","))"'

models page 以影像輸入篩選後顯示我們目錄中所有接受影像的模型。若後續 V4 checkpoint 加入影像輸入,其模型頁面與 API 回應將顯示,並且我們會更新此頁面。

常見問題

DeepSeek V4 Flash 有視覺功能嗎?

這取決於版本。deepseek/deepseek-v4.1-flash 與 deepseek/deepseek-v4-flash-vision-exp 接受文字與影像。deepseek/deepseek-v4-flash-0731 與 deepseek/deepseek-v4-flash 為文字專用,且 ~deepseek/deepseek-v4-flash-latest 別名解析為 Flash 0731,撰寫時為此。

DeepSeek V4 Pro 有視覺功能嗎?

僅使用 No. deepseek/deepseek-v4-pro-0813 和較舊的 deepseek/deepseek-v4-pro 以文字作為唯一輸入模式。若要在影像上使用 Pro,請先執行一個視覺模型,並將其文字描述傳遞給 Pro。

我應該使用哪一款 DeepSeek V4 模型來處理影像?

使用 deepseek/deepseek-v4.1-flash。它原生讀取影像,未被標記為實驗性,且於 2026 年 9 月 29 日列為每百萬輸入 token $0.30、每百萬輸出 token $1.20。deepseek/deepseek-v4-flash-vision-exp 為實驗性選項。

DeepSeek V4 影像輸入的費用是多少?

影像輸入的費用按模型的 token 價格計算。於 2026 年 9 月 29 日,V4.1 Flash 的每百萬輸入 token $0.30、輸出 token $1.20,V4 Flash Vision Exp 的每百萬輸入 token $0.216、輸出 token $0.647。使用前請先檢視模型頁面,因為列出的價格會變動。

DeepSeek V4 能處理影片嗎?

我們目錄中的 V4 模型並未列出影片作為輸入模式。若要處理影片,請使用支援的模型,例如 qwen/qwen3.8-27b 或 moonshotai/kimi-k3,然後將其文字輸出傳遞給 V4 模型。

來源:openrouter blog · openrouter.ai