← 返回 2026-09-21 简报

DeepSeek V4 具备视觉能力吗?

语音播报
摘要
事件:OpenRouter解析DeepSeek V4模型家族,指出仅V4.1 Flash与实验版Flash Vision支持原生图像输入。 要点:V4.1 Flash基于因果编解码架构,激活8B/16B参数;V4 Flash Vision Exp为实验性视觉版本; 影响:开发者需直接调用特定slug以启用视觉能力,避免使用别名导致请求失败。

DeepSeek V4 并非单一模型。在我们的目录中,它是一个包含 V4.1 Flash、V4 Pro 0813、V4 Flash 0731、V4 Flash Vision Exp、两个较早的 0423 检查点以及一个 Flash “latest”别名的家族。这些名称告诉你层级和发布日期,但并未说明哪些模型接受图像输入。

本指南将逐一介绍该家族中的每个模型,使用我们目录中的确切 slug,并展示在图像上使用 V4 的两种方式。第一种方式是将图像发送到能够读取图像的 V4 模型。第二种方式是在纯文本 V4 模型之前运行一个独立的视觉模型。

按模型划分的简短答案

有两个 V4 模型接受图像输入。DeepSeek V4.1 Flash 原生支持图像读取,是用于新图像工作的首选模型。DeepSeek V4 Flash Vision Exp 也支持图像读取,DeepSeek 将其标记为实验性版本。

我们目录中的其他所有 V4 slug 均为“文本输入,文本输出”。这包括 V4 Pro 0813、V4 Flash 0731、两个 0423 检查点以及 ~deepseek/deepseek-v4-flash-latest 别名。向这些模型之一发送包含 image_url 部分的请求会失败,因为这些模型的输入模态列表中不包含图像。

存在哪些 V4 模型以及它们接受什么输入

通过订阅,您同意接收 OpenRouter 通讯:模型使用数据、产品更新和研究报道,每周约一封电子邮件。您可以通过每封电子邮件中的链接随时取消订阅。请参阅我们的隐私政策。

下表列出了我们目录中的每个 V4 模型,其中“模态”一栏回答了该问题。价格为 2026 年 9 月 11 日列出的每百万 token 的目录费率,如果列出的费率有更多位数,则四舍五入到小数点后三位。

模型 Slug 输入 价格(输入/输出) 上下文长度 图像输入

V4.1 Flash deepseek/deepseek-v4.1-flash 文本、图像 $0.15 / $0.60 1,048,576 是

V4 Flash Vision Exp deepseek/deepseek-v4-flash-vision-exp 文本、图像 $0.22 / $0.66 1,048,576 是,实验性

V4 Pro 0813 deepseek/deepseek-v4-pro-0813 文本 $0.579 / $1.738 1,048,576 否

V4 Flash 0731 deepseek/deepseek-v4-flash-0731 文本 $0.065 / $0.18 1,310,720 否

V4 Pro 0423 deepseek/deepseek-v4-pro 文本 $0.860 / $1.720 1,048,576 否

V4 Flash 0423 deepseek/deepseek-v4-flash 文本 $0.085 / $0.171 1,048,576 否

所有六个模型仅返回文本。每个模型页面列出了当前价格、上下文长度和输入模态,这些值会随着提供者和检查点的变化而变化。在将某个 slug 投入生产之前,请阅读该页面。

~deepseek/deepseek-v4-flash-latest 别名重定向到 V4 Flash 家族中的最新模型。在撰写本文时,它解析为 Flash 0731,并将文本列为其唯一的输入模态。请勿在图像请求中使用此别名。直接指定 deepseek/deepseek-v4.1-flash 或 deepseek/deepseek-v4-flash-vision-exp。

V4.1 Flash 原生支持图像读取

DeepSeek V4.1 Flash 是首个基于 DeepSeek 因果编码器-解码器架构构建的模型。它在输入时激活 8B 参数,在输出时激活 16B 参数,骨干网络拥有 552B 参数。图像理解是该架构的一部分,视觉和文本嵌入从预训练开始就联合训练。它拥有 1,048,576 token 的上下文窗口,在 DeepSeek 端点上最大输出为 384,000 token,并支持工具调用、response_format 和结构化输出。

使用图像调用它与普通的聊天请求相同,只需在消息内容中添加一个图像部分即可。TypeScript SDK 将请求体嵌套在 chatRequest 下,并使用 camelCase 字段名,因此 SDK 中的图像部分为 imageUrl,而在网络传输中为 image_url。

import { OpenRouter } from "@openrouter/sdk" ;

const openRouter = new OpenRouter ({
apiKey: process.env. OPENROUTER_API_KEY ,
});

const result = await openRouter.chat. send ({
chatRequest: {
model: "deepseek/deepseek-v4.1-flash" ,
messages: [
{
role: "user" ,
content: [
{ type: "text" , text: "What error state is this screenshot showing?" },
{ type: "image_url" , imageUrl: { url: "https://example.com/screenshot.png" } },
],
},
],
stream: false ,
},
});

if ( ! ( "choices" in result)) {
throw new Error ( "Expected a non-streaming response" );
}

console. log (result.choices[ 0 ]?.message.content);
url 字段接受公共图像 URL 或 base64 数据 URL。请在图像部分之前发送文本部分。图像输入指南涵盖了 base64 格式、支持的图像类型以及在单个请求中发送多张图像的方法。

V4 Flash Vision Exp 是实验性选项

DeepSeek V4 Flash Vision Exp 是 V4 Flash 0731 的实验性视觉增强版本。它在保持与基础模型在文本任务上性能一致的同时,增加了图像理解能力。该模型于 2026 年 8 月 21 日发布,直到 2026 年 9 月 10 日 V4.1 Flash 发布之前,它是唯一接受图像输入的 V4 系列模型。

它使用与上述示例相同的请求结构,仅需将 model 字段更改为 deepseek/deepseek-v4-flash-vision-exp 。它具有 1,048,576 个 token 的上下文窗口,并支持工具调用、response_format 和结构化输出。

DeepSeek 将该模型标记为实验性模型。除非你有特定理由测试该实验模型,否则对于新的图像任务请使用 V4.1 Flash;如果确实使用该实验模型,请锁定确切的 slug。

在纯文本 V4 模型前放置视觉模型

V4 Pro 0813、V4 Flash 0731 以及 0423 检查点均不接受图像输入。如果你希望其中一个模型对图像进行推理,请先运行一个视觉模型,并将其文本输出传递给 V4 模型。V4 模型永远不会看到像素,它读取的是描述。

接受图像和视频输入的两个模型分别是位于 qwen/qwen3.8-27b 的 Qwen3.8 27B 和位于 moonshotai/kimi-k3 的 Kimi K3 。我们的视觉模型集合列出了所有接受图像输入的目录模型。

import { OpenRouter } from "@openrouter/sdk" ;

const openRouter = new OpenRouter ({
apiKey: process.env. OPENROUTER_API_KEY ,
});

const imageUrl = "https://example.com/screenshot.png" ;
const userTask = "Explain the error and propose a fix." ;

// Step 1: a vision model reads the image and returns a text description.
const seen = await openRouter.chat. send ({
chatRequest: {
model: "qwen/qwen3.8-27b" ,
messages: [
{
role: "user" ,
content: [
{
type: "text" ,
text: "Describe this screenshot for a reasoning model. Report only what is visible." ,
},
{ type: "image_url" , imageUrl: { url: imageUrl } },
],
},
],
stream: false ,
},
});

if ( ! ( "choices" in seen)) {
throw new Error ( "Expected a non-streaming response" );
}

const description = seen.choices[ 0 ]?.message.content;

if ( typeof description !== "string" ) {
throw new Error ( "Expected a text description from the vision model" );
}

// Step 2: a text-only V4 model reasons over the description.
const reasoned = await openRouter.chat. send ({
chatRequest: {
model: "deepseek/deepseek-v4-pro-0813" ,
messages: [
{
role: "user" ,
content: Image notes: \n ${ description } \n\n Task: ${ userTask } ,
},
],
stream: false ,
},
});

if ( ! ( "choices" in reasoned)) {
throw new Error ( "Expected a non-streaming response" );
}

console. log (reasoned.choices[ 0 ]?.message.content);
将 qwen/qwen3.8-27b 替换为 moonshotai/kimi-k3 可将 Kimi K3 用于图像输入,或将 deepseek/deepseek-v4-pro-0813 替换为 deepseek/deepseek-v4-flash-0731 用于文本推理环节。

两次调用比一次调用成本更高。2026 年 9 月 11 日,Qwen3.8 27B 的定价为每百万输入 token 0.42 美元、每百万输出 token 3.00 美元,Kimi K3 的定价为 2.10 美元和 10.53 美元。此外你还需支付 V4 模型的费用。仅在需要纯文本 V4 模型或视频输入时使用此模式,不要将其作为使用 V4 读取图像的默认方式。

选择哪种路径

根据所需模型和你拥有的输入类型匹配路径。

如果是静态图片或文档,且 Flash 层级质量已足够,请在一次调用中将其发送至 deepseek/deepseek-v4.1-flash 。

如果是静态图片,且你想测试实验性模型,请在一次调用中将其发送至 deepseek/deepseek-v4-flash-vision-exp ,并锁定 slug。

对图像进行 Pro 层级推理。没有 V4 Pro 模型接受图像输入。请先运行一个视觉模型,并将其文本输出传递给 deepseek/deepseek-v4-pro-0813 。

视频输入。没有任何 V4 模型接受视频输入。请运行支持视频的模型(例如 Qwen3.8 27B 或 Kimi K3),并将其生成的文本传递给 V4 模型。关于视频输入的指南涵盖了请求的格式。

混合文本和图像流量。将纯文本请求保留在您已使用的文本模型上,并将图像请求发送给 V4.1 Flash。

如果图像未经预警地到达,请检查代码中的消息内容,并在发送请求之前选择正确的模型。提供商路由仅在您指定的模型的提供商之间进行选择。它不会切换到不同的模型,因此无法将针对纯文本模型的图像请求转换为对视觉模型的请求。

如何自行检查模型的模态

模型页面和 models API 是确定 slug 接受内容的权威来源。每个模型页面都列出了其输入和输出模态。models API 返回的数据与每个模型的 architecture.input_modalities 相同。

curl -s https://openrouter.ai/api/v1/models \
| jq -r '.data[] | select(.id | startswith("deepseek/deepseek-v4")) | "(.id)\t(.architecture.input_modalities | join(","))"'

筛选为图像输入的 models 页面显示了目录中所有接受图像的模型。如果后续的 V4 检查点增加了图像输入功能,其模型页面和 API 响应将显示该信息,我们将更新此页面。

常见问题解答

DeepSeek V4 Flash 是否具有视觉功能?

这取决于检查点。deepseek/deepseek-v4.1-flash 和 deepseek/deepseek-v4-flash-vision-exp 接受文本和图像。deepseek/deepseek-v4-flash-0731 和 deepseek/deepseek-v4-flash 仅支持文本,而 ~deepseek/deepseek-v4-flash-latest 别名在撰写本文时解析为 Flash 0731。

DeepSeek V4 Pro 是否具有视觉功能?

没有。deepseek/deepseek-v4-pro-0813 和较旧的 deepseek/deepseek-v4-pro 仅将文本列为其输入模态。要在图像上使用 Pro,请先运行一个视觉模型,并将其文本描述传递给 Pro。

我应该为图像使用哪个 DeepSeek V4 模型?

请使用 deepseek/deepseek-v4.1-flash 。它原生支持读取图像,未被标记为实验性,并且在 2026 年 9 月 11 日列出的价格为每百万输入令牌 0.15 美元,每百万输出令牌 0.60 美元。deepseek/deepseek-v4-flash-vision-exp 是实验性替代方案。

DeepSeek V4 图像输入的成本是多少?

图像输入通过模型的令牌价格进行计费。在 2026 年 9 月 11 日,V4.1 Flash 的列价为每百万令牌输入 0.15 美元、输出 0.60 美元,而 V4 Flash Vision Exp 的列价为每百万令牌输入 0.22 美元、输出 0.66 美元。在估算预算之前,请查看模型页面,因为列出的价格会发生变化。

DeepSeek V4 能否处理视频?

我们目录中的任何 V4 模型均未将视频列为输入模态。对于视频,请使用支持视频的模型(例如 qwen/qwen3.8-27b 或 moonshotai/kimi-k3),然后将其文本输出传递给 V4 模型。

原文链接:https://openrouter.ai/blog/insights/deepseek-v4-vision/
来源:OpenRouter
以上内容由 AI 自动翻译,仅供参考。
← 返回简报