DeepSeek 给 V4-Flash 加上视觉,多模态智能体分数逼近 Opus 4.8
这个 2840 亿参数的 MoE 模型加入图像输入,每张图上限 384 个 token,相对文本不加价
DeepSeek 于 2026 年 8 月 21 日发布了 V4 系列中第一个具备视觉能力的模型,为自 4 月以来一直是其开发者生态支柱的纯文本模型 V4-Flash 加上了图像理解能力。这个新模型 —— 在 API 中的标识为 deepseek-v4-flash-vision-exp —— 通过开发者已经在用的那个 V4-Flash 端点同时接受图像和文本,对这些图像按现有 V4-Flash 输入费率计费,不收视觉附加费。对于此前一直先把图像送去另一个视觉模型、再把提取出的文本传给 DeepSeek 的团队来说,等待原生多模态方案的日子结束了。
这次发布没有给出的,是一份经独立验证的性能主张。引发大部分报道的那张评测表 —— 把 V4-Flash-Vision-Exp 与 Anthropic 的 Claude Opus 4.8 作对比 —— 是 DeepSeek 以 PNG 图片的形式发布在发布说明里的,完全是自报数据,而且显示新模型在表中十一项评测里有八项落后于 Opus 4.8,最大差距在 NL2Repo 编程任务上达到 12 分。截至发稿,没有任何第三方评测方独立复现过这十一个分数中的任何一个。DeepSeek 自己的措辞是「接近 Opus 4.8」,这对多模态那几行来说是个合理的概括;而更广泛报道所用的「持平」或「叫板」的框定,数字并不支持。
这个区分之所以重要,是因为这里真正值得讲的故事,主要并不是竞争卡位。而是这样一个事实:DeepSeek 为智能体开发者消除了一项实质性的架构依赖,而且是在一个让「每张图的成本相对于这些图将生成的输出 token 几乎可以忽略不计」的价位上做到的。
直到本周之前,DeepSeek V4 都明确只支持文本
当 DeepSeek 于 2026 年 4 月发布 V4-Flash 和 V4-Pro时,两个模型的文档都写明只支持文本和代码。在 V4 平台上构建智能体、又需要处理图像的开发者 —— 网页界面截图、图表、文档、票据、UI 状态 —— 有两个选择:把图像送去另一个视觉模型(通常是 Gemini 或 Qwen-VL),提取出相关文本或描述,再把那段文本传给 DeepSeek;或者接受基于 V4 的智能体根本看不见这个事实。第一种做法增加了延迟、第二个 API 依赖,以及额外一层成本。DeepSeek 随 V4 一同推出的智能体框架 DeepSeek Harness,直到与新模型同日发布的 v0.1.1 版本之前,都缺乏原生视觉支持。
V4-Flash-Vision-Exp 消除了这项依赖。它不是新产品线中的另一个模型 —— 而是 V4-Flash-0731 的实验性变体,后者是 7 月重训的构建版本,目前承接所有发往 deepseek-v4-flash 端点的 API 调用。发布说明称它在文本能力上与 V4-Flash 持平,包括智能体、推理和世界知识。这种「持平」是字面意义上的还是近似的,属于公司的说法;可获得的评测数据(同样由公司自报)显示,视觉模型在九项可比评测中有八项优于其纯文本基线,仅在评估软件漏洞发现能力的 Cybergym 上落后。
一个以固定 token 上限处理图像的 2840 亿稀疏 MoE 模型
V4-Flash 的基础架构是稀疏专家混合(MoE)设计,总参数 2840 亿,每个 token 激活约 130 亿参数。MoE 的做法是把每个进来的 token 路由到一个专门化的参数块子集,而不是跑完整个模型,这也是为什么一个 2840 亿参数的模型能以与小得多的稠密网络相当的推理成本提供服务。视觉扩展依托的正是同一套架构:V4-Flash-Vision-Exp 继承了完整的 V4-Flash-0731 文本与推理栈,并在其上叠加了一条图像通路。
DeepSeek 没有披露任何关于它如何构建视觉编码器的信息 —— 没有论文,没有模型卡的相关章节,没有架构描述。Hugging Face 上确实存在名字与官方模型相近的第三方仓库,但它们自己的文档写明这些是独立的研究实验:把取自某个竞争对手架构的 MoonViT 编码器,拼接到冻结的 V4-Flash 文本主干上。正如OpenRouter 的模型页面所确认的,该模型没有官方的 Hugging Face 仓库。这些第三方仓库不是 DeepSeek 的官方发布,它们对 DeepSeek 生产系统究竟如何构建没有任何说明。
DeepSeek 确实公布了的,是它如何对图像输入计费。每张图像在内部被切分为最多 384 个 token,只要分辨率超过某个阈值,就与实际分辨率无关。该公司的视觉指南对这一后果说得很明确:一张 2000 × 2000 像素的图像与一张 5000 × 5000 像素的图像收费完全相同。该指南也直接列明了支持的图像格式:JPEG、PNG、GIF 和 WebP。图像有三种方式送入模型 —— 作为请求体中 base64 编码的字节、作为模型自行抓取的外部 URL,或者通过新的 Files API 以 file_id 引用。视觉指南中公布的单次请求上限允许每次调用最多 600 张图像;当请求中图像少于 15 张时,单边最大分辨率为 8192 像素,达到或超过 15 张时降为 4096 像素。
该模型支持思考模式且默认开启,继承了 V4-Flash 的思维链推理行为。它同时可通过 DeepSeek 的 OpenAI 兼容端点和 Anthropic 格式端点访问,这意味着已经在用其中任一格式的团队,只要改一下模型标识符就能加上视觉能力,API 集成的结构无需任何改动。
被报道读错了的那张评测表
这次发布中被引用最多的事实,是 V4-Flash-Vision-Exp 在多模态智能体评测上表现「接近 Opus 4.8」。这句话是 DeepSeek 自己说的,而且对于对比表中多模态那几行来说是准确的。问题在于这张表有十一行,不是四行,而该模型在全部十一项上的位置,比头条对比所暗示的要难看得多。
DeepSeek 的发布说明把评测数据作为图片文件而非文本嵌入,使得许多文本抓取工具无法读取,因而在早期报道中被分析得不够。这张完整的表由 DeepSeek 自报,对比 V4-Flash-Vision-Exp、纯文本的 V4-Flash-0731 和 Anthropic 的 Opus 4.8,分为两个部分。
在七项基于文本的智能体评测上,V4-Flash-Vision-Exp 有六项优于其纯文本基线,一项落后(Cybergym)。但对上 Opus 4.8,视觉模型仅在软件工程评测 DeepSWE 上领先 1.3 分(59.3 对 58.0),其余六项均落后。在评估「自然语言到仓库代码生成」的 NL2Repo 上,差距达到 12.0 分(57.7 对 69.7)。在 DSBench-Hard 上,差距为 8.1 分。
四项多模态智能体评测,才是「接近 Opus 4.8」这一说法最站得住的地方。视觉模型在 Agents' Last Exam(27.3 对 25.7)和 ZeroBench(35.0 对 34.0)上领先 Opus 4.8,在 ApexBench(36.5 对 39.4)和 Chartography(64.3 对 65.0)上小幅落后。这些评测正是为检验该模型刚刚获得的那项能力 —— 对视觉内容采取行动的能力 —— 而设计的,所以在四项多模态任务上全部领先或紧咬,是一个有意义的结果。但它并不等于与一个在更难的文本智能体评测上握有 8 到 12 分优势的模型全面持平。
关键背景:全部十一个分数都由 DeepSeek 自报。文本智能体那几行是用 DeepSeek 自家的 Harness 框架在 Minimal 模式下评测的,超参数设定具体为 temperature 1.0、top_p 0.95。Opus 4.8 对比分数的来源没有披露。没有任何独立评测方发表过对表中任一分数的复现。截至发稿,Terminal Bench 2.1 排行榜上没有该模型的第三方条目。来自更广泛 V4 系列的评测先例并不让人乐观:正如追踪 V4-Pro 发布的分析师所记录的,V4-Pro 的预览版在 DeepSeek 自家的 SWE-bench Verified 评测中拿到 80.6%,而在独立运行的 DeepSWE 评测上只有 8%,这个落差主要被归因于两项测试在验证器误报率上的差异。
两套时钟、一张价目表:图像计费到底怎么算
V4-Flash-Vision-Exp 的定价在每一个条目上都与纯文本 V4-Flash 相同,但有一个大多数报道忽略了的重要复杂之处:DeepSeek 按一天中的不同时段收取两种不同费率 —— 但只在工作日如此。
非高峰费率 —— 在周末以及工作日的非高峰时段生效 —— 为每百万输入 token 0.22 美元(缓存未命中)、每百万 0.007 美元(缓存命中)、每百万输出 token 0.66 美元。在工作日的两个高峰窗口(世界协调时 01:00 至 04:00 和 06:00 至 10:00,周一至周五),每一个条目都精确翻倍:输入 0.44 美元、缓存命中 0.014 美元、输出 1.32 美元。按 DeepSeek 公布的费率结构,周末全时段都算非高峰。一条在伦敦上班时间(工作日世界协调时 09:00 至 17:00)运行的流水线,几乎完全处在非高峰。而一条在美国东部时间工作日凌晨运行的流水线(东部时间 01:00 至 05:00 即世界协调时 05:00 至 09:00),会撞上第二个高峰窗口的大部分,那段时间按双倍费率付费。
图像 token 按调用发生那一刻适用的输入费率计费 —— 高峰或非高峰、缓存未命中或命中 —— 不收视觉专项附加费。按 384 token 的上限和非高峰缓存未命中费率算,单张图像成本约为 0.0000845 美元。一千张图像约 0.085 美元。放到规模上,一条处理一百万张图像的流水线,按非高峰费率单算图像 token 输入约需 84.50 美元 —— 这个数字被模型针对这些图像产出的输出 token 远远盖过:即便每张图只按 200 个输出 token 算,同样这一百万张图在非高峰费率下也要花 132 美元。实际的读法是:相对于图像所生成的输出,图像 token 在经济上可以忽略不计;对任何生产部署而言,时钟和默认开启的思考模式才是更要紧的成本因素。
与视觉模型同日发布的 Files API,让团队可以只上传一次图像,然后在后续请求中用 file_id 引用它。DeepSeek 声明该 API 免费。实际好处在于请求体积:不用 Files API 时,每次请求的图像总载荷上限为 64 MiB;而通过 file_id 引用图像时,每次请求的图像总大小上限升至 200 MiB。对于那些在智能体循环中处理高分辨率截图、同一批源图像会跨多轮反复出现的团队,Files API 免去了重复传输,也不需要重新编码。至于重复的 file_id 引用是否也会触发 DeepSeek 在 token 计费上的上下文缓存折扣,文档没有说明;这两套机制是分开的系统,不能想当然地认为等价。
这个模型做不到什么
V4-Flash-Vision-Exp 缺失的几项能力值得明确点出来,一是因为它们在竞争的多模态模型里都有,二是因为早期报道暗示的能力范围超出了文档所能支持的。
它没有视频输入,没有原生的 PDF 或文档摄取,没有 OCR 模式,也没有空间定位或边界框输出。输入是文本和静态图像,输出是文本。需要页级文档理解的团队,必须自己把 PDF 页面栅格化成图像文件,并在 600 张图、64 MiB 载荷的限制内发送 —— 这在技术上可行,但文档处理层需要由开发者自己搭建和维护。
该模型没有开放权重。DeepSeek 的纯文本 V4-Flash 检查点在 Hugging Face 上以 MIT 许可证提供,可以自行部署。而视觉模型没有对应的仓库、没有许可证,也没有宣布任何开放权重发布的路径。那些因为数据主权顾虑而选择 DeepSeek 自托管方案的团队,在视觉能力上无法复制这个选项。在实验期内,该模型只能通过 API 使用。
「Exp」这个后缀值得认真对待。DeepSeek 此前用过这个标记,包括在 DeepSeek-V3.2-Exp 上。关于 Exp 究竟让公司承诺了什么 —— 在稳定性、评估时间表或弃用政策方面 —— 没有任何正式定义被公布过。实际含义是:模型标识符 deepseek-v4-flash-vision-exp 应当被当作配置项,而不是一个永久字符串。当 Exp 阶段结束时,DeepSeek 通常会把该能力迁移到一个稳定的标识符上,而把模型名硬编码在代码里的团队,可能要通过一个 API 报错才会发现这次切换。
竞争背景:补上中国 AI 智能体基础设施的视觉缺口
V4-Flash-Vision-Exp 不是中国主要 AI 实验室推出的第一个多模态模型,也不是最便宜的视觉模型。Gemini 3.5 Flash 一直在相近价位上提供多模态能力。阿里巴巴的 Qwen-VL 提供带视觉支持的开放权重。DeepSeek 这次发布所代表的,是补上了一个对特定开发者群体而言代价高昂的特定缺口:那些已经押注 DeepSeek 智能体生态、基于 V4-Flash 和 Harness 框架构建、并且一直在为处理图像而承担双模型流水线开销的团队。
对这些团队来说,主要价值是架构上的简化,而不是评测对比。一个同时处理文本和图像、定价模型统一、并与 Harness 原生集成的单一模型端点,消除了一个决策点,减少了模型间交接带来的延迟,也消灭了一整类失败模式 —— 即视觉提取步骤返回了某样东西、而文本模型把它理解错了。
对于此前没有 DeepSeek 依赖的团队,竞争上的算盘要开放得多。Gemini 3.5 Flash 提供多模态能力,有更成熟的生产使用记录,以及一套随分辨率缩放的分块图像定价模型 —— 在某些工作负载下比 DeepSeek 的 384 token 上限更低,在另一些下更高,取决于图像复杂度和所选的分块分辨率。对多数对成本敏感的多模态智能体开发者来说,DeepSeek 评测表里那个与 Opus 4.8 的对比是错的比较对象;更相关的问题是 V4-Flash-Vision-Exp 在真实智能体任务的独立评测中相对 Gemini Flash 表现如何 —— 而这项测试需要第三方复现者来跑。
数据主权维度没有变化,而且以一种实质性的方式延伸到了视觉场景。DeepSeek 注册于中国杭州,由中国对冲基金幻方量化持有。中国《国家情报法》要求组织配合政府的情报请求;《网络安全法》和《数据安全法》施加了额外的数据访问与传输义务。当托管 API 处理图像时 —— 业务应用的截图、文档扫描件、界面状态 —— 潜在数据暴露的范围就超出了文本内容。把敏感视觉内容路由到该 API 的企业团队,承接的是与文本相同的义务,只不过如今适用于可能捕捉到应用内部结构、财务文件或专有 UI 设计的图像输入。而视觉模型目前不提供自托管选项。
DeepSeek 多模态栈接下来会怎样
最值得关注的进展是独立的评测复现。DeepSeek 这份十一项评测的自报表格,其内在诚实程度高于它所获得的报道 —— 一个想宣称与 Opus 4.8 全面持平的实验室,完全可以只公布一张更窄的表 —— 但这些分数讲述的故事比头条对比复杂,而且 DeepSeek 此前在厂商自控评测与独立评测之间存在的分数差异,使第三方验证成为任何严肃生产规划决策的前提。
DeepSeek 已宣布但未披露时间表、幅度或范围的一次 API 涨价,是第二个开放变量。本文中的每一个成本数字,反映的都是 DeepSeek 明确表示为临时的费率。为采用 V4-Flash-Vision-Exp 做成本测算的团队,应当把当前定价当作一张快照而不是稳态,并且应当把「高峰费率变成新的非高峰费率」这一情景也纳入模型。
第三个问题是 DeepSeek 会不会把视觉检查点作为开放权重发布。如果发布,那些目前因数据主权要求而无法使用托管 API 的团队,就能在自托管基础设施上获得视觉能力。如果不发布,视觉模型将在一条以开放权重发布著称的产品线中成为一项只有专有版本的能力 —— 这是与 V4-Flash 之间的一个结构性差异,开发者社区最终需要把它纳入自己的平台决策。
8 月 21 日这次发布已经确立的事实是:DeepSeek 的智能体模型现在能看见了。这份视觉够不够好、价格几何、在什么数据条件下、适用于哪些工作负载 —— 这些问题,要靠接下来几周的独立评测才能开始回答。
专家混合架构如何让低成本视觉成为可能
V4-Flash-Vision-Exp 定价背后的经济逻辑,落在 V4-Flash 从 DeepSeek 早期模型继承下来的 MoE 架构上。传统的稠密语言模型 —— 每一个参数都参与每一次前向传播 —— 推理成本随参数量线性增长。一个 2840 亿参数的稠密模型,需要为它处理的每一个 token 把 2840 亿个参数值搬过硬件加速器。在消费级定价下,这是负担不起的。
稀疏 MoE 模型把总参数量与每 token 计算量解耦。V4-Flash 的 2840 亿参数被组织成专门化的「专家」子网络。当模型处理一个 token 时,一个学习得到的路由机制会选出一小部分专家 —— 大约相当于 130 亿参数 —— 并只把该 token 送过这些专家。其余参数对这个特定 token 而言处于休眠状态。因为不同 token 会路由到不同专家,完整的 2840 亿参数知识库会在多样化的工作负载中被充分调动,但任何单次推理步骤只触及总参数的一小部分。DeepSeek 在 V2 中首次采用这一设计,在 V3 中进一步发展,并在 V4 中把它保留为核心架构原则。
V4 架构中引入的两种注意力机制,专门在长上下文长度上带来了进一步的算力节省:压缩稀疏注意力,它把相邻 token 分组,只检索统计上相关的远距离上下文;以及重度压缩注意力,它把较旧的上下文表示为稠密的摘要向量。这些机制降低了超长序列下每个 token 的计算量,让百万级 token 的上下文窗口从「技术上可能」变成「经济上可行」。
在这个基础上加一个视觉编码器,并不会从根本上改变文本推理的经济性。DeepSeek 没有描述它的视觉通路,但在 Transformer 主干上构建多模态模型的标准做法,是把图像 token 投射到语言模型用于文本的同一个嵌入空间,然后让组合后的序列经过模型现有的层。DeepSeek 对每张图施加的 384 token 上限与这一做法是吻合的:它限定了进入序列的视觉 token 数量,从而框住每张图的计算成本,同时以适合多数商业文档和截图的分辨率保留图像的信息内容。
让视觉模型可以立刻投入使用的那个智能体框架
DeepSeek Harness 是 DeepSeek 与其 V4 模型家族一同开发的智能体运行时。0.1 版本随 2026 年 8 月 13 日 V4-Pro 的正式发布一同推出;v0.1.1 与视觉模型同日发布,为 deepseek-v4-flash-vision-exp 提供了开箱即用的支持。
同日提供 Harness 支持的意义在于,为一个已有的、基于 DeepSeek 的智能体添加图像处理能力,开发者摩擦极小。已经在 V4-Flash 上使用 Harness 的开发者,只需在配置里改一下模型标识符,再在提示词里加入图像输入。其余的由框架处理:工具集成、多轮记忆管理,以及让智能体能跨越长动作序列运作的任务循环基础设施。对于 DeepSeek V4-Flash 赖以建立开发者拥趸的那些智能体用例 —— 编程智能体、基于终端的任务执行、浏览器自动化 —— 视觉扩展意味着智能体现在能读到自己正在操作的那个屏幕状态,而不必仅凭文本输出去推断。
架构上因此变简单的工作流包括:必须读取渲染后页面状态的浏览器智能体、验证视觉输出的 UI 测试自动化工具、处理扫描表单或结构化数据截图的文档处理流水线,以及需要解读报错截图或 UI 设计稿的编程智能体。这些不是假想的应用 —— 它们正是双模型变通方案最令人痛苦的真实工作流,而且直接对应着 DeepSeek 自报数据中相对纯文本基线提升最明显的那几项多模态智能体评测(ApexBench、Agents' Last Exam)。
同一档位内的视觉定价对比
对于寻找低成本多模态推理的开发者,V4-Flash-Vision-Exp 并不是唯一选项,要准确评估 DeepSeek 的定价主张,需要做一次直接比较。
谷歌的 Gemini 3.5 Flash 是同一价位档上最成熟的竞争者。Gemini 3.5 Flash 把图像输入与文本输入分开计费,按每张图收取一笔取决于分辨率和分块数量的分块费。与 DeepSeek 做法的关键区别在于:在分块模型下,Gemini 每张图的成本随分辨率增长,而 DeepSeek 的 384 token 上限在超过阈值后是平的,与分辨率无关。对于批量处理高分辨率建筑图纸或大幅文档的工作负载,DeepSeek 的固定上限可能更可预测。对于处理大量小而简单图像的工作负载,Gemini 的分块定价可能每张更便宜。真正的成本对比需要拿实际工作负载的图像去测,而不是比理论上限。
OpenAI 和其他供应商也提供其他低成本托管视觉 API,其输出定价在某些部署时段可能比 DeepSeek 的非高峰费率更有利。阿里巴巴的 Qwen-VL 系列提供可自托管的开放权重多模态选项,这让它在功能上与托管 API 的比较不属同一类:一个能在自有 GPU 基础设施上运行 Qwen-VL 的团队,面对的是边际推理成本,而不是规模化之后的按 token 计费。DeepSeek 的视觉模型没有开放权重,不参与那个类别的竞争。
诚实的竞争性总结是:V4-Flash-Vision-Exp 在托管多模态 API 市场中定价具有竞争力,其定价机制比某些替代方案更简单(固定的 384 token 图像上限,而非分块或随分辨率缩放的计费),相对前沿多模态模型的价格优势相当可观 —— 但没有开放权重意味着,它相对自托管方案的总成本优势,完全取决于工作负载体量和基础设施经济性。
独立验证,以及开发者在投入之前该做什么
缺乏独立的评测复现不是一个次要的编辑注脚 —— 对任何考虑把 V4-Flash-Vision-Exp 投入生产的开发者来说,它是核心的未决问题。DeepSeek 的模型家族在「厂商自控评测分数」与「独立评测分数」之间有据可查的差异记录。正如分析师在 V4-Pro 正式发布时指出的,V4-Pro 预览版在 DeepSeek 自家的 SWE-bench Verified 评测中拿到 80.6%,而该评测使用的验证器误报率为 8.5%;在独立运行的 DeepSWE 评测上 —— 它使用的是来自 yage.ai 的、误报率为 0.3% 的验证器 —— 同一个模型只得了 8%。
0813 的后训练更新把 V4-Pro 在更严格评测下的 DeepSWE 分数提到了 62.7 —— 说明能力确有提升 —— 但这个分数本身仍然是厂商自报的。而视觉模型的多模态评测分数,甚至还没有受到过这种程度的外部审视。
对开发者的实际含义是:把这张评测表当作方向性参考而非定论,并在大规模集成之前,拿模型跑一遍自己有代表性的工作负载。构成 DeepSeek 多模态对比核心的 ApexBench 和 Agents' Last Exam,是为检验智能体在复杂多步骤视觉任务上的行为而设计的;这些评测上的结果,未必能迁移到某个团队工作负载实际产出的那些特定截图类型、文档格式或 UI 模式上。一个为扫描版发票搭建数据提取流水线的团队,把自己有代表性的一批发票喂给模型,学到的东西会比 Chartography 的评测分数多得多。一次初步评估的成本可以忽略不计 —— 按非高峰费率,处理一千张测试图像的图像 token 花费不到十美分 —— 而其信息价值,远高于那张自报表格里的任何一个分数。