DeepSeek V4 Flash Vision Exp:以文本模型的价格打开多模态智能体工作流
开放权重、384 token 的图像上限,以及三处骨干改动,让视觉按 V4 Flash 的价格交付

DeepSeek 于 2026 年 8 月 21 日发布了 DeepSeek-V4-Flash-Vision-Exp —— 其 V4 家族中第一个能处理图像的模型 —— 当天即上线为可用的 API 端点,并在 Hugging Face 上以 MIT 许可发布了开放权重。这次发布回应了 DeepSeek Harness 开发者社区里呼声最高的功能需求,也交付了整个 AI 行业鲜少见到的东西:一个每 token 价格与其纯文本前身完全相同的多模态模型,图像 token 与文本 token 同价计费。更有分量的消息不是 DeepSeek 公布的那张基准对比表,而是嵌在架构里的经济算术:按非高峰时段每百万输入 token 0.22 美元计,处理一张截图的成本不到一美分的十分之一;而一个在每轮循环里都要检查 UI 状态、截图密集的编程智能体,加在已有 V4 Flash 部署之上的边际成本基本为零。
V4 Flash 曾是纯文本的,开发者只能绕道
V4 Flash 架构于 2026 年 4 月以预览版发布,7 月 31 日以 V4-Flash-0731 进入正式可用,确立了自己在准前沿 API 模型中的成本领先地位。它 2840 亿总参数 —— 通过稀疏专家混合路由,每个 token 只激活 130 亿 —— 让它的推理经济性等同于跑一个 130 亿参数的稠密模型,同时又能调用大得多的知识库。价格与智能体能力的这个组合,让它成了面向开发者的编程智能体、流水线自动化和文档处理工具常见的后端选择。
有一处空缺格外显眼:V4 Flash 处理不了图像。在 Vision-Exp 发布前的那几周里,DeepSeek 的 Harness GitHub 讨论区里出现频率最高的问题,就是怎么给 V4 Flash 的工作流加上图像支持。开发者们在搭建视觉桥接插件,先把图像转成文本再喂给模型 —— 一个不优雅的变通方案,既增加延迟又增加成本,还丢掉了语言模型无法从图转文中完整恢复的空间信息。
DeepSeek 把 V4-Flash-Vision-Exp 描述为实验性的 —— 「Exp」这个标识意味着,未经独立验证不建议用于生产关键工作流 —— 但架构上的增补足够实质,值得做技术分析;而开放权重的发布,意味着开发者可以直接检视并复现这套实现。
延伸阅读:DeepSeek 给 V4 Flash 加上视觉能力,多模态智能体分数逼近 Opus 4.8
三处骨干改动,而不是一处
V4-Flash-0731(纯文本)与 V4-Flash-Vision-Exp 之间的架构差距,比「加了个视觉编码器」这种惯常说法所暗示的要宽。给语言模型加装视觉的标准做法,是在输入端挂一个图像编码器,把视觉特征转成 token,直接送进已有的语言模型层。这种做法不需要改动 V4 Flash 的核心 transformer,但它也会失败 —— 因为 V4 Flash 的稀疏注意力机制,并没有被设计成能像处理文本那样处理图像跨段的 token。
Vision-Exp 这次发布对 V4 Flash 骨干做了三处不同的改动,全都能在Hugging Face上开放的推理代码里看到。
第一处改动是视觉前端本身。一个 32 层的 Vision Transformer 先把输入图像切成 14×14 像素的图块,把每个图块转成向量,再跑 32 层自注意力,构建出各区域之间空间关系的表示。这个 ViT 有 411842560 个参数,规模与 SigLIP-400M 相当 —— 后者是若干当代多模态模型采用的视觉编码器。
接着由一个 Aligner 网络把 ViT 的输出转成语言模型能吃进去的形式。Aligner 施加空间池化,把相邻的九个 ViT token(一个 3×3 块)合并成一个输出 token,并把它从 ViT 的 9216 维表示映射到 V4 Flash 的 4096 维。这个九合一压缩有一个直接后果:无论原始图像分辨率多高,每张图最多产生 384 个语言模型空间中的视觉 token。四个特殊 token —— IMAGE_START、IMAGE_END、IMAGE_NEWLINE 和 IMAGE_PAD —— 在提示词序列里把这些视觉 token 括起来并加以组织。视觉前端为 V4 Flash 基座增加了约 4.66 亿参数。
第二处改动解决的是长图像跨段与 V4 Flash 滑动窗口注意力之间的一个根本性不兼容。V4 Flash 使用 DeepSeek 稀疏注意力(DFlash),它把大多数文本 token 限制为只关注周围约 128 个 token 的局部窗口,从而大幅降低长上下文的注意力计算量。但一张被切成 384 个 token 的图像,跨度是那个窗口的三倍 —— 在原始的 DFlash 配置下,同一张图内不同位置的图像 token 无法充分互相关注,模型的视觉表示因此被割裂。
Vision-Exp 引入了一对函数 —— get_image_visible() 和 get_window_topk_idxs_visible() —— 它们检测 IMAGE_START 与 IMAGE_END 边界,并为同一张图跨段内的所有 token 动态扩大可见范围。图像区域之外的文本 token 继续使用原来的 128 token 窗口,只有属于同一张图的 token 才获得扩展后的范围。这不是一处无关紧要的适配:它需要在运行时识别图像跨段的边界、在注意力内核里实现图像感知的可见性逻辑,并确保这项改动不会改变文本骨干在既有负载上的行为。
第三处改动影响的是模型的专家混合路由器如何把 token 分派给专家。V4 Flash 的前三层 transformer 对文本使用哈希路由:每个 token 的专家分派,由一张以其 token ID 为键的静态查找表决定。这产生的是快速、确定性的路由,对身份稳定的词表 token 效果很好。而图像 token 没有标准的词表 ID —— 它们是 Aligner 的输出,不是词表嵌入 —— 所以哈希路由对它们不适用。
对图像 token,Vision-Exp 改用基于内容的动态打分:门控网络评估每个 token 的内容并给出分数,据此决定由哪些专家来处理。一组学习得到的偏置分数(在推理代码里写作 bias_vl)会调整 256 个专家中哪些更可能被选中来处理视觉内容。文本 token 和图像 token 最终路由进的是同一个 256 专家池;不同的是路由机制随输入类型而变,而不是专家本身有两套。
384 token 的图像上限是一个经济设计选择,不只是一道约束
DeepSeek 把图像上限定在 384 个语言模型 token,这个架构选择值得从经济而不只是技术角度审视。这个上限是 Aligner 那个 3×3 空间池化的直接后果:九个 ViT 图块收敛成一个 LLM token,因此一张被填满的图占据 384 个槽位。按 V4 Flash 公布的非高峰输入定价每百万 token 0.22 美元计,一张 384 token 的图约合 0.000085 美元 —— 不到一美分的万分之一。
对那一类推动开发者在 V4 Flash 上索要视觉能力的工作流来说 —— 周期性截图的 UI 自动化、检查终端输出或错误对话框的编程智能体、需要解析图表图片的文档分析流水线 —— 这套定价结构意义重大。它意味着视觉感知在工作流里成了一个接近零成本的环节,而不是一项必须定量配给的高价功能。一条每十秒截一次图、跑满一小时自主编程会话的流水线会处理 360 张图;按非高峰费率算,全部视觉算力成本不到四美分。
代价是保真度。一张 5000×5000 像素的照片和一张 500×500 像素的照片,在这个设计下产生的是同一个计费事件 —— 两者都被封顶在 384 个 token,收费相同。高细节的视觉任务 —— 读一份密集医疗文件里的小字、解读标注细小的地图、分析高分辨率卫星影像 —— 可能超出 384 个 token 所能表示的范围。DeepSeek 的文档没有说明,当图像经过 Aligner 池化后所需的空间细节超过 384 token 时模型如何处理;模型卡把这个数字描述为 token 数的上界,而不是对高复杂度视觉输入表示完整性的保证。
基准结果:Vision-Exp 在哪儿领先,在哪儿落后
DeepSeek 公布了一张基准对比表,把 V4-Flash-Vision-Exp 与 V4-Flash-0731(其纯文本前身)和 Claude Opus 4.8 相比。所有数字均为公司自报,由 DeepSeek 自家的 Harness 框架在最大推理强度、temperature 1.0、top_p 0.95 的设置下产出。用于该评测的 DeepSeek Harness 0.1.1 与模型同日发布,这意味着发布当时不可能做独立复现。
在七项文本智能体基准上,Vision-Exp 相对 V4-Flash-0731 在其中六项上有提升。DeepSWE(59.3 对 54.4)和 Toolathlon-Verified(75.9 对 70.3)上的增益最有意义,因为这两项分别测的是真实世界的智能体编程与工具使用。Cybergym 略有下滑(75.3 对 76.7)。DeepSeek 的说法 —— 视觉变体「在纯文本智能体任务上保持了可比的表现」—— 就已公布的数字而言是准确的。NL2Repo(57.7 对 54.2)和 DSBench-Hard(63.6 对 59.6)上的提升幅度不大,但方向一致。
在四项多模态智能体基准上 —— 那里 V4-Flash-0731 本无视觉能力,其数字代表的是模型直接忽略图像内容时的表现 —— Vision-Exp 拿出了它最强的主张。ApexBench Pass@1 从 26.2(忽略图像的纯文本 Flash)升到 36.5;Opus 4.8 的数字是 39.4。在 Agents' Last Exam 上,Vision-Exp 得 27.3,对 V4-Flash-0731 的纯文本基线 25.2 和 Opus 4.8 的 25.7。ZeroBench Pass@5 上 Vision-Exp 是 35.0,Opus 4.8 是 34.0。图表阅读基准 Chartography 上,Vision-Exp 64.3,Opus 4.8 65.0。
把这些数字当成竞争结论之前,有两点必须先说。第一,Anthropic 发布了 Claude Opus 5,时间是 2026 年 7 月 24 日 —— 正如 TheNextWeb 在报道 Vision-Exp 发布时所指出的,它在编程与智能体任务上比 Opus 4.8 更强。DeepSeek 对标的是 Opus 4.8,该模型仍在完整支持和活跃状态,但它已不是 Anthropic 的旗舰。公布的表格里没有 Opus 5 这一列,也没有任何独立评测方发布过 Vision-Exp 与 Opus 5 的直接对比。第二,Vision-Exp 领先 Opus 4.8 的那些多模态基准(Agents' Last Exam 和 ZeroBench),与 Opus 4.8 领先的那些(ApexBench 和 Chartography)并不是同一批评测。对这几项特定基准而言,准确的说法是「接近 Opus 4.8」—— 不是「击败 Opus 4.8」,也不是「在所有任务上追平 Opus 4.8」。
在纯文本基准上,NL2Repo 的差距最大:Vision-Exp 57.7 对 Opus 4.8 的 69.7 —— 相差 12 分。DSBench-Hard 上同方向差 8 分。这些正是「Anthropic 的 Opus 4.8 这类专门化编程助手」与「DeepSeek 的通用型 Flash 模型」之间能力差异最明显的任务。
它在多模态竞争版图里的位置
一个原生多模态、开放权重、按 V4 Flash 价格出售的模型的发布,改变了开发者构建视觉能力智能体系统时的决策矩阵。8 月 21 日之前,预算型多模态这一档主要由两类构成:达不到 V4 Flash 文本智能体能力的较小开源模型(LLaVA 各变体、Qwen-VL、InternVL),或者价格显著更高的托管商业 API。
Google 的 Gemini 2.5 Pro 支持视觉,上下文窗口同样很大,定价也有竞争力,但不提供开放权重。OpenAI 的 GPT-4o 支持图像,上下文 128K,输入价格约为每百万 token 2.50 美元 —— 大约是 V4 Flash Vision Exp 非高峰费率的十一倍。Anthropic 的 Claude Opus 4.8 是主要的对标基准,非缓存输入每百万 token 5 美元,就原始输入价格而言约为 V4 Flash Vision Exp 非高峰费率的 23 倍 —— 不过 Opus 4.8 也支持丰富得多的视觉能力,没有 DeepSeek 那道 384 token 的天花板。
V4 Flash Vision Exp 架构通过大多数智能体框架已经支持的标准 OpenAI ChatCompletions API 格式运行,同时也提供 Anthropic 的 Messages 格式。DeepSeek 的 Harness 0.1.1 在发布当天就加入了对该模型的显式支持,DSH、DeepChat 和 OpenCode 等几款编程智能体工具在发布后头几天内完成了兼容。已经在用 V4 Flash 跑文本工作流的开发者,只需把模型标识符改成 deepseek-v4-flash-vision-exp,并调整提示词以传入图像内容,即可扩展到视觉 —— 不需要额外更改 API 凭据。
自托管 MIT 许可的 Hugging Face 权重,可通过 SGLang 和 vLLM 实现,推理 README 记录了张量并行的权重转换(推荐 TP4)。对于拥有本地 GPU 基础设施、且隐私要求禁止把数据经由 DeepSeek 托管 API 路由的机构,开放权重这条路径提供的是同一个模型,且不受任何数据管辖权约束。
基准表格没有反映出来的那些限制
有几类限制在 DeepSeek 的官方发布材料里是缺席的。
这个模型被明确标为实验性。DeepSeek 没有说明「Exp」标识何时或是否会被摘掉,也没有说明该模型会不会毕业进入稳定的 deepseek-v4-flash 端点。在 V4 Flash Vision Exp 上搭建生产系统的团队,所依托的是一个可能在缺少正式可用端点通常所带的那种通知期的情况下,就发生变更或被弃用的 API 端点。
视觉幻觉率 —— 模型多大频率会对图像内容生成错误描述 —— 尚未有针对 Vision-Exp 的独立刻画。视觉语言模型这个领域整体上有充分记录的幻觉问题,而一个刚发布、还没有独立评测记录的模型,在高风险的视觉解读任务上值得抱以有节制的采用预期。
384 token 的上限按设计就会对高细节图像产生有损的表示。需要对密集文本做精确 OCR、细粒度医学影像解读,或高分辨率工程图纸分析的任务,在假定 V4 Flash Vision Exp 能充分替代没有这道天花板的模型之前,可能需要谨慎验证。
不支持视频、音频和 PDF 输入。与原生接受视频帧的 Google Gemini 不同,V4 Flash Vision Exp 是静态图像模型 —— 可以把单帧抽出来作为图像序列提交,但当前发布中没有记录也不支持原生的视频处理。
最后,截至本文发布,独立的基准复现尚未发生。所有已公布的基准评测都是由公司自家的 Harness 框架跑出来的。虽然 DeepSeek Harness 是开源且开发者可用的,但外部实验室在自己的基础设施上跑同样评测的结果尚未公布。DeepSeek 在这一点上的过往记录有参考价值:对 V4-Pro 的 DeepSWE 表现所做的独立测量,曾与厂商自报数字出现相当大的分歧,主要源自验证器严格程度的差异。
开放权重改变了部署这笔账
开放权重的发布,把这次上线与 Anthropic、OpenAI、Google 的同类公告区分开来 —— 那三家都不发布模型权重。MIT 许可对商业部署、微调和再分发不设任何限制。对于既需要多模态智能体能力、又倾向自己掌控推理基础设施、并且身处「数据不得经由外部服务器」的受监管环境中的开发者来说,V4 Flash Vision Exp 目前是唯一同时满足这三个条件的准前沿选项。
Hugging Face 上的推理代码 —— 覆盖 ViT、Aligner、DFlash 注意力、带 Hyper-Connections 的 MoE,以及 DSpark 投机解码 —— 被明确描述为一份可读的参考实现,而非生产级服务引擎。这是一次有实质意义的架构披露:开发者可以精确审计那三处骨干改动是怎么工作的,把开放实现与托管 API 做行为一致性的对照,并在这份参考之上构建优化过的服务代码。
现实的约束是硬件。跑完整模型需要约 168 GB 存储来放已发布的权重;一次完整的 BF16 推理部署,在张量并行集群上要吃掉多得多的显存。FP4 量化检查点 —— 在转换脚本里通过 --expert-dtype fp4 支持 —— 能把四路张量并行部署的这个需求显著降下来。对大多数没有多卡 H100 集群的团队来说,托管 API 仍是入口;开放权重主要服务的是那些拥有规模化私有推理基础设施的机构。
这次发布之后有意义的问题,不是 V4 Flash Vision Exp 在所有视觉任务上是否追平 Claude Opus 4.8 —— 已公布的基准本身就显示它没有。问题在于:以商品化 API 价格提供的、带开放权重和一百万 token 上下文窗口的准前沿多模态智能体能力,会不会改变「哪些团队有能力构建可行的视觉 AI 系统」这个分布。就这个问题而言,384 token 的图像上限和每百万 token 0.22 美元的价目表提示答案是肯定的 —— 附带一句提醒:「Exp」这个标识本身就在说,DeepSeek 自己还没认定这套架构已经定型。