阿里上线 Qwen3.8-Omni-Flash:音视频智能体 API,百万 token 0.15 美元
这个全模态模型的价格是 Gemini 3.8 Flash 的五分之一,2027 年 1 月后将只有十分之一

阿里巴巴的 Qwen 团队于 2026 年 9 月 18 日上线了 Qwen3.8-Omni-Flash —— 一个在一次 API 调用中同时接收文本、图像、音频和视频,跨这些模态规划任务、自主执行工具调用、并返回文本的多模态模型 —— 每百万输入 token 0.15 美元。这个价格是 Gemini 3.8 Flash 当前推广价的五分之一;而到 2027 年 1 月 1 日、Gemini 3.x Flash 线的推广价翻倍之后,它将不到谷歌 Flash 定价的十分之一。该模型已在 QwenCloud、阿里云 Model Studio 和 Qwen Studio 上线,发布时没有开放权重。
延伸阅读:DeepSeek V4 Flash Vision Exp:以文本模型的价格打开多模态智能体工作流
Qwen3.8-Omni-Flash 不是一个感知模型,而是一个执行模型
阿里强调的这个设计区别值得细看。大多数多模态模型在拿到一段两小时视频和一个问题时,会用同样的方式处理每一帧 —— 线性扫过去,指望相关内容正好落在有效注意力范围内。Qwen3.8-Omni-Flash 走的是另一条路,阿里称之为「智能体式感知」:它从用户的问题出发,判断视频和音频流中的哪些片段值得细看,然后由粗到细地分轮收集证据,而不是用同等分辨率处理整个输入。
在测试模型处理长视频的 OmniVideoBench 上,该公司报告其智能体式做法得分 67.8,而静态处理模式为 63.4,同时消耗的 token 少 45.7%(79,117 对 145,736)。这些数字由厂商自行报告,截至发稿尚未被独立复现,但背后的逻辑是站得住的:有针对性的、由问题驱动的视频阅读,在面对超长内容时比均匀的密集处理更能扩展。
对开发者来说,实际的好处是:同样 100 万 token 的上下文窗口,用来线性处理素材时显得很贵,而当模型学会只把 token 分配给真正能回答问题的那部分素材时,它就变得可用了。
除了理解,模型还能对它发现的内容触发工具。一次 API 调用就可以看完一段会议录像、找出其中做的三项决定、提取出归属到具名发言人的待办事项,并把它们写进任务管理系统 —— 不需要再额外搭一层编排来把这些步骤串起来。思考模式默认开启,推理强度设为最高档(xhigh),对延迟敏感的部署可以关掉。
底层架构:一个激活参数 60 亿的 Qwen4 预览版
Qwen3.8-Omni-Flash 建立在 Qwen3.8-Flash-Next 之上 —— 那是阿里在 2026 年 8 月底发布的实验性开放权重模型,作为它打算用于 Qwen4 的架构的早期预览。
这个底座是一个混合专家模型,总参数约 1250 亿,但每个 token 只激活 60 亿。稀疏激活是有意为之:模型存储的大部分知识位于专家层中,而对任一给定 token,这些层大多不会被调用;这意味着每个 token 的实际计算量相当于跑一个 60 亿参数的稠密模型,同时仍能调用编码在全部 1250 亿参数中的模式知识。正因如此,一个具备接近前沿能力的模型,才可能以每百万 token 0.15 美元的价格做推理。
相比前几代 Qwen,最关键的架构改动是 Qwen 稀疏注意力(QSA):它在微块(micro-block)层级工作,而不是逐 token 工作。相比常规的滑动窗口注意力,这在长上下文上显著降低了延迟 —— 当模型要在一个上下文里处理 45 分钟音频或两小时视频时,这是实打实的收益。门控残差(Gated Residual)机制和 n-gram 嵌入词表构成了其余的架构改动,团队把这些统称为通往 Qwen4 路上的一次「系统性升级」。
在 Flash-Next 这个文本加图像的底座之上,全模态版本加了两个组件:一个视觉编码器和一个专门的音频—文本模块。两者都汇入同一个中央智能体,由它规划动作并调用工具。关键在于,这是端到端的原生架构,而不是一条流水线 —— 模型的注意力层同时看到全部四种模态,而不是接收预先转换好的表示。对于意义同时分布在多个通道上的任务,这个区别很重要,比如说话者的语气与他字面上说的话相矛盾的情形。
有一个限制很显眼:Qwen3.8-Omni-Flash 接收音频和视频作为输入,但只输出文本。需要生成语音的团队必须再串一个文本转语音步骤;阿里自己的文档把需要语音输出的工作流指向 Qwen3.5-Omni。它的上下文窗口也是分项的,而不是一个整数:最多 991,000 个输入 token、最多 131,000 个输出 token,推理轨迹最多 262,000 个 token。
延伸阅读:阿里开源 Qwen4 架构预览版,智能体编程能力超过 Claude Opus
12 月 31 日之后会变样的价格对比
按推广价算,成本账很直白。Qwen3.8-Omni-Flash 的价格是每百万输入 token 0.15 美元、每百万输出 token 0.47 美元,隐式缓存命中按每百万 0.016 美元计费。谷歌于 2026 年 9 月 2 日发布的 Gemini 3.8 Flash 目前在推广价下是每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。也就是说,按今天的价格,Qwen3.8-Omni-Flash 的输入便宜 5 倍,输出便宜约 8 倍。
这个对比没说的是,谷歌的推广价有明确的到期时间。根据谷歌 Cloud Agent Platform 的定价文档,Gemini 3.8 Flash、Gemini 3.7 Flash 和 Gemini 3.6 Flash 都将在 2027 年 1 月 1 日涨价一倍 —— 输入从每百万 0.75 美元涨到 1.50 美元,输出从 3.75 美元涨到 7.50 美元。Qwen3.8-Omni-Flash 在发布时没有声明类似的价格到期。今天拿 Gemini 推广价做成本模型的团队应当注意:三个半月后这个对比会明显改变,两者之间可持续的差距在输入 token 上可能从 5 倍拉开到 10 倍。
换算成具体的运营数字,阿里估计 Qwen3.8-Omni-Flash 上每小时音频输入的成本低于 0.01 美元,带音频的 720p 视频(每秒一帧)每小时内容约 0.20 美元,均不计输出 token。公司称,相比自家前代 Qwen3.5-Omni-Plus,每小时音频成本降低 98%,音视频成本降低 93%。这两个数字都由公司自行报告,未经独立核实。
该模型支持 113 种音频输入语言和方言,可通过 URL 接收最长两小时、最大 2 GB 的视频文件,音频文件最长三小时。它支持双声道立体声和四声道 FOA 空间音频,这对需要对发言人做空间定位的会议分析很有用。API 兼容 DashScope 和 OpenAI 两套协议,后者通过 Chat Completions 和 Responses API 提供。
跑分表说了什么,又没说什么
阿里公布了一张涵盖 29 项评测的跑分表,把 Qwen3.8-Omni-Flash 与 Qwen3.5-Omni-Plus、Gemini 3.8 Flash、Seed 2.0 Lite 和 Muse Spark 1.2 做对比。在这些评测上,公司报告相比 Qwen3.5-Omni-Plus 平均提升超过 25%,其中智能体相关的提升在 WildClawBench-MM 上达到 36.5 分、在 AgenticVBench 上达到 22.3 分,UniClawBench 达到 69.6。所有数字均由厂商自行报告。
如果属实,这些数字相当可观,但有几处方法上的限制,决定了这张表能证明什么。第一,每一行都是阿里用自己的评测设施测出来的,目前还没有独立复现。第二,BenchLM AI 对这组对比的评述指出,阿里在不同基准上用了不同的框架 —— WildClawBench-MM 和 AgenticVBench 用 Claude Code,UniClawBench 用 OpenClaw —— 同时为每个竞品套用了各自的媒体设置(Gemini 3.8 Flash 设为 media_resolution=high,Seed 2.0 Lite 设为 max_frame_tokens=384)。设置不统一,意味着第三方在不知道阿里为每个竞争系统具体用了什么配置的情况下,无法复现这组对比。
第三,在公司声称 Qwen3.8-Omni-Flash 超过 Gemini 3.8 Flash 的音频任务上,值得指出的是:前代 Qwen3.5-Omni-Plus 在口语交互基准上本来就领先 Gemini 3.8 Flash(按 BenchLM 对该评测的呈现是 92.9 对 92.3),这说明音频上的优势并不是这一代才有的。真正新的主张,具体是在智能体式音视频基准上。
在多说话人会议转写方面,阿里报告在 AliMeeting(它自有的会议评测数据集)上有显著改善:说话人分离错误率从 88.11 降到 3.35,拼接词错误率从 89.61 改善到 17.18。
AiCybr 技术分析给出的实际建议很中肯:「发布时独立的基准证据仍然有限,因此以应用层评测作为生产采用的依据才是合适的。」
Qwen-MM-Plugins:把全模态能力装到任意智能体框架上
与模型一同发布的还有两个开源项目,目的是降低那些已经在用现成智能体框架的团队的集成阻力。Qwen-MM-Plugins 以 Apache-2.0 协议发布在 GitHub 上,自我定位是「让任何智能体框架原生支持多模态」。
这套插件架构把每项能力装成一个 Skill 外加一个可选的 MCP 服务器。引导式安装器支持 Claude Code、CodeBuddy、Codex、OpenClaw、Qwen Code 和 Gemini CLI —— 这是有意为之的广度优先策略,不要求团队迁移到 Qwen 自家的技术栈。三项核心能力直接对应发布时宣称的用例:omni-memory 为一段长视频建立持久的音视频记忆;omni-video2note 把教程视频转成带时间戳的图文 PDF;omni-chatcut 负责音乐视频制作、影视解说,以及保留说话人音色的视频翻译 —— 最后这项要求模型识别每位说话人的嗓音特征,再用翻译后的台词重新配音,同时保住原本的音色。
第二个开源项目 Qwen-Live Harness,支持通过接入的摄像头和麦克风做实时交互 —— 让智能体持续作用于实时的视频和音频,而不是上传的文件。这让该系统可以用于常开监控、实时会议辅助,以及与机器人相邻的交互式应用。
README 直接点出了一个现实限制:大多数现有的智能体框架还不能原生地把音频喂给模型。在框架层的音频支持成熟之前,音频是走 API 传入,而不是通过标准的工具调用接口。对只有视频的工作流来说这不算限制,但对音视频结合的智能体来说,这多出了一道路由环节。
Qwen3.8-Omni-Flash 在低价多模态格局中的位置
在这次发布之前,具备音视频能力的 API,其低价档起点是 Gemini Flash 的价格(每百万输入 0.75 美元)。而有开放权重的模型 —— 包括 DeepSeek V4 Flash Vision Exp(MIT 许可证,闲时每百万 0.22 美元)—— 只有视觉能力,不支持音频和原生视频。Qwen3.8-Omni-Flash 的发布,等于为完整的四模态组合开出了一个新的价格档:低于 Gemini Flash 的地板价,而且不必为了处理音频而套上「图像转文本」这类架构上的变通。
代价是没有开放权重。DeepSeek V4 Flash Vision Exp 可以被有本地部署需求的团队自托管在多卡集群上,而 Qwen3.8-Omni-Flash 在发布时只有 API。那些数据管辖要求不允许把音频和视频路由给外部供应商的团队 —— 受监管行业、政府承包商、有欧盟数据驻留要求的机构 —— 不接受这层外部 API 依赖就拿不到这个价格优势。六个可用区域(北京、新加坡、香港、东京、法兰克福和弗吉尼亚)给主要市场的开发者提供了合规的路由选择,但自托管目前还谈不上。
在整个 Qwen 系列上,阿里一直遵循先发布闭源 API 模型、再开源权重版本的模式;关于这次发布的报道提到,该公司已表示计划按照此前 Qwen 版本的惯例把模型开源,但没有给出时间表。
要守住这个市场位置,接下来需要发生什么
有三件事将决定 Qwen3.8-Omni-Flash 在每百万 token 0.15 美元上的竞争位置,是会变成一个持久的市场事实,还是只是一次临时的价格事件。
第一,独立的基准复现。智能体式感知的说法在技术上是自洽的,但还没有任何第三方实验室在受控、可复现的条件下,把 OmniVideoBench、WildClawBench-MM 或 AgenticVBench 的对比在 Gemini 3.8 Flash 上跑一遍。阿里此前公布的跑分在独立审视下总体站得住,但当前这张表里非标准的框架配置,让具体的竞争幅度更难核实。
第二,价格的稳定性问题。阿里没有公布 Qwen3.8-Omni-Flash 的价格复审或推广价时间表。如果每百万 0.15 美元本身就是一个为早期获客而设的促销数字,那么对要做长期基础设施决策的团队来说,成本账可能明显改变 —— 就像 Gemini Flash 在 2027 年 1 月 1 日翻倍会改变 Gemini 那边的账一样。
第三,开放权重。Qwen3.8-Flash-Next 这个底座已经以 qwen-community-1.0 许可证提供,而全模态版本在它之上加了视觉编码器和音频—文本模块。如果阿里把这些权重也放出来,低价多模态自托管的竞争格局会明显改变 —— 尤其对那些认为 DeepSeek V4 Flash Vision 的 384 token 图像上限和缺失的音频支持是掣肘的团队而言。
在那之前,Qwen3.8-Omni-Flash 代表着一个实实在在的进展:它把音视频智能体能力放到了一个足以改变「用它来做东西」这件事的单位经济账的价格点上 —— 前提是你愿意暂且相信厂商自报的跑分,同时等待那场决定这些数字有多少能经得起中立框架检验的独立复现。