开源 APXInf 把 VLA 推理压到 26 毫秒
Rust 引擎在 Jetson Thor 上用 FP8 跑到 38Hz,准确率几乎没掉

2026 年 9 月 14 日,无问芯穹(Infinigence-AI)推送了一个 GitHub 仓库,回答了具身机器人领域一个相对安静的工程难题:怎样让一个十亿参数级的视觉-语言-动作(VLA)模型,在机器人体内的计算模块上跑得快到足以真正控制它。这个项目叫 APXInf,它在英伟达的 Jetson Thor 模块上用 FP8 精度,把 Physical Intelligence 的 π0.5 VLA 模型的推理延迟从约 278 毫秒压到 26 毫秒 —— 压缩十倍以上 —— 而且不需要重训模型,在 LIBERO-10 操作基准上的任务准确率也没有可测量的下降。每秒 38 个周期,这跨过了机器人工程师普遍认为流畅、连续操作所必需的那道门槛。
这次发布来自无问芯穹与清华大学、上海交通大学的合作。无问芯穹是一家总部在北京的 AI 推理创业公司,此前开发过边缘推理引擎 Mizar,据报道已部署在 AI PC 上,随后把它的硬件经验投向了机器人领域。APXInf 实际上是把同一套本事用在一个更苛刻的问题上:一个必须在连续回路中感知、决策、行动的物理系统,容不下云端延迟带来的那些停顿。
把机器人拴在云上的那道部署鸿沟
将近两年来,VLA 模型在研究实验室里能做什么、与它在商用机器人体内能做什么之间的差距,一直是这个行业标志性的约束之一。VLA 模型接收视觉观察 —— 通常是一个或多个机器人搭载相机的图像 —— 以及一条自然语言任务指令,直接输出运动指令。这种架构省掉了传统机器人系统所需的独立感知、规划和控制模块,这让 VLA 模型格外灵活:原则上,同一个模型可以泛化到新物体、新环境和新任务描述,而不必重新编程。
工程上的问题是,在推理时跑这些模型很贵。Physical Intelligence 当前的 VLA 模型 π0.5 运行在数十亿参数的规模上,使用扩散式的策略头,对每一段预测出的动作序列都要多次前向穿过骨干网络。在带独立 GPU 和高带宽显存的桌面级硬件上,推理很快。而在 Jetson 模块上 —— 这是能塞进商用机器人机体的那一类边缘算力 —— 各种约束叠加起来:Jetson Thor 和 Jetson Orin 用的是 LPDDR5 内存,带宽大约只有独立 GPU 里 HBM 的四分之一到八分之一,而且两个模块的功耗包络都比数据中心卡紧五到十倍。在这些约束下,未经优化的 π0.5 一次推理约需 278 毫秒,相当于每秒约 3.6 个周期 —— 连粗略的操作任务都嫌慢,更别提那种让 VLA 演示看起来惊艳的灵巧、有反应的动作。
权宜之计一直是云端推理:机器人采集传感器数据、传给运行模型的云服务器、收回预测的动作、再执行。单是网络传输的往返延迟,通常就要加上 50 到 200 毫秒,取决于网络状况和数据中心的远近。更根本的是,一个把核心决策回路托付给云连接的机器人,会在网络不可用时一同不可用。经济账也放大得很难看:机群里的每台机器人,都需要分配一份专属的推理服务器资源,才能守住延迟预算。
CUDA Graph、FP8 和 Rust:APXInf 怎样把 278 毫秒压成 26 毫秒
APXInf 的提速来自一层层叠加的优化,每一层针对标准推理流水线里一个不同的低效来源。
最基础的手段是 CUDA Graph 捕获。英伟达的 CUDA API 允许开发者把一串 GPU 内核启动记录成一张图,然后在稳态下用一次 CPU 侧调用重放这张图,从而消除 CPU 逐个下发 GPU 操作时累积起来的每内核启动开销。对标准的语言模型推理来说,输入形状不断变化 —— 提示词长度不同、批大小不同 —— 这让 CUDA Graph 捕获很难用上。而边缘上的 VLA 推理有一副不同的面孔:机器人以固定分辨率、固定数量的相机输入运行,批大小固定为一,扩散步数也固定。这些约束让计算图变成静态的,而静态正是 CUDA Graph 所要求的条件。APXInf 在第一次调用时捕获完整的推理图,之后每一个控制周期都重放它,把 CPU 调度开销压到接近于零。
FP8 量化提供了第二级提速,这一级专属于 Jetson Thor。驱动 Jetson Thor 模块的英伟达 Blackwell 架构带有原生 FP8 张量核心,在同一硬件上处理八位浮点运算的吞吐量约为十六位 BF16 的两倍。APXInf 把 FP8 精度施加到 π0.5 模型的权重和激活上,让模型的有效内存占用减半、计算吞吐翻倍,而且不需要重训模型。使用英伟达较老的 Ampere 架构的 Jetson Orin 不含 FP8 张量核心;在 Orin 上,APXInf 改用 INT8 量化,以更低的精度取得另一种但仍然可观的提速。
第三层 —— 单步动作生成 —— 针对的是扩散式策略头里一个结构性的低效。π0.5 通常要经过多个扩散步来生成一段动作序列(全图配置用十步),每一步都要完整前向穿过一次 Transformer 骨干。APXInf 的单步变体把动作视野剪到一步,把每个控制周期的骨干前向次数从十次降到一次。它在 LIBERO-10 上付出的准确率代价小到可以忽略不计,下文有详细数字。
这个运行时本身是用 Rust 写的,而不是 Python 或 C++。Rust 通过编译期的所有权类型系统强制内存安全,消除了在 C 和 C++ 系统里常见的那一类内存破坏缺陷,同时又避免了 Python 运行时那种垃圾回收停顿。对一个延迟尖峰会直接变成物理误差的实时控制回路来说,Rust 内存管理的可预测性是一项运行特性,而不是风格偏好。这份代码把 unsafe 的 Rust 限制在与 CUDA 库对接的外部函数接口边界上,让推理框架主体保持在所有权模型之内。
APXInf 只为目标 GPU 的特定计算能力编译 CUDA 内核 —— Jetson Orin 是 SM87,Jetson Thor 是 SM110 —— 从而避开那些必须在运行时支持多种架构的框架所带来的 JIT 重编译开销。该仓库直接内置了 CUTLASS 和 FlashAttention,因此除了一套装好英伟达驱动和 CUDA 工具包的标准 Linux 之外,没有任何外部框架依赖。构建系统也不需要 Docker。
基准结果:推理更快,任务准确率不变
APXInf 在 LIBERO-10 上报告自己的性能,这是 VLA 研究社群广泛使用的一个仿真机器人操作基准。该基准涵盖十个任务族,每族以固定随机种子评测五十次回放,合计 500 个回合。任务内容是桌面操作 —— 在一个物理仿真器里摆放物体、打开容器、堆叠物品。
作为参照的 π0.5 模型在标准条件下于 LIBERO-10 上取得 92.4% 的任务成功率。APXInf 在 Jetson Thor 上的 FP8 单步配置取得 92.2%,相差 0.2 个百分点。Thor BF16(完整十步、CUDA Graph)取得 92.8%,Orin BF16 取得 92.0%。带来延迟下降的量化和动作剪枝技术,最多只花掉 0.4 个百分点的任务成功率 —— 落在一个 500 回合基准的测量噪声范围之内。
GitHub README 里的延迟数字,测的是批大小为一、两张 224×224 输入图像、十个流步长下的 CUDA Graph 稳态 P50 延迟:Jetson Thor BF16 完整版 72.45 毫秒(13.8Hz);Thor FP8 完整版 41.16 毫秒(24.3Hz);Orin BF16 完整版 165.67 毫秒(6.0Hz)。加上单步剪枝后,Thor BF16 降到 44.05 毫秒(22.7Hz),Thor FP8 降到 26.32 毫秒(38.0Hz)—— 后者就是那个头条数字。作为对比,桌面级 RTX 4090 在 BF16 完整图模式下是 31.38 毫秒(31.9Hz),INT8 单步变体则是 25.99 毫秒(38.5Hz)。
这些结果由公司自行报告,截至发稿尚未被独立复现。LIBERO-10 是一个种子固定的仿真基准,它的结果并不能直接预测在不受控的真实环境中的表现 —— 那里物体多样性、光照变化和接触动力学都与仿真器相差甚远。
为什么云端推理框架填不上这道缺口
部署最广的两个开源 LLM 推理框架 —— vLLM 和 SGLang —— 是为一种根本不同的运行条件优化的。两者都旨在用连续批处理、PagedAttention 和投机解码这类技术,在数据中心硬件上把成百上千个并发请求的吞吐量拉满,让计算成本摊薄到许多用户身上。结果是规模化下极高的每秒 token 数。代价是批大小为一的单样本延迟 —— 这在数据中心语境里无关紧要 —— 并不是它们的设计目标。把 vLLM 或 SGLang 部署在一个 Jetson 模块上去服务单台机器人,得不到 APXInf 那样的延迟表现,因为让这些框架在规模上高效的那些架构选择,恰恰与单流实时控制回路的要求相左。
英伟达的 TensorRT-LLM 更对口一些 —— 它把针对硬件的优化施加到英伟达 GPU 上的 Transformer 推理 —— 但它是为语言模型和视觉语言模型设计的,而不是为带扩散策略头和动作分块输出的 VLA 架构设计的。把 TensorRT-LLM 适配到 π0.5 具体的推理图上,需要既懂模型架构又懂 TensorRT 优化流水线的开发者投入相当可观的工程量。
最接近的公开替代品是 embodied.cpp,由东南大学、南京大学、微软研究院和清华大学智能产业研究院的研究者于 2026 年 7 月发表。与 APXInf 一样,embodied.cpp 是一个 C++ 运行时,瞄准的是闭环控制中具身 AI 推理的特定延迟要求。在 π0.5 上,embodied.cpp 取得 56.85 毫秒的摊薄单步延迟、91% 的 LIBERO 成功率 —— 一个可信的结果,独立证明了 60 毫秒以内的边缘 VLA 推理是可行的。而 APXInf 在同一模型上、在 Jetson Thor FP8 下达到 26.32 毫秒、92.2% 成功率,延迟约低 2.2 倍,准确率还略高一点。
两个项目之间的架构取舍是明摆着的:embodied.cpp 优先考虑跨异构硬件的可移植性 —— Jetson、基于瑞芯微的板子、x86 边缘盒子 —— 而 APXInf 把优化集中在 Jetson 平台上。对一支在 Jetson Thor 上做开发的机器人团队来说,APXInf 目前性能更好;对在非 Jetson 硬件上做开发的团队,embodied.cpp 是更能立刻用上的选项。
解决模型迭代过快问题的智能体工作流
推理提速是 APXInf 这次发布里最一眼可见的成果,但还有第二个组件,随时间推移也许更要紧:一条嵌在仓库里、以 skills/model-port-workflow 形式存在的智能体式模型移植流水线。
2026 年的 VLA 领域,推进速度快过多数推理团队能追踪的节奏。仅在 9 月 14 日到 9 月 22 日这八天里,就有三家公司宣布了五套新的机器人 AI 系统,而 Black Forest Labs 发布了 FLUX 3 Action —— 一个 70 亿参数的新 VLA 架构,带着自己的推理特性。每一个新模型架构,都要求重来一轮内核工程,才能达到 APXInf 为 π0.5 所展示的那种性能:识别模型的计算图、为其特定算子编写或适配 CUDA 内核、跑 Autotune 为部署 GPU 挑出最优内核配置、再对照参考实现验证结果。在一支人手充足的团队里,这个过程要几周;在一家没有专职推理工程团队的机器人公司,它可能干脆就不会发生。
延伸阅读:70 亿参数开源模型登顶 RoboLab-120 机器人榜
APXInf 的智能体流水线把这个过程的大部分自动化了。该工作流用 AI 智能体读取一份 PyTorch 参考实现,生成模型算子及其形状的清单,用 Rust 实现一条静态执行路径,逐算子对照 PyTorch 参考做验证,执行 Autotune 的内核选择流程,并产出文档。人在这个过程中的角色是定义验收标准 —— 移植后的模型必须达到什么准确率和延迟目标 —— 以及审阅产出。内核工程那些步骤由智能体流水线负责。
这个设计反映了对 VLA 领域走向的一个现实判断。为 π0.5 做的推理提速,迟早会被别的团队复现、被做进商用工具链,或者被新硬件取代。对一支机器人团队来说,持久的竞争优势在于:新的模型架构一出现,就能采纳它,而不必把推理栈从头重建。无问芯穹此前为 AI PC 做 Mizar 的经历,让团队直接面对过「在固定边缘硬件上追踪快速迭代的模型家族」这个问题;APXInf 把那份经验延伸进了机器人领域。
APXInf 目前还差在哪里
这个工具才十五天大,它的局限与它的成就同样值得一提。
LIBERO-10 基准虽然在 VLA 社群里是标准,但它完全运行在种子固定的仿真中。它不检验那些分布漂移 —— 当一个训练好的模型遇上表面纹理不同的真实物体、带阴影和反射的真实光照,或者手指会打滑、物体会倾倒、表面并不完全平整的真实接触动力学时,才会出现的那些。目前还没有任何公开数据,显示经 APXInf 加速的 π0.5 推理在不受控环境中的实体机器人上完成操作任务。仿真基准成绩与真实任务可靠性之间的落差,是具身 AI 里长期未解的问题之一;APXInf 并没有弥合它。
硬件支持目前限于英伟达 Jetson Thor、Jetson Orin 和英伟达 RTX 系列桌面 GPU。对 AMD GPU 和国产 AI 加速器(如寒武纪、壁仞)的支持列在项目路线图上,但尚未交付。在非 Jetson 硬件上部署的团队,还得继续用别的框架。
π0.5 之外的模型支持在计划中 —— WallOSS、Llama 和 Qwen3-VL 出现在仓库的路线图条目里 —— 但对这些模型的优化深度,还没有像 π0.5 那样被确立起来。LIBERO-10 的结果专属于 π0.5;其他 VLA 架构的准确率和延迟可能相差甚远。
那条智能体式移植工作流是一项新能力,尚未在生产级机器人环境中被独立验证。它在适配全新的、架构各异的 VLA 模型时是否有效,还有待在规模上被证明。
一份面向实时机器人控制的开源概念验证
APXInf 作为一次开源发布的意义,值得与它的性能数字分开来看。性能数字证明的是:对 π0.5 这一类 VLA 模型,在 Jetson 硬件上实现十倍以上的推理提速是可行的,而所用的技术单拎出来都不算新 —— CUDA Graph 自 CUDA 10 起就有,FP8 张量核心写在 Blackwell 的公开规格里,Rust 用于系统编程也有好些年了。APXInf 贡献的,是把它们整合成一条连贯的、专门为 VLA 边缘推理问题工程化的开源流水线,连同构建系统、API 层和移植工具一起。
对一位正在评估今天要不要尝试 Jetson 上 VLA 部署的机器人工程师来说,APXInf 之外的选择,要么是从零把那套优化工作重做一遍 —— 好几周的工程量 —— 要么是接受云端推理连同它的延迟和连通性依赖。这次开源发布把这道选择题取消了:那条优化过的推理路径可以直接 clone、构建、跑分,不需要一支专职的推理工程团队。
接下来六到十二个月里,具身 AI 这个行业会盯着的问题是:APXInf 在仿真里的收益能否迁移到在生产环境中执行复杂任务的实体机器人上,以及那条智能体式移植流水线是否足够快,能跟上仍在加速的 VLA 领域。如果两点都成立,那么令人印象深刻的 VLA 演示与真正落地的机器人产品之间的基础设施缺口,就会明显收窄。