Karpathy:理解 AI 输出将成瓶颈,四招可缓解
OpenAI 联合创始人推荐 ASD-STE100、图表、HTML 和视频

Andrej Karpathy 是 OpenAI 联合创始人,现为 Anthropic 研究员,10 月 2 日在 X 上发布了四条具体技巧,用来让大语言模型的输出真正易读 —— 他没有把这个问题归结为模型缺陷,而是把它界定为人类消化 AI 生成知识的方式即将遇到的瓶颈。
这条帖子 以一句精确的警告开头:「我们将要花多得多的时间,去理解语言模型的输出。」随着模型越来越强、生成文本越来越快,AI 生成内容的吞吐量增长得比人类阅读能力更快。Karpathy 的论点是,与 AI 协作的首要技能正从提示 —— 让模型产出 —— 转向理解与验证:解析、核对并据以行动于模型已经产出的东西。他列出的四种技巧是对这一转变的实用回答,并构成一条从结构化文本一直到被动观看视频的递进。
为什么大语言模型天生啰嗦
Karpathy 所针对的啰嗦问题不是偶然的。它是前沿模型训练方式的结构性后果。基于人类反馈的强化学习是占主导的后训练对齐方法,它让人类评分者比较成对的输出并指出更偏好哪一个,以此构建模型。评分者始终偏好更长、更详尽的回答,而不是更短的,即便简洁更能服务用户。由这一过程产生的奖励模型,把全面等同于质量。结果是,输出把限定条件、背景和注意事项堆在本可以只有一句话的答案上 —— 不是因为模型对简短答案缺乏信心,而是因为训练信号教会了它越长越好。
实际的缓解办法已经存在 —— 要求简洁的系统提示、API 长度参数、在更短回复上微调的模型 —— 但每一种都有取舍:系统提示是全局约束;长度上限会把回答截断在思路中途;简洁性微调会牺牲细微差别。Karpathy 的技巧不同:它们改变的是输出格式,而不是截断内容,既用上了模型的全部能力,又改变了表达方式。
ASD-STE100:规训 AI 文风的航空航天标准
第一个、也是技术上最具体的技巧,是让大语言模型使用 ASD-STE100 来解释某件事 —— 这是一份由欧洲航空航天与国防工业协会维护的受控语言规范。该项目始于 1979 年,工作组在 1983 年正式成立,当时欧洲航空航天业着手在不同制造商、不同语言和不同培训背景之间,统一航空维修文档。STE100 实施严格的结构规则:程序步骤的句子最长 20 个词,每句只涉及一个主题,优先使用主动语态而不是被动语态,指令使用祈使语气,而不是「建议技术人员应当……」这样的结构。
它对 AI 输出的实际效果清晰可见。关于如何重启网络路由器的一段文字说明,若以典型大语言模型的风格给出 —— 从句嵌套从句 —— 可能长达一个六十词的句子。同样的信息按 STE 原则组织,则产生五个句子,平均每句不到十个词。这些指令不需要解析就能照着做;它们读起来是一连串动作,而不是一段推理。
作为提示约束使用时,STE100 的规则迫使模型去掉那些让大语言模型文字难以跟读的含糊其词、嵌套限定和同义词堆砌的铺陈。Karpathy 指出,他有时会要求「80% 的 STE100」,承认完全遵守并不现实。该标准还把词汇限制在大约 900 个获批词汇内,每个词只有一种允许的含义 —— 这份词表,模型在没有明确获得它的情况下无法执行。ASD 自己的常见问题解答 提醒说,没有任何工具能取代标准本身,并指出,AI 生成的文字可能在结构上看起来与简化技术英语一致,却违反词汇要求。这一技巧会产生明显更干净的输出。它不会产生经过认证的航空航天文档。
超越文字:图表与交互式 HTML 产物
Karpathy 的第二个技巧,是要求画图,而不是文字解释。这个选择反映的是一个基本的认知差异:视觉解析 —— 识别关系、比较大小、跟随空间流向 —— 与对密集文字的语言解码,运作方式不同。对于结构比顺序论证更重要的主题,一张图可以一遍就传达一段文字要读好几遍才能达到的效果。现代大语言模型能够以足够的可靠性生成静态和动态图形,使这种做法可以随需实现。
第三个技巧把同样的逻辑用在文档结构上,而不是视觉上。要求输出「用 HTML」,会让模型从写作文章转向生成网页文档。模型会调用它在网页开发上的训练,生成可导航的文档,带有小节标题、可折叠面板、交互元素和视觉层次。严格说,这是在用模型的代码生成能力,而不是它的文章写作能力 —— 一种模态切换,用空间导航换取线性阅读。Karpathy 在 2026 年 5 月的一条帖子 里描述过这类输出:让模型把回答组织成 HTML,并在浏览器中查看生成的文件 —— 这种文档的生成成本低到可以专门为一个问题定制,然后丢掉,而不必去查阅为另一类读者写的通用文档。那条较早的帖子在认为这种框架有用的从业者中引起了大量互动;10 月 2 日的帖子把它延伸成了一个四项技巧的体系。
视频前沿:3Blue1Brown 风格与 ElevenLabs 旁白
Karpathy 称之为最有前景的技巧,是生成定制的讲解视频。他的具体建议是,要求一段 3Blue1Brown 风格的视频 —— 这是数学家 Grant Sanderson 的 YouTube 频道,以把抽象的数学和计算概念变成空间化、可视化过程的动画而闻名 —— 旁白由 ElevenLabs 生成。他还提到,没有 ElevenLabs API 密钥的用户,可以让模型去找免费的本地替代方案。
它的吸引力是认知负荷降低走到了逻辑的终点。阅读需要主动构建意义;观看一段设计良好、旁白同步的动画,则更接近被动接收。对于涉及变换或多步骤过程的概念,动画能让文字只能描述的东西变得可见。Karpathy 的措辞是「最看好」,而不是「可用于生产」,表明这是一个近期方向,而不是今天就完全可靠的技巧。
目前的能力是真实的,但并不均衡。动画的准确性没有保证,而非常短的视频给复杂主题的细微之处留下的空间有限。这条流程很可能涉及模型分别生成动画代码和旁白,由 ElevenLabs 负责语音合成 —— 与直接的文字回答相比增加了摩擦。正如 RuntimeWire 指出的,Karpathy 的帖子没有报告任何对比结果或可测量的理解度提升;这一建议是从业者的经验之谈,而不是对照研究。
认知负荷阶梯,以及它对 AI 界面设计意味着什么
Karpathy 的四种技巧对应着一条认知投入递减的序列:受约束的文本(为效率而结构化,仍是线性阅读)→ 图表(视觉解析,非线性)→ 交互式 HTML(可导航,由用户主导)→ 视频(被动观看,无需解码)。每一级台阶,都用一部分精确度和信息密度,换取读者一侧更低的处理成本。
更广泛的含义是,AI 界面设计正进入一个阶段:输出的格式与输出的质量同样重要。目前大多数 AI 工具关注的是提示一侧 —— 如何引出更好的模型输出。Karpathy 指向的是消费一侧:既然模型产出的文字已经多于用户能轻松处理的量,下一个设计问题就不是生成,而是理解。用户层面对这个问题的回答,就像他的四种技巧。模型和平台层面的回答,则需要改变训练信号,让简洁和结构清晰像全面性目前这样被一致地奖励 —— 这是一个更根本的改变,目前没有哪家主要实验室宣布过。在这一点改变之前,瓶颈会一直停在 Karpathy 所指出的地方。