LAION 开放 8000 万条视频档案,冲击多模态训练数据的瓶颈
开放的 BVD 语料库覆盖 8000 万条视频,在标准基准上胜过 InternVid

曾以五十亿张图像的数据集推动图像模型训练民主化的德国非营利组织 LAION,今天发布了一份试图在视频上复刻同一壮举的资源:Big Video Dataset(BVD)—— 一个可公开获取的语料库,包含 8000 万条已下载视频,总时长 1000 万小时。这次发布出现在这样一个时点:前沿的视频生成与视频理解模型越来越依赖学术研究者根本无法复制的巨型私有训练流水线 —— 而 BVD 直指这个缺口。
这个数据集由从CommonCrawl网络档案中提取的 13 亿条视频 URL 构建而成,随附一份arXiv 预印本,作者是一支十二人团队,来自图宾根 AI 中心、马克斯·普朗克智能系统研究所、于利希超算中心、ELLIS 图宾根研究所以及 LAION 自身。作者中包括欧洲机器学习研究的两位重要人物 Bernhard Schölkopf 和 Matthias Bethge。数据集与配套处理代码现已按一份明确禁止商业使用的「仅限研究」许可发布。
为什么开放视频数据一直是那个约束性瓶颈
对多模态 AI —— 联合理解视频、音频与文本的模型 —— 而言,最要命的稀缺一直不是算力。云 GPU 已变得越来越便宜,Open-Sora 2.0 项目就是明证:它以约 20 万美元训练出了商业品质的视频生成模型。更难的问题是数据。生产 Sora 或 Runway Gen-3 这类系统的实验室,依赖的是通过授权协议或内部数据流水线建起的巨型专有视频语料库,外部研究者无从接触。结果是一种结构性的不对称:少数资金雄厚的机构之外,研究者只能使用比前沿模型内部所用小一个数量级的开放视频数据集。
此前这个领域的开放标杆是 InternVid,由上海人工智能实验室 OpenGVLab 团队于 2023 年发表,并在 ICLR 2024 上被选为 spotlight。InternVid 覆盖约 700 万条视频、76 万小时内容,产出 2.34 亿个带标注片段。这些数字相对此前已有的资源是一次实质飞跃。但 76 万小时仍比 BVD 的 1000 万小时小约 13 倍 —— 而且 InternVid 只覆盖视频和文本,不含音频。InternVid 论文确立了此前的标杆,而 BVD 如今在规模上显著超越了它。
LAION 是怎么攒出 1000 万小时的
BVD 的流水线走四个主要阶段。从 CommonCrawl 快照中收割的 13 亿条平台专属视频 URL 出发,团队成功下载了 8000 万条视频 —— 这个完成率既反映可得性也反映筛选。从这些视频中,内容感知的场景检测识别出视觉与时间边界,提取出 5500 万个片段。这个做法很关键:按固定时长切分视频会横跨场景转换,产出的片段里视觉内容与任何相关描述分属两个不同场景。而场景感知的切分产出的片段内容自洽 —— 那才是训练视频-文本对比模型的正确单元。
这 5500 万个片段随后接受两层不同的合成标注。视频字幕由一个视觉-语言模型自动生成,描述每个片段的视觉内容。音频字幕则从音轨单独生成,产出与 CLAP(对比语言-音频预训练,用于训练音频-文本检索模型的框架)兼容的描述。正是这种双字幕做法,让 BVD 能以同一份底层语料同时充当视频-语言和音频-语言模型的训练数据。
第三种模态来自抽帧。团队在场景切换边界处抽取了 3 亿张静态图像,产出可用于训练 CLIP 类图文模型的图文对。这些帧来自真实世界的视频,而非主导网络图像数据集的那类经过策展的摄影作品,因而具有独特的视觉分布 —— 作者称其与既有的图像预训练来源形成互补。
目前没有任何可比的开放语料库能在这个规模上、从统一来源同时提供三种模态(视频、音频、图像)。InternVid 提供视频和文本。另一个大型开放数据集 Panda-70M 提供约 7000 万个片段,但没有音频-文本对。BVD 是首个同时覆盖这三种训练目标的开放资源。
基准结果说明了什么,又没说明什么
据LAION-BVD 论文,在 BVD 上训练的 ViCLIP 模型在标准视频-文本基准上比在 InternVid 的 FLT 子集上训练的模型最多高出 2.1 个百分点,且从 1000 万个训练片段增加到 5000 万个时增益保持一致。在 BVD 音频数据上训练的 CLAP 模型,相对其他大规模未策展音频数据集表现有竞争力,且随模型与数据集规模增长呈现有利的缩放趋势。用抽取帧训练的 CLIP 模型在标准基准上取得了不错的图文检索分数。
这些结果需要仔细读。实验由论文作者 —— 也就是构建这个数据集的同一批人 —— 自行运行,而非独立评测方。具体的基准名称和确切的评测条件写在论文全文而非摘要里,而「+2.1 个百分点」代表的是一个区间的上限,出现在片段数更大的训练轮次上。跨训练规模(从 1000 万到 5000 万片段)改进的一致性是一个有意义的正面信号 —— 数据质量中的随机噪声通常会产生不一致的趋势 —— 但在从业者能依据这些数字做生产决策之前,仍需要独立复现。
延伸阅读:新基准显示:前沿视觉语言模型在隐式空间推理上仍然失败
这次发布背后的法律架构
LAION 之所以能构建并发布 BVD,部分依托于德国一系列检验「为非商业研究训练数据抓取受版权保护材料在欧盟法下是否合法」的法院判决。2024 年 9 月,汉堡地方法院驳回了摄影师 Robert Kneschke 对 LAION 提起的停止侵害之诉,认定 LAION 的数据集构建行为落入德国《著作权法》第 60d 条 —— 那是欧盟《数字单一市场指令》第 3 条在德国的国内转化,为科学研究划出了文本与数据挖掘的例外。2025 年 12 月,汉堡高等地方法院就同一案件作出上诉审裁决(案号 5 U 104/24),就 AI 训练与数据挖掘在德国法下的可容许性提供了进一步指引。
LAION 为 BVD 设定的「仅限研究」许可,正是用来把该数据集留在那层法律保护之内的机制。第 3 条下的文本与数据挖掘例外覆盖科学研究,不覆盖商业使用。通过禁止商业应用,LAION 明确是在努力留在这个例外的范围内。至于「下载并再分发一份依该例外编纂的数据集,是否把这层保护延伸给所有下游研究者」,法律学者指出这在欧盟法下仍部分悬而未决 —— 但 LAION 采取的「仅限研究许可 + 明确使用条款」是目前站得住的姿态。
从业者该知道的限制与风险
有几项约束框定了 BVD 实际能提供什么。仅限研究的许可不是技术限制,但它意味着商业 AI 开发者不能合法地把这个数据集纳入生产训练。任何在 BVD 上训练模型、再把该模型商业化部署的机构,都在使用条款之外运作。
全部字幕 —— 视频描述与音频描述 —— 都是合成生成的。论文没有说明用了哪些字幕模型来生成它们,这使得独立评估其质量上限变得困难。合成字幕带着已知的风险:描述中出现幻觉性的视觉内容、无法捕捉领域专有术语,以及可能不反映人工撰写字幕多样性的语言同质化。大规模使用合成字幕训练的模型已表明,这类数据有用,但在高精度检索任务上不等同于人工标注。
LAION 也明确警告,BVD 与其他大规模网络数据集一样,可能包含偏见、刻板印象,以及跨语言、地区和主题的不均衡表征。这是 CommonCrawl 衍生语料库的已知属性 —— 它们反映的是被索引网络的构成,而非任何经过策展的平衡。LAION 此前的旗舰数据集 LAION-5B 曾在 2023 年被暂时下线,起因是斯坦福互联网观察站的一项研究在该语料库中识别出数千张疑似儿童性虐待材料的图像。BVD 在视频内容上面临类似风险,而视频在规模上比静态图像更难审计。LAION 团队尚未公开描述针对 BVD 的视频专项内容审计方法,基于该数据集构建模型的从业者应把这份不确定性计入考量。
这次发布改变了开放 AI 研究的什么
LAION 用 LAION-5B 确立的历史模式很有参考价值。那个数据集 2022 年的发布,使 Stable Diffusion 的训练成为可能,并催化了一个广阔的开放图像生成生态,大幅收窄了专有实验室能产出的东西与学术研究者、独立开发者能复制的东西之间的差距。同样的动力学在视频上尚未上演 —— Sora 这类前沿视频生成系统在质量上仍远领先于开放替代方案 —— 但造成这道差距的结构性原因之一(数据稀缺)刚刚变了。
接下来会变成什么样,取决于研究共同体怎么用 BVD。作者记录的缩放趋势 —— 训练片段从 1000 万增到 5000 万时基准持续改善 —— 意味着单纯用更多这类数据训练仍在起作用,而这正是让一个数据集真正有用、而非一次性基准练习的那种结果。2026 年及以后的问题是:BVD 这个量级的开放数据,加上越来越便宜的算力,能否催生出一代可与 LAION-5B 之于图像相提并论的开放视频理解与视频生成模型。数据这道约束已经被移开了,算力和架构的工作还在。