Montage AI — 公开数据集 & Benchmark 调研报告

Montage AI · 2026-07-06

Montage AI — 公开数据集 & Benchmark 调研报告

2026-07-06 | Benchmark 构建与算法迭代参考
基于前期调研确定的内容类型(P0-P1),梳理可公开获取的数据集、评测基准和工具链

一、核心结论

一句话:Montage AI 的 ~20 种剪辑原语中,绝大多数都有可直接使用的公开数据集和成熟 benchmark。最大的空白在 UGC 广告素材电商视频 领域 — 需要自建数据集。

三个关键发现


二、按核心能力分类的数据集全景

2.1 场景检测 / 镜头边界检测 (Shot Boundary Detection)

对应内容类型:所有类型(基础能力)

数据集规模标注内容获取方式备注
ClipShots128,636 个镜头转场,4,039 视频硬切、渐变、溶解等转场类型GitHub 公开学术界最广泛使用
BBC Planet Earth~11h 纪录片逐帧镜头边界标注需联系 BBC R&D高质量标注,但获取有门槛
RAI Dataset14 段新闻/电影视频镜头切换标注TRECVID 社区公开意大利国家广播数据
IACC.3 (TRECVID)~600h 互联网视频多任务标注含镜头边界NIST 申请下载TRECVID 评测系列标准数据集
MovieNet1,100+ 电影,60K+ trailer场景边界、关键帧、角色movienet.site 公开电影级全方位标注

推荐工具/预训练模型

Benchmark 建议:用 ClipShots 做主基准,MovieNet 做电影/长视频场景测试。指标:F1 Score、召回率、精确率。


2.2 视频高光检测 / 精彩片段提取

对应内容类型:游戏直播切片 (P1)、YouTube 长视频 (P1)、播客切片

数据集规模标注内容获取方式备注
QVHighlights10,310 个 YouTube 视频自然语言查询 → 高光时刻 + 显著性分数GitHub 公开查询驱动的高光检测,与 Agent 场景最匹配
YouTube Highlights6 类内容(冲浪/滑板/体操等),433 视频领域专家标注的高光片段学术申请按品类的高光检测
TVSum50 个 YouTube 视频,10 类逐帧重要性评分(20 标注者)GitHub 公开视频摘要标准 benchmark
SumMe25 个用户视频多人标注的摘要片段ETH Zürich 公开经典视频摘要数据集
ActivityNet Captions20K YouTube 视频,100K 段落时序事件描述、时间戳ActivityNet 公开大规模时序定位
Ego4D3,670h 第一人称视频多任务标注(瞬间检测、摘要等)Meta Research 申请Meta 发布的超大规模第一人称视频

游戏领域特定数据

Benchmark 建议:QVHighlights 做查询驱动高光检测的主基准(最接近"用户说要什么"的场景),TVSum/SumMe 做通用视频摘要基准。指标:mAP、HIT@1、Kendall τ(与人类排序的相关性)。


2.3 语音识别 / ASR (自动字幕生成)

对应内容类型:所有类型(基础能力)

数据集规模语言获取方式备注
LibriSpeech1,000h 英语有声书英语OpenSLR 公开ASR 标准 benchmark,clean/other 分档
GigaSpeech10,000h 有声书/播客/YouTube英语GitHub 公开大规模多场景
Common Voice (Mozilla)30,000h+,120+ 语言多语言commonvoice.mozilla.org 公开最大众包语音数据集
WenetSpeech10,000h+ 中文中文GitHub 公开中文 ASR 最大公开数据集
AISHELL 系列AISHELL-1: 170h, AISHELL-2: 1000h中文部分公开中文语音识别标准
VoxPopuli400K+h 欧洲议会录音23 种欧洲语言GitHub 公开多语言 ASR
SPGISpeech5,000h 金融财报会议英语学术申请专业场景 ASR
MLS (Multilingual LibriSpeech)50,000h+8 种语言OpenSLR 公开多语言大规模
Whisper 训练集 (弱标注)680,000h 互联网音频多语言不公开(模型公开)OpenAI Whisper 训练数据

推荐工具/预训练模型

Benchmark 建议:英语用 LibriSpeech test-clean/test-other,中文用 AISHELL-1 test。指标:WER (Word Error Rate) / CER (Character Error Rate)。


2.4 口水词 / 填充词检测 (Filler Word Detection)

对应内容类型:播客视频化 (P0)、知识付费/教程 (P1)、YouTube 长视频 (P1)

数据集规模标注内容获取方式备注
Switchboard Corpus2,400 段电话对话(~260h)语言不流畅标注(um, uh, 重复、修正)LDC 付费 ($)语言学标准语料
Fisher Corpus11,699 段对话(~2000h)自发语音转录含不流畅标注LDC 付费Switchboard 的扩展版
Santa Barbara Corpus60h 日常对话精细转录含犹豫/停顿UCSB 公开学术研究用
DISFLUENCY (Lickley et al.)学术规模英语语言不流畅分类标注学术论文附带细粒度不流畅分类
PodcastFillers社区构建播客中的填充词时间戳GitHub 散布非标准但贴合场景

中文口水词数据

替代方案:用 ASR + 规则检测

Benchmark 建议:Switchboard 上的 Disfluency Detection 任务是学术标准。自建评测集:从 YouTube/播客采样 100 段 2 分钟片段,人工标注口水词时间戳。指标:Precision/Recall/F1(按时间窗口匹配)。


2.5 音乐 / 节拍检测 (Beat Tracking & Music Analysis)

对应内容类型:快节奏卡点风格、音乐 MV 混剪、电商视频 BGM

数据集规模标注内容获取方式备注
GTZAN1,000 首歌 × 10 流派流派分类、节拍公开音乐分类经典 benchmark
Ballroom Dataset698 首舞曲BPM、节拍位置ISMIR 公开节拍检测标准
SMC Dataset288 首多流派节拍和下拍标注公开复杂节奏挑战集
RWC Music Database315 首,多体裁节拍、和弦、结构学术申请日本产的高质量标注
MUSDB18150 首完整歌曲多轨分离(人声/鼓/贝斯/其他)Zenodo 公开音源分离标准数据集
FMA (Free Music Archive)106,574 首歌流派、标签、音频特征GitHub 公开超大规模免费音乐
MTG-Jamendo55,000+ 首歌情绪、流派、乐器标签MTG CC 许可公开商用友好许可
MusicCaps (Google)5,521 段 YouTube 音乐自然语言描述 + 标签Kaggle/GitHub 公开音乐理解/检索

推荐工具/预训练模型

Benchmark 建议:Ballroom + SMC 做节拍检测基准。FMA/MTG-Jamendo 做 BGM 情绪匹配基准。指标:F-measure(节拍准确率,±70ms 容忍窗口)、P-score、AMLt。


2.6 视频理解 / 内容分类

对应内容类型:所有类型(Agent 理解素材的基础)

数据集规模标注内容获取方式备注
Kinetics-700650K 视频片段700 类人体动作DeepMind 公开视频理解核心 benchmark
Something-Something V2220K 视频174 类物体交互动作Qualcomm 申请因果/时序理解
Moments in Time1M 3 秒视频339 类动词标签MIT 公开超大规模
HowTo100M136M 视频片段,1.22M YouTube 视频ASR 字幕 + 视觉对齐GitHub 公开教程视频理解
YouCook22,000 YouTube 烹饪视频分步骤标注 + 文字描述YouCook 公开美食/教程类
Charades9,848 个家庭活动视频157 类动作 + 时序标注Allen AI 公开日常活动理解
Video-ChatGPT Benchmark多任务评测视频问答、描述、推理GitHub 公开评测多模态 LLM 的视频理解能力
MVBench4,000 个多类视频20 个细粒度视频理解任务GitHub 公开综合视频理解评测

Benchmark 建议:Kinetics-700 做动作识别基准,HowTo100M 做教程视频理解基准,MVBench 做综合视频理解评测。


2.7 视频字幕 / 描述生成

对应内容类型:所有类型(字幕、标题卡生成)

数据集规模标注内容获取方式备注
MSR-VTT10,000 视频片段每段 20 条描述公开视频描述标准 benchmark
MSVD1,970 YouTube 片段多语言描述公开经典小型 benchmark
VATEX41,269 视频英/中双语描述GitHub 公开双语! 对中文市场关键
ActivityNet Captions20K 视频密集时序字幕ActivityNet 公开时序感知字幕
ViTT8,169 YouTube 教程视频分段标签 + 时间戳Google Research 公开教程视频分段
VideoInstruct-100K100K 视频指令对QA + 描述 + 创意写作GitHub 公开指令跟随训练

Benchmark 建议:MSR-VTT 做字幕生成基准,VATEX 做中英双语基准。指标:BLEU-4、METEOR、CIDEr、ROUGE-L。


2.8 人脸检测 / 追踪(竖屏裁切跟随)

对应内容类型:播客视频化 (P0)、口播讲解、游戏直播切片

数据集规模标注内容获取方式备注
WIDER FACE32,203 张图片,393,703 标注人脸人脸检测框WiderFace 公开人脸检测标准 benchmark
300-VW114 个视频68 点人脸关键点追踪iBUG 公开视频人脸追踪
MOT Challenge多个视频序列多目标追踪框MOTChallenge 公开通用目标追踪(含人物)
VoxCeleb 1/27,000+ 名人,100 万+ 语音片段说话人识别 + 人脸VoxCeleb 公开说话人分离(播客多人场景)

推荐工具


2.9 视频质量评估 (VQA)

对应内容类型:所有类型(成品质量把关)

数据集规模标注内容获取方式备注
LSVQ39,075 真实 UGC 视频MOS 质量分GitHub 公开最大 UGC 视频质量数据集
KoNViD-1k1,200 Flickr 视频MOS 质量分GitHub 公开UGC 视频质量标准 benchmark
YouTube-UGC1,500 YouTube 视频MOS 质量分Google Research 公开YouTube 原生 UGC
LIVE-VQC585 手机拍摄视频差异 MOS 分UT Austin 公开手机拍摄质量评估

推荐工具


2.10 视频编辑专项 (Video Editing Benchmarks) 最新

直接评测 AI 视频编辑能力

数据集/Benchmark规模评测内容获取方式备注
Goku Dataset100 万+ 编辑对指令驱动的视频编辑(风格转换、物体编辑等)论文 2026-06 发布,待 GitHub 公开最新最大的视频编辑数据集
Goku-Bench1,000 人工验证测试样例7 种编辑指标同上视频编辑质量 benchmark
EditBench多任务编辑基准图像/视频编辑质量Google Research 公开编辑保真度评测
LOVEU-RVOSYouTube 视频参考视频对象分割 + 编辑CVPR Workshop 公开视频对象级编辑
InsV2V多样视频对指令驱动的视频编辑GitHub 公开指令→编辑效果对

三、按内容类型交叉映射

哪些数据集服务于哪个 P0/P1 内容类型? = 直接适用,⚠️ = 间接适用

数据集播客视频化UGC 广告电商商品YouTube 长视频知识付费/教程游戏切片
LibriSpeech/GigaSpeech (ASR)⚠️⚠️⚠️
WenetSpeech/AISHELL (中文 ASR)⚠️⚠️⚠️
VoxCeleb (说话人)⚠️⚠️
Switchboard (口水词)
ClipShots/MovieNet (场景)⚠️⚠️⚠️⚠️
QVHighlights/TVSum (高光)⚠️⚠️
MUSDB18/Ballroom (音乐)⚠️⚠️
MTG-Jamendo/FMA (BGM)⚠️⚠️⚠️
WIDER FACE/300-VW (人脸)⚠️⚠️⚠️
HowTo100M/YouCook2 (教程)⚠️
VATEX/MSR-VTT (字幕)⚠️⚠️⚠️⚠️
Kinetics-700 (动作)⚠️⚠️⚠️
LSVQ/KoNViD (质量)⚠️⚠️⚠️

四、数据空白分析 & 自建数据计划

4.1 完全空白(无公开数据集)

内容类型缺失能力自建方案成本估算
UGC 广告素材Hook-Demo-CTA 结构检测、广告效果预测从 Meta Ad Library / TikTok Creative Center 采集公开广告素材,人工标注结构500 条 × ¥5/条 = ¥2,500
电商商品视频商品卖点提取、多角度剪切模式从抖音/小红书爬取公开电商视频,标注卖点/结构500 条 × ¥5/条 = ¥2,500
Retention Editing 风格jump cut 节奏、zoom 时机、SFX 插入点从 YouTube 头部创作者视频采集,标注编辑手法时间轴100 条 × ¥30/条 = ¥3,000

4.2 部分可用(需业务数据补充)

能力现有公开数据缺失部分补充方案
中文口水词检测HKUST/MTS(小规模)大规模标注、播客/教程场景Whisper 转录 + 规则标注 → 人工校验 100h
播客多人切换VoxCeleb(名人)真实播客的自然对话切换采集 CC 许可播客 50 期,标注说话人切换
游戏高光检测YouTube Highlights(非游戏)FPS/MOBA 特定的高光标准从 Twitch 采集公开 VOD,标注高光时间戳

4.3 Waitlist 数据收集策略

结合 Waitlist 的第 8 道开放题(用户输入编辑意图),可以构建:

  1. 意图理解训练集 — 用户自然语言指令 → Agent 理解的结构化参数
  2. 真实素材样本 — 邀请 Beta 用户上传素材(获得授权),构建私有评测集
  3. 人工偏好数据 — A/B 对比两种剪辑风格,让用户投票,构建 RLHF 数据

五、推荐 Benchmark 体系设计

5.1 分层 Benchmark

层级评测目标数据集指标频率
L0 — 基础能力场景检测ClipShotsF1 > 0.95每次模型更新
ASR 准确率LibriSpeech / AISHELL-1WER < 5% (en) / CER < 5% (zh)每次模型更新
节拍检测BallroomF1 > 0.90 (±70ms)每次更新
人脸追踪300-VWNME < 4.0每次更新
L1 — 组合能力高光提取QVHighlightsmAP > 0.35每周
口水词去除自建 100 段F1 > 0.85每周
视频摘要TVSumKendall τ > 0.10每周
L2 — 端到端全自动剪辑质量自建 50 条(人工评分 1-5)MOS > 3.5每两周
意图理解准确率自建 200 条意图Accuracy > 0.80每两周
用户满意度Beta 用户反馈NPS > 40每月

5.2 自动化评测流程

`

  1. CI 触发 → 自动跑 L0 基础能力 benchmark
  2. 通过后 → 跑 L1 组合能力 benchmark
  3. 通过后 → 部署到 staging → 跑 L2 端到端评测
  4. 人工审核 L2 结果 → 决定是否发布

`


六、完整获取清单(按优先级)

立即可下载(免费,无申请)

  1. ClipShots — 场景检测 → git clone
  2. TVSum / SumMe — 视频摘要 → git clone
  3. QVHighlights — 查询驱动高光 → git clone
  4. LibriSpeech — 英文 ASR → wget
  5. Common Voice — 多语言 ASR → 网站下载
  6. WenetSpeech — 中文 ASR → git clone
  7. MUSDB18 — 音源分离 → Zenodo 下载
  8. FMA — 音乐分析 → git clone
  9. MTG-Jamendo — BGM 情绪匹配 → 下载
  10. MusicCaps — 音乐描述 → Kaggle
  11. WIDER FACE — 人脸检测 → 网站下载
  12. MSR-VTT — 视频字幕 → 下载
  13. VATEX — 中英字幕 → 网站下载
  14. HowTo100M — 教程视频 → git clone
  15. LSVQ — 视频质量 → git clone
  16. Kinetics-700 — 动作理解 → 下载
  17. MovieNet — 电影理解 → 网站下载
  18. PySceneDetect — 场景检测工具 → pip install
  19. TransNet V2 — 镜头检测模型 → git clone
  20. madmom — 节拍检测 → pip install
  21. Demucs — 音源分离 → pip install
  22. MediaPipe — 人脸追踪 → pip install

需要申请(免费但有流程)

  1. Switchboard — 口水词/不流畅 → LDC 学术许可
  2. Ego4D — 第一人称视频 → Meta Research 申请
  3. Something-Something V2 — 视频理解 → 申请
  4. IACC.3 (TRECVID) — 镜头边界 → NIST 申请

需要自建

  1. UGC 广告素材结构标注 (~500 条, ¥2,500)
  2. 电商商品视频结构标注 (~500 条, ¥2,500)
  3. 中文口水词标注 (~100h, ¥5,000)
  4. Retention Editing 手法标注 (~100 条, ¥3,000)
  5. 端到端剪辑质量评测集 (~50 条, ¥2,000)

自建总预算:约 ¥15,000


七、下一步行动

时间行动产出
本周下载 L0 基础能力数据集(ClipShots, LibriSpeech, AISHELL, Ballroom)数据就绪,可开始跑基准
本周集成 TransNet V2 + Whisper + madmom三大基础能力 Pipeline
下周下载 L1 数据集(QVHighlights, TVSum, MUSDB18)高光/摘要/音乐分析评测就绪
下周采集 50 条 UGC 广告素材 + 50 条电商视频自建数据集 V0.1
2 周内搭建自动化 benchmark CI 流程每次代码提交自动跑 L0
1 个月完成全部自建数据标注自建数据集 V1.0,覆盖所有 P0 场景

调研数据截至 2026-07-06,基于公开论文、GitHub 仓库和数据集网站。数据集可用性可能变化。