Montage AI · 2026-07-06
2026-07-06 | Benchmark 构建与算法迭代参考
基于前期调研确定的内容类型(P0-P1),梳理可公开获取的数据集、评测基准和工具链
一句话:Montage AI 的 ~20 种剪辑原语中,绝大多数都有可直接使用的公开数据集和成熟 benchmark。最大的空白在 UGC 广告素材 和 电商视频 领域 — 需要自建数据集。
三个关键发现:
对应内容类型:所有类型(基础能力)
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| ClipShots | 128,636 个镜头转场,4,039 视频 | 硬切、渐变、溶解等转场类型 | GitHub 公开 | 学术界最广泛使用 |
| BBC Planet Earth | ~11h 纪录片 | 逐帧镜头边界标注 | 需联系 BBC R&D | 高质量标注,但获取有门槛 |
| RAI Dataset | 14 段新闻/电影视频 | 镜头切换标注 | TRECVID 社区公开 | 意大利国家广播数据 |
| IACC.3 (TRECVID) | ~600h 互联网视频 | 多任务标注含镜头边界 | NIST 申请下载 | TRECVID 评测系列标准数据集 |
| MovieNet | 1,100+ 电影,60K+ trailer | 场景边界、关键帧、角色 | movienet.site 公开 | 电影级全方位标注 |
推荐工具/预训练模型:
Benchmark 建议:用 ClipShots 做主基准,MovieNet 做电影/长视频场景测试。指标:F1 Score、召回率、精确率。
对应内容类型:游戏直播切片 (P1)、YouTube 长视频 (P1)、播客切片
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| QVHighlights | 10,310 个 YouTube 视频 | 自然语言查询 → 高光时刻 + 显著性分数 | GitHub 公开 | 查询驱动的高光检测,与 Agent 场景最匹配 |
| YouTube Highlights | 6 类内容(冲浪/滑板/体操等),433 视频 | 领域专家标注的高光片段 | 学术申请 | 按品类的高光检测 |
| TVSum | 50 个 YouTube 视频,10 类 | 逐帧重要性评分(20 标注者) | GitHub 公开 | 视频摘要标准 benchmark |
| SumMe | 25 个用户视频 | 多人标注的摘要片段 | ETH Zürich 公开 | 经典视频摘要数据集 |
| ActivityNet Captions | 20K YouTube 视频,100K 段落 | 时序事件描述、时间戳 | ActivityNet 公开 | 大规模时序定位 |
| Ego4D | 3,670h 第一人称视频 | 多任务标注(瞬间检测、摘要等) | Meta Research 申请 | Meta 发布的超大规模第一人称视频 |
游戏领域特定数据:
Benchmark 建议:QVHighlights 做查询驱动高光检测的主基准(最接近"用户说要什么"的场景),TVSum/SumMe 做通用视频摘要基准。指标:mAP、HIT@1、Kendall τ(与人类排序的相关性)。
对应内容类型:所有类型(基础能力)
| 数据集 | 规模 | 语言 | 获取方式 | 备注 |
|---|---|---|---|---|
| LibriSpeech | 1,000h 英语有声书 | 英语 | OpenSLR 公开 | ASR 标准 benchmark,clean/other 分档 |
| GigaSpeech | 10,000h 有声书/播客/YouTube | 英语 | GitHub 公开 | 大规模多场景 |
| Common Voice (Mozilla) | 30,000h+,120+ 语言 | 多语言 | commonvoice.mozilla.org 公开 | 最大众包语音数据集 |
| WenetSpeech | 10,000h+ 中文 | 中文 | GitHub 公开 | 中文 ASR 最大公开数据集 |
| AISHELL 系列 | AISHELL-1: 170h, AISHELL-2: 1000h | 中文 | 部分公开 | 中文语音识别标准 |
| VoxPopuli | 400K+h 欧洲议会录音 | 23 种欧洲语言 | GitHub 公开 | 多语言 ASR |
| SPGISpeech | 5,000h 金融财报会议 | 英语 | 学术申请 | 专业场景 ASR |
| MLS (Multilingual LibriSpeech) | 50,000h+ | 8 种语言 | OpenSLR 公开 | 多语言大规模 |
| Whisper 训练集 (弱标注) | 680,000h 互联网音频 | 多语言 | 不公开(模型公开) | OpenAI Whisper 训练数据 |
推荐工具/预训练模型:
Benchmark 建议:英语用 LibriSpeech test-clean/test-other,中文用 AISHELL-1 test。指标:WER (Word Error Rate) / CER (Character Error Rate)。
对应内容类型:播客视频化 (P0)、知识付费/教程 (P1)、YouTube 长视频 (P1)
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| Switchboard Corpus | 2,400 段电话对话(~260h) | 语言不流畅标注(um, uh, 重复、修正) | LDC 付费 ($) | 语言学标准语料 |
| Fisher Corpus | 11,699 段对话(~2000h) | 自发语音转录含不流畅标注 | LDC 付费 | Switchboard 的扩展版 |
| Santa Barbara Corpus | 60h 日常对话 | 精细转录含犹豫/停顿 | UCSB 公开 | 学术研究用 |
| DISFLUENCY (Lickley et al.) | 学术规模 | 英语语言不流畅分类标注 | 学术论文附带 | 细粒度不流畅分类 |
| PodcastFillers | 社区构建 | 播客中的填充词时间戳 | GitHub 散布 | 非标准但贴合场景 |
中文口水词数据:
替代方案:用 ASR + 规则检测:
Benchmark 建议:Switchboard 上的 Disfluency Detection 任务是学术标准。自建评测集:从 YouTube/播客采样 100 段 2 分钟片段,人工标注口水词时间戳。指标:Precision/Recall/F1(按时间窗口匹配)。
对应内容类型:快节奏卡点风格、音乐 MV 混剪、电商视频 BGM
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| GTZAN | 1,000 首歌 × 10 流派 | 流派分类、节拍 | 公开 | 音乐分类经典 benchmark |
| Ballroom Dataset | 698 首舞曲 | BPM、节拍位置 | ISMIR 公开 | 节拍检测标准 |
| SMC Dataset | 288 首多流派 | 节拍和下拍标注 | 公开 | 复杂节奏挑战集 |
| RWC Music Database | 315 首,多体裁 | 节拍、和弦、结构 | 学术申请 | 日本产的高质量标注 |
| MUSDB18 | 150 首完整歌曲 | 多轨分离(人声/鼓/贝斯/其他) | Zenodo 公开 | 音源分离标准数据集 |
| FMA (Free Music Archive) | 106,574 首歌 | 流派、标签、音频特征 | GitHub 公开 | 超大规模免费音乐 |
| MTG-Jamendo | 55,000+ 首歌 | 情绪、流派、乐器标签 | MTG CC 许可公开 | 商用友好许可 |
| MusicCaps (Google) | 5,521 段 YouTube 音乐 | 自然语言描述 + 标签 | Kaggle/GitHub 公开 | 音乐理解/检索 |
推荐工具/预训练模型:
Benchmark 建议:Ballroom + SMC 做节拍检测基准。FMA/MTG-Jamendo 做 BGM 情绪匹配基准。指标:F-measure(节拍准确率,±70ms 容忍窗口)、P-score、AMLt。
对应内容类型:所有类型(Agent 理解素材的基础)
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| Kinetics-700 | 650K 视频片段 | 700 类人体动作 | DeepMind 公开 | 视频理解核心 benchmark |
| Something-Something V2 | 220K 视频 | 174 类物体交互动作 | Qualcomm 申请 | 因果/时序理解 |
| Moments in Time | 1M 3 秒视频 | 339 类动词标签 | MIT 公开 | 超大规模 |
| HowTo100M | 136M 视频片段,1.22M YouTube 视频 | ASR 字幕 + 视觉对齐 | GitHub 公开 | 教程视频理解 |
| YouCook2 | 2,000 YouTube 烹饪视频 | 分步骤标注 + 文字描述 | YouCook 公开 | 美食/教程类 |
| Charades | 9,848 个家庭活动视频 | 157 类动作 + 时序标注 | Allen AI 公开 | 日常活动理解 |
| Video-ChatGPT Benchmark | 多任务评测 | 视频问答、描述、推理 | GitHub 公开 | 评测多模态 LLM 的视频理解能力 |
| MVBench | 4,000 个多类视频 | 20 个细粒度视频理解任务 | GitHub 公开 | 综合视频理解评测 |
Benchmark 建议:Kinetics-700 做动作识别基准,HowTo100M 做教程视频理解基准,MVBench 做综合视频理解评测。
对应内容类型:所有类型(字幕、标题卡生成)
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| MSR-VTT | 10,000 视频片段 | 每段 20 条描述 | 公开 | 视频描述标准 benchmark |
| MSVD | 1,970 YouTube 片段 | 多语言描述 | 公开 | 经典小型 benchmark |
| VATEX | 41,269 视频 | 英/中双语描述 | GitHub 公开 | 双语! 对中文市场关键 |
| ActivityNet Captions | 20K 视频 | 密集时序字幕 | ActivityNet 公开 | 时序感知字幕 |
| ViTT | 8,169 YouTube 教程视频 | 分段标签 + 时间戳 | Google Research 公开 | 教程视频分段 |
| VideoInstruct-100K | 100K 视频指令对 | QA + 描述 + 创意写作 | GitHub 公开 | 指令跟随训练 |
Benchmark 建议:MSR-VTT 做字幕生成基准,VATEX 做中英双语基准。指标:BLEU-4、METEOR、CIDEr、ROUGE-L。
对应内容类型:播客视频化 (P0)、口播讲解、游戏直播切片
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| WIDER FACE | 32,203 张图片,393,703 标注人脸 | 人脸检测框 | WiderFace 公开 | 人脸检测标准 benchmark |
| 300-VW | 114 个视频 | 68 点人脸关键点追踪 | iBUG 公开 | 视频人脸追踪 |
| MOT Challenge | 多个视频序列 | 多目标追踪框 | MOTChallenge 公开 | 通用目标追踪(含人物) |
| VoxCeleb 1/2 | 7,000+ 名人,100 万+ 语音片段 | 说话人识别 + 人脸 | VoxCeleb 公开 | 说话人分离(播客多人场景) |
推荐工具:
对应内容类型:所有类型(成品质量把关)
| 数据集 | 规模 | 标注内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| LSVQ | 39,075 真实 UGC 视频 | MOS 质量分 | GitHub 公开 | 最大 UGC 视频质量数据集 |
| KoNViD-1k | 1,200 Flickr 视频 | MOS 质量分 | GitHub 公开 | UGC 视频质量标准 benchmark |
| YouTube-UGC | 1,500 YouTube 视频 | MOS 质量分 | Google Research 公开 | YouTube 原生 UGC |
| LIVE-VQC | 585 手机拍摄视频 | 差异 MOS 分 | UT Austin 公开 | 手机拍摄质量评估 |
推荐工具:
直接评测 AI 视频编辑能力
| 数据集/Benchmark | 规模 | 评测内容 | 获取方式 | 备注 |
|---|---|---|---|---|
| Goku Dataset | 100 万+ 编辑对 | 指令驱动的视频编辑(风格转换、物体编辑等) | 论文 2026-06 发布,待 GitHub 公开 | 最新最大的视频编辑数据集 |
| Goku-Bench | 1,000 人工验证测试样例 | 7 种编辑指标 | 同上 | 视频编辑质量 benchmark |
| EditBench | 多任务编辑基准 | 图像/视频编辑质量 | Google Research 公开 | 编辑保真度评测 |
| LOVEU-RVOS | YouTube 视频 | 参考视频对象分割 + 编辑 | CVPR Workshop 公开 | 视频对象级编辑 |
| InsV2V | 多样视频对 | 指令驱动的视频编辑 | GitHub 公开 | 指令→编辑效果对 |
哪些数据集服务于哪个 P0/P1 内容类型?✅ = 直接适用,⚠️ = 间接适用
| 数据集 | 播客视频化 | UGC 广告 | 电商商品 | YouTube 长视频 | 知识付费/教程 | 游戏切片 |
|---|---|---|---|---|---|---|
| LibriSpeech/GigaSpeech (ASR) | ✅ | ⚠️ | ⚠️ | ✅ | ✅ | ⚠️ |
| WenetSpeech/AISHELL (中文 ASR) | ✅ | ⚠️ | ✅ | ⚠️ | ✅ | ⚠️ |
| VoxCeleb (说话人) | ✅ | ❌ | ❌ | ⚠️ | ⚠️ | ❌ |
| Switchboard (口水词) | ✅ | ❌ | ❌ | ✅ | ✅ | ❌ |
| ClipShots/MovieNet (场景) | ⚠️ | ⚠️ | ⚠️ | ✅ | ⚠️ | ✅ |
| QVHighlights/TVSum (高光) | ⚠️ | ❌ | ❌ | ✅ | ⚠️ | ✅ |
| MUSDB18/Ballroom (音乐) | ⚠️ | ✅ | ✅ | ✅ | ❌ | ⚠️ |
| MTG-Jamendo/FMA (BGM) | ⚠️ | ✅ | ✅ | ✅ | ⚠️ | ⚠️ |
| WIDER FACE/300-VW (人脸) | ✅ | ⚠️ | ⚠️ | ✅ | ✅ | ⚠️ |
| HowTo100M/YouCook2 (教程) | ❌ | ❌ | ❌ | ⚠️ | ✅ | ❌ |
| VATEX/MSR-VTT (字幕) | ⚠️ | ⚠️ | ⚠️ | ✅ | ✅ | ⚠️ |
| Kinetics-700 (动作) | ❌ | ⚠️ | ⚠️ | ✅ | ⚠️ | ✅ |
| LSVQ/KoNViD (质量) | ⚠️ | ✅ | ✅ | ✅ | ⚠️ | ⚠️ |
| 内容类型 | 缺失能力 | 自建方案 | 成本估算 |
|---|---|---|---|
| UGC 广告素材 | Hook-Demo-CTA 结构检测、广告效果预测 | 从 Meta Ad Library / TikTok Creative Center 采集公开广告素材,人工标注结构 | 500 条 × ¥5/条 = ¥2,500 |
| 电商商品视频 | 商品卖点提取、多角度剪切模式 | 从抖音/小红书爬取公开电商视频,标注卖点/结构 | 500 条 × ¥5/条 = ¥2,500 |
| Retention Editing 风格 | jump cut 节奏、zoom 时机、SFX 插入点 | 从 YouTube 头部创作者视频采集,标注编辑手法时间轴 | 100 条 × ¥30/条 = ¥3,000 |
| 能力 | 现有公开数据 | 缺失部分 | 补充方案 |
|---|---|---|---|
| 中文口水词检测 | HKUST/MTS(小规模) | 大规模标注、播客/教程场景 | Whisper 转录 + 规则标注 → 人工校验 100h |
| 播客多人切换 | VoxCeleb(名人) | 真实播客的自然对话切换 | 采集 CC 许可播客 50 期,标注说话人切换 |
| 游戏高光检测 | YouTube Highlights(非游戏) | FPS/MOBA 特定的高光标准 | 从 Twitch 采集公开 VOD,标注高光时间戳 |
结合 Waitlist 的第 8 道开放题(用户输入编辑意图),可以构建:
| 层级 | 评测目标 | 数据集 | 指标 | 频率 |
|---|---|---|---|---|
| L0 — 基础能力 | 场景检测 | ClipShots | F1 > 0.95 | 每次模型更新 |
| ASR 准确率 | LibriSpeech / AISHELL-1 | WER < 5% (en) / CER < 5% (zh) | 每次模型更新 | |
| 节拍检测 | Ballroom | F1 > 0.90 (±70ms) | 每次更新 | |
| 人脸追踪 | 300-VW | NME < 4.0 | 每次更新 | |
| L1 — 组合能力 | 高光提取 | QVHighlights | mAP > 0.35 | 每周 |
| 口水词去除 | 自建 100 段 | F1 > 0.85 | 每周 | |
| 视频摘要 | TVSum | Kendall τ > 0.10 | 每周 | |
| L2 — 端到端 | 全自动剪辑质量 | 自建 50 条(人工评分 1-5) | MOS > 3.5 | 每两周 |
| 意图理解准确率 | 自建 200 条意图 | Accuracy > 0.80 | 每两周 | |
| 用户满意度 | Beta 用户反馈 | NPS > 40 | 每月 |
`
`
自建总预算:约 ¥15,000
| 时间 | 行动 | 产出 |
|---|---|---|
| 本周 | 下载 L0 基础能力数据集(ClipShots, LibriSpeech, AISHELL, Ballroom) | 数据就绪,可开始跑基准 |
| 本周 | 集成 TransNet V2 + Whisper + madmom | 三大基础能力 Pipeline |
| 下周 | 下载 L1 数据集(QVHighlights, TVSum, MUSDB18) | 高光/摘要/音乐分析评测就绪 |
| 下周 | 采集 50 条 UGC 广告素材 + 50 条电商视频 | 自建数据集 V0.1 |
| 2 周内 | 搭建自动化 benchmark CI 流程 | 每次代码提交自动跑 L0 |
| 1 个月 | 完成全部自建数据标注 | 自建数据集 V1.0,覆盖所有 P0 场景 |
调研数据截至 2026-07-06,基于公开论文、GitHub 仓库和数据集网站。数据集可用性可能变化。