[P1] 降重增强:BGM池差异化分配,打破变体间音频指纹一致性 #1767

Closed
opened 2026-09-07 20:08:14 +08:00 by xiaoxia · 1 comment
Owner

背景

当前批量生成时,多个变体可能共用同一首 BGM。YouTube Content ID 音频准确率 99.5%,支持 10 秒部分匹配。音频一致是查重的高危信号。

目标

不同变体使用不同的 BGM 或同一 BGM 的不同段落。

方案

策略一:BGM 池分配(优先)

  1. 维护一个 BGM 池(至少 5-10 首风格匹配的 BGM)
  2. 每个变体随机分配一首 BGM
  3. BGM 需匹配视频整体风格/情绪(后续可用 AI 匹配)

策略二:BGM 段落差异化(备选)

  1. 如果 BGM 池不够大,同一首 BGM 也可做差异化:
    • 变体A用前奏段+高潮段
    • 变体B用副歌段+结尾段
    • 不同起始点、不同裁剪段落

策略三:BGM 音量混合微调

  1. 不同变体的 BGM 音量有 ±3dB 微调
  2. BGM 与配音的混音比例有微小差异

代码改动点

  1. variant_plan_selector.py 或 BGM 选择逻辑:

    • 新增 BGM 池数据结构
    • 变体生成时随机选 BGM(基于 variantSeed)
  2. 音频渲染/混音

    • 支持不同 BGM 文件路径传入
    • 混音参数微调

约束

  • 不破坏现有能力:单视频 BGM 选择逻辑不变
  • BGM 风格匹配:随机不等于乱选,BGM 情绪需与视频内容匹配(初期可用分类标签约束)

验收标准

  1. 批量生成3个视频时,3个视频的 BGM 不同(或起始段落不同)
  2. BGM 与视频内容情绪匹配(主观听感合理)
  3. BGM 切换不影响配音清晰度
## 背景 当前批量生成时,多个变体可能共用同一首 BGM。YouTube Content ID 音频准确率 99.5%,支持 10 秒部分匹配。音频一致是查重的高危信号。 ## 目标 不同变体使用不同的 BGM 或同一 BGM 的不同段落。 ## 方案 ### 策略一:BGM 池分配(优先) 1. 维护一个 BGM 池(至少 5-10 首风格匹配的 BGM) 2. 每个变体随机分配一首 BGM 3. BGM 需匹配视频整体风格/情绪(后续可用 AI 匹配) ### 策略二:BGM 段落差异化(备选) 1. 如果 BGM 池不够大,同一首 BGM 也可做差异化: - 变体A用前奏段+高潮段 - 变体B用副歌段+结尾段 - 不同起始点、不同裁剪段落 ### 策略三:BGM 音量混合微调 1. 不同变体的 BGM 音量有 ±3dB 微调 2. BGM 与配音的混音比例有微小差异 ### 代码改动点 1. **variant_plan_selector.py** 或 BGM 选择逻辑: - 新增 BGM 池数据结构 - 变体生成时随机选 BGM(基于 variantSeed) 2. **音频渲染/混音**: - 支持不同 BGM 文件路径传入 - 混音参数微调 ### 约束 - **不破坏现有能力**:单视频 BGM 选择逻辑不变 - **BGM 风格匹配**:随机不等于乱选,BGM 情绪需与视频内容匹配(初期可用分类标签约束) ## 验收标准 1. 批量生成3个视频时,3个视频的 BGM 不同(或起始段落不同) 2. BGM 与视频内容情绪匹配(主观听感合理) 3. BGM 切换不影响配音清晰度
Author
Owner

已完成。PR #1785(feat: BGM池差异化分配)已合并 develop。三层策略全部实现:10首BGM池按风格筛选+variantSeed随机分配、段落差异化seek偏移(5s量化≤30s)、音量±3dB微调。31个单测覆盖。

已完成。PR #1785(feat: BGM池差异化分配)已合并 develop。三层策略全部实现:10首BGM池按风格筛选+variantSeed随机分配、段落差异化seek偏移(5s量化≤30s)、音量±3dB微调。31个单测覆盖。
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: xiaoxia/xiaoxia-saas#1767