[Feature] 智能剪辑流程重构:文案/配音前置 + 双剪辑模式 + 智能降重 #1970

Closed
opened 2026-09-16 22:33:16 +08:00 by xiaoxia · 0 comments
Owner

⚠️ 明确边界

  1. Step3选择标题、Step4确认生成、Step5选择封面——三个页面完全不改动,保持现有代码和UI不动。
  2. 智能降重+原子化切片都是在现有逻辑基础上优化迭代,不是推倒重来。

概述

重构智能剪辑生成向导第一步(文案/配音前置+双模式),素材原子化按3~6秒切片,智能降重加开关+微变换。

优先级: P1
原型: /Coze/Drive/saas剪辑软件开发/prototype/smart-edit-flow-v4.html
详细文档: /Coze/Drive/saas剪辑软件开发/docs/smart-edit-flow-redesign-20260916.md

新5步流程

Step1 选择剪辑模式+生成设置(新页面)
  ├─ 随机混剪 → [弹窗] 选择配音(配音库音频)→ Step2
  └─ 叙事剪辑 → [弹窗] 选文案(搜索+标签)→ [弹窗] 选音色+合成配音 → Step2
Step2 选择素材(叙事模式加AI匹配提示卡)
Step3 选择标题(完全不动)
Step4 确认生成(完全不动,摘要补字段)
Step5 选择封面(完全不动)

素材原子化切片(P1核心)

切片规则:素材入库后按3~6秒固定时长切成原子片段,每个片段时长在3-6秒范围内随机(避免固定节奏被查重识别);切点附近0.5秒内有scdet镜头切换点就偏移到切换处更自然;<6秒素材整条一个片段,末段<3秒合并到前段;片段是逻辑索引不物理切文件,存atom_clips表。

生成时选片:选片单元从整条素材变为atom_clip,从原子片段池随机组合选取,每个片段只用一次,配音时长决定需要多少片段。scdet只做切点对齐辅助,不是主要切分依据。

兜底:atom_clips未就绪时内存临时均匀切片。

智能降重增强

保留现有3层:smart_select随机噪声(#1743) + random_edge_crop(#1664) + source_edit_plan_id批量变体(#1855)。

本次加:

  • 智能降重开关(默认开启,关闭时所有降重包括edge_crop都跳过)
  • 6个微变换维度叠加:水平翻转(无字幕片段)/速度0.97-1.03x/亮度±2%/对比度±2%/饱和度±2%/BGM偏移2-8s

不做:转场随机/TTS语速/渲染重构。

后端要点

  • 新增assembly_mode(random/narrative)/script_id/tts_voice_id/dedup_enabled/video_ratio参数
  • 现有字段保持兼容,未传assembly_mode默认random
  • 叙事模式:先TTS合成配音再走剪辑,素材优先按文案标签匹配
  • atom_clips表+3~6秒切片异步任务+渲染按start/end trim
  • 降重开关透传渲染链路
  • EditingMode废弃标记但不删代码

前端要点

  • constants改5步,修Step1TemplateSelect import error
  • 新建Step1EditMode+3弹窗(VoiceSelect/ScriptSelect/TtsVoice)
  • 复用TtsModal和/api/v1/scripts
  • Step2加AI匹配提示卡,Step4摘要适配
  • Step3/5/配音库/文案库/AI数字人不动

验收

  • 随机/叙事两条路径全流程走通
  • Step3/5页面完全不变
  • 素材入库后按3~6秒切片atom_clips生成,选片从片段池走
  • 降重开关开/关行为正确
  • 未传assembly_mode默认random向后兼容
## ⚠️ 明确边界 1. **Step3选择标题、Step4确认生成、Step5选择封面——三个页面完全不改动**,保持现有代码和UI不动。 2. **智能降重+原子化切片都是在现有逻辑基础上优化迭代,不是推倒重来**。 --- ## 概述 重构智能剪辑生成向导第一步(文案/配音前置+双模式),素材原子化按3~6秒切片,智能降重加开关+微变换。 **优先级:** P1 **原型:** `/Coze/Drive/saas剪辑软件开发/prototype/smart-edit-flow-v4.html` **详细文档:** `/Coze/Drive/saas剪辑软件开发/docs/smart-edit-flow-redesign-20260916.md` ## 新5步流程 ``` Step1 选择剪辑模式+生成设置(新页面) ├─ 随机混剪 → [弹窗] 选择配音(配音库音频)→ Step2 └─ 叙事剪辑 → [弹窗] 选文案(搜索+标签)→ [弹窗] 选音色+合成配音 → Step2 Step2 选择素材(叙事模式加AI匹配提示卡) Step3 选择标题(完全不动) Step4 确认生成(完全不动,摘要补字段) Step5 选择封面(完全不动) ``` ## 素材原子化切片(P1核心) **切片规则**:素材入库后按3~6秒固定时长切成原子片段,每个片段时长在3-6秒范围内随机(避免固定节奏被查重识别);切点附近0.5秒内有scdet镜头切换点就偏移到切换处更自然;<6秒素材整条一个片段,末段<3秒合并到前段;片段是逻辑索引不物理切文件,存atom_clips表。 **生成时选片**:选片单元从整条素材变为atom_clip,从原子片段池随机组合选取,每个片段只用一次,配音时长决定需要多少片段。scdet只做切点对齐辅助,不是主要切分依据。 **兜底**:atom_clips未就绪时内存临时均匀切片。 ## 智能降重增强 保留现有3层:smart_select随机噪声(#1743) + random_edge_crop(#1664) + source_edit_plan_id批量变体(#1855)。 本次加: - 智能降重开关(默认开启,关闭时所有降重包括edge_crop都跳过) - 6个微变换维度叠加:水平翻转(无字幕片段)/速度0.97-1.03x/亮度±2%/对比度±2%/饱和度±2%/BGM偏移2-8s 不做:转场随机/TTS语速/渲染重构。 ## 后端要点 - 新增assembly_mode(random/narrative)/script_id/tts_voice_id/dedup_enabled/video_ratio参数 - 现有字段保持兼容,未传assembly_mode默认random - 叙事模式:先TTS合成配音再走剪辑,素材优先按文案标签匹配 - atom_clips表+3~6秒切片异步任务+渲染按start/end trim - 降重开关透传渲染链路 - EditingMode废弃标记但不删代码 ## 前端要点 - constants改5步,修Step1TemplateSelect import error - 新建Step1EditMode+3弹窗(VoiceSelect/ScriptSelect/TtsVoice) - 复用TtsModal和/api/v1/scripts - Step2加AI匹配提示卡,Step4摘要适配 - Step3/5/配音库/文案库/AI数字人不动 ## 验收 - [ ] 随机/叙事两条路径全流程走通 - [ ] Step3/5页面完全不变 - [ ] 素材入库后按3~6秒切片atom_clips生成,选片从片段池走 - [ ] 降重开关开/关行为正确 - [ ] 未传assembly_mode默认random向后兼容
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: xiaoxia/xiaoxia-saas#1970