[P1][Feature] 爆款视频一键生成功能(用户端) #2077

Open
opened 2026-09-28 00:27:28 +08:00 by xiaoxia · 0 comments
Owner

需求概述

用户上传1-9张产品图,可选填产品描述文案(支持口语化草稿)、可选上传参考爆款视频(跟拍风格),系统自动完成图片分析→文案生成→分镜规划→视频生成→配音配乐→字幕输出,3分钟内生成一条9:16竖屏带货短视频。

PRD文档

viral-video-feature-PRD-v1.4.html(位于主对话工作目录)
必读:严格按PRD实现,不得自行脑补功能。本工单只包含Phase 1 MVP + Phase 2核心能力。

用户端功能点

入口与页面

  • 用户端新增"爆款视频"Tab/入口
  • 三栏布局:左栏素材上传 / 中栏文案编辑 / 右栏视频配置
  • 底部3按钮严格顺序:①开始分析图片 ②生成视频文案 ③开始生成视频

Phase 1 MVP(第一周)

  1. 图片上传:1-9张产品图,支持拖拽/点击上传
  2. 可选音色克隆:用户可上传10秒音频片段克隆自己的声音(MVP阶段先提供10+预置系统音色)
  3. 图片分析:调用豆包VLM,输出产品名/品类/核心卖点/适用场景/适合人群/视觉特征
  4. 文案编辑:
    • 用户可填写任意长度文字(关键词/一句话/完整草稿都支持)
    • AI基于用户文字+图片分析+行业知识+爆款结构生成口播文案+分镜脚本
    • 用户文案融合强度三档:AI帮我全写 / 我打草稿AI润色(默认) / 按我的话来
    • 文案可编辑后再生成
  5. 参数选择:行业(10个预置)、人设(5种)、爆款结构(4种)、时长(15/30/60秒)
  6. 视频配置:清晰度(480p/720p/1080p)、字幕开关、BGM风格
  7. 视频生成:调用火山引擎Seedance 2.5 API,按分镜逐镜头生成→FFmpeg拼接
  8. TTS配音:复用现有TTS能力(第一版用现有云端CosyVoice,等#2075完成后切换到本地Qwen3-TTS)
  9. 字幕/BGM/转场:复用现有FFmpeg渲染管线
  10. MuseTalk口型同步(可选开关):若选择数字人模式,对人物镜头做口型同步
  11. 成片输出:9:16 MP4,带进度实时反馈
  12. 任务队列:复用现有Celery任务队列

Phase 2(第二-三周,与本工单并行或接续)

  1. 声音克隆:用户上传10秒音频片段,Qwen3-TTS零样本克隆音色
  2. 参考视频风格分析(跟拍爆款):
    • 用户上传参考视频,AI分析镜头语言(运镜/转场/色调/节奏/BGM)
    • 分析后展示识别卡片,用户确认后按此风格生成
    • 风格强度三档:参考一下 / 按这个风格拍(默认)/ 1:1复刻运镜
  3. 输出优化:智能字幕判断(口播镜头不加字幕,纯旁白加字幕)、人物一致性约束、镜头级质量校验重试

AI编导Prompt体系(核心)

严格按PRD §7实现模块化Prompt拼装:

  • 5种人设Prompt模板
  • 10个行业知识库(痛点/卖点/强词/禁忌)
  • 4种爆款结构模板(痛点钩子/反差种草/场景代入/对比冲击)
  • 4维度随机口味(开头/语气/节奏/角度)防套路化
  • few-shot参考示例库(按行业×结构组合预置)
  • 黑名单词(禁用烂大街词+广告法极限词+医疗词)
  • 全局负面约束(字幕水印/变形人脸/商品错位/加速口播等)
  • 事实审核Prompt(生成后二次校验,最多重试2次)

防坑规则(严格实现)

  1. 图片分析区分"明确可见事实"和"推测",严禁编造地址/电话/价格/材质
  2. 文案结构必须按选定爆款结构的时间轴,不能自由发挥
  3. 用户核心卖点必须保留,AI只能润色扩写不能篡改
  4. 有人出镜必须注入consistency特征描述保证跨镜头人脸一致
  5. 黑名单词拼入Prompt,生成后再过审核
  6. 每个分镜必须输出完整字段:景别/角度/运镜/光线/焦点/动作/台词/音效/转场/英文prompt/负面prompt

技术复用清单(不重造轮子)

能力 复用现有模块
图片上传/OSS 复用现有上传接口
用户/权限/计费 复用现有系统
任务队列 复用现有Celery
VLM视觉分析 复用豆包VLM(只写新Prompt)
LLM文案生成 复用豆包LLM(只写新Prompt)
TTS配音 复用TTS模块(接#2075本地Qwen3-TTS)
视频生成API 新增:火山引擎Seedance 2.5调用
FFmpeg拼接/字幕/BGM 复用现有worker渲染管线
口型同步 复用MuseTalk
参考视频分析 新增:基于VLM+音频分析的脚本(约300行)

验收标准(Phase 1)

  • 用户可以上传图片→填文案→选参数→生成视频,端到端流程跑通
  • 生成视频为9:16 MP4,画面连贯,配音清晰
  • 文案生成可编辑后再出视频
  • 三档融合强度效果差异明显
  • 不同行业/人设/结构组合产出风格有差异
  • 禁用词/违规词不会出现在成片中
  • 任务进度实时反馈,失败有明确错误提示
  • 单元测试覆盖Prompt拼装、文案审核、分镜输出格式

关联

## 需求概述 用户上传1-9张产品图,可选填产品描述文案(支持口语化草稿)、可选上传参考爆款视频(跟拍风格),系统自动完成图片分析→文案生成→分镜规划→视频生成→配音配乐→字幕输出,3分钟内生成一条9:16竖屏带货短视频。 ## PRD文档 viral-video-feature-PRD-v1.4.html(位于主对话工作目录) **必读:严格按PRD实现,不得自行脑补功能。本工单只包含Phase 1 MVP + Phase 2核心能力。** ## 用户端功能点 ### 入口与页面 - 用户端新增"爆款视频"Tab/入口 - 三栏布局:左栏素材上传 / 中栏文案编辑 / 右栏视频配置 - 底部3按钮严格顺序:①开始分析图片 ②生成视频文案 ③开始生成视频 ### Phase 1 MVP(第一周) 1. **图片上传**:1-9张产品图,支持拖拽/点击上传 2. **可选音色克隆**:用户可上传10秒音频片段克隆自己的声音(MVP阶段先提供10+预置系统音色) 3. **图片分析**:调用豆包VLM,输出产品名/品类/核心卖点/适用场景/适合人群/视觉特征 4. **文案编辑**: - 用户可填写任意长度文字(关键词/一句话/完整草稿都支持) - AI基于用户文字+图片分析+行业知识+爆款结构生成口播文案+分镜脚本 - 用户文案融合强度三档:AI帮我全写 / 我打草稿AI润色(默认) / 按我的话来 - 文案可编辑后再生成 5. **参数选择**:行业(10个预置)、人设(5种)、爆款结构(4种)、时长(15/30/60秒) 6. **视频配置**:清晰度(480p/720p/1080p)、字幕开关、BGM风格 7. **视频生成**:调用火山引擎Seedance 2.5 API,按分镜逐镜头生成→FFmpeg拼接 8. **TTS配音**:复用现有TTS能力(第一版用现有云端CosyVoice,等#2075完成后切换到本地Qwen3-TTS) 9. **字幕/BGM/转场**:复用现有FFmpeg渲染管线 10. **MuseTalk口型同步**(可选开关):若选择数字人模式,对人物镜头做口型同步 11. **成片输出**:9:16 MP4,带进度实时反馈 12. **任务队列**:复用现有Celery任务队列 ### Phase 2(第二-三周,与本工单并行或接续) 1. **声音克隆**:用户上传10秒音频片段,Qwen3-TTS零样本克隆音色 2. **参考视频风格分析(跟拍爆款)**: - 用户上传参考视频,AI分析镜头语言(运镜/转场/色调/节奏/BGM) - 分析后展示识别卡片,用户确认后按此风格生成 - 风格强度三档:参考一下 / 按这个风格拍(默认)/ 1:1复刻运镜 3. **输出优化**:智能字幕判断(口播镜头不加字幕,纯旁白加字幕)、人物一致性约束、镜头级质量校验重试 ## AI编导Prompt体系(核心) 严格按PRD §7实现模块化Prompt拼装: - 5种人设Prompt模板 - 10个行业知识库(痛点/卖点/强词/禁忌) - 4种爆款结构模板(痛点钩子/反差种草/场景代入/对比冲击) - 4维度随机口味(开头/语气/节奏/角度)防套路化 - few-shot参考示例库(按行业×结构组合预置) - 黑名单词(禁用烂大街词+广告法极限词+医疗词) - 全局负面约束(字幕水印/变形人脸/商品错位/加速口播等) - 事实审核Prompt(生成后二次校验,最多重试2次) ## 防坑规则(严格实现) 1. 图片分析区分"明确可见事实"和"推测",严禁编造地址/电话/价格/材质 2. 文案结构必须按选定爆款结构的时间轴,不能自由发挥 3. 用户核心卖点必须保留,AI只能润色扩写不能篡改 4. 有人出镜必须注入consistency特征描述保证跨镜头人脸一致 5. 黑名单词拼入Prompt,生成后再过审核 6. 每个分镜必须输出完整字段:景别/角度/运镜/光线/焦点/动作/台词/音效/转场/英文prompt/负面prompt ## 技术复用清单(不重造轮子) | 能力 | 复用现有模块 | |---|---| | 图片上传/OSS | 复用现有上传接口 | | 用户/权限/计费 | 复用现有系统 | | 任务队列 | 复用现有Celery | | VLM视觉分析 | 复用豆包VLM(只写新Prompt) | | LLM文案生成 | 复用豆包LLM(只写新Prompt) | | TTS配音 | 复用TTS模块(接#2075本地Qwen3-TTS) | | 视频生成API | 新增:火山引擎Seedance 2.5调用 | | FFmpeg拼接/字幕/BGM | 复用现有worker渲染管线 | | 口型同步 | 复用MuseTalk | | 参考视频分析 | 新增:基于VLM+音频分析的脚本(约300行) | ## 验收标准(Phase 1) - [ ] 用户可以上传图片→填文案→选参数→生成视频,端到端流程跑通 - [ ] 生成视频为9:16 MP4,画面连贯,配音清晰 - [ ] 文案生成可编辑后再出视频 - [ ] 三档融合强度效果差异明显 - [ ] 不同行业/人设/结构组合产出风格有差异 - [ ] 禁用词/违规词不会出现在成片中 - [ ] 任务进度实时反馈,失败有明确错误提示 - [ ] 单元测试覆盖Prompt拼装、文案审核、分镜输出格式 ## 关联 - PRD: viral-video-feature-PRD-v1.4.html(详细字段、流程、示例见PRD) - 后台运营模块: #2077 - TTS本地部署: #2075 - MuseTalk倒放bug: #2073 - P4000编码节点: #2074(编码加速用) - EchoMimicV2评估: #2076(后续可能升级半身数字人)
xiaoxia added the featurefrontendP1backend labels 2026-09-28 00:27:28 +08:00
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: xiaoxia/xiaoxia-saas#2077