[Feature][P0] AI爆款视频生成 v1.2 - 图片+文案意图融合一键出片 #2038

Open
opened 2026-09-25 21:27:54 +08:00 by xiaoxia · 3 comments
Owner

功能概述

用户上传1-9张产品图片,可选输入自己想表达但不完整的文案(支持关键词/碎碎念/短句),选择行业/客户/人设/爆款结构/营销目的,AI完成「图片分析→文案意图理解→融合文案→分镜→配音→渲染→成片」全流程一键出片。

v1.2 核心新增

  • 「我说你写」文案融合功能:三档融合强度
    • AI帮我全写:用户只给图,AI自由发挥写文案
    • 我打草稿AI润色(推荐):用户输入关键词/碎碎念/短句,AI理解后扩写润色
    • 按我的话来:用户有明确文案,AI保留用户原话核心表达,只做衔接和微调
  • AI理解摘要卡片确认机制:意图解析完成后,先展示AI理解的核心要点卡片(3-5条),用户确认后才进入后续流程,理解不对可编辑文案重新生成
  • 进度阶段新增「AI理解你想表达」阶段

技术栈

  • Python 3.12 + FastAPI + Celery(现有后端栈)
  • React + TypeScript + Ant Design(现有前端栈)
  • 不引入新技术栈

⚠️ 铁律:复用现有能力,禁止重写

以下模块已有部署且运行稳定,直接调用,不重写一行代码:

  • 豆包VLM多模态 → ai_service.call_vision()
  • 豆包LLM → ai_service.call_llm()
  • CosyVoice TTS(GPU已部署,有音色库)→ 现有TTS服务
  • GPT-SoVITS声音克隆 → 现有服务
  • FFmpeg UnifiedRenderService(图片转视频/转场/Ken Burns/ASS字幕/BGM混音/配音叠加/音量闪避)→ 直接调用
  • MuseTalk数字人口型同步(Docker+GPU worker轮询架构已运行)→ 直接调用
  • OSS直传、JWT认证、credits扣点、WebSocket进度、Celery队列、PostgreSQL → 全部复用
  • React+TS+Ant Design前端组件、OSS上传组件、视频播放器、WebSocket hook → 全部复用

周期

  • Phase1:1-2周

交付清单(子任务)

  • #2039 后端:DB模型+REST API+Celery编排器(9步流水线)
  • #2040 后端:Prompt模板系统(5套Prompt+三档融合+DB配置化)
  • #2041 前端:完整创作页面UI(三栏布局+「我说你写」+理解摘要卡片)
  • #2042 配置:初始数据seed + Staging端到端联调

验收标准

  1. 用户上传1-9张图,可选输入文案,选参数,点生成→端到端出片成功
  2. 三档融合强度各走通,user_primary模式下用户核心表达不被篡改
  3. AI理解摘要卡片正确展示,反馈按钮可触发重新生成
  4. v1.1流程(不填文案纯AI模式)不受影响,正常出片
  5. 数字人模式MuseTalk口型同步链路正常
  6. credits扣点正确,失败自动回滚
  7. WebSocket实时进度9阶段正确推送
  8. Staging全链路通过后才能发版
## 功能概述 用户上传1-9张产品图片,可选输入自己想表达但不完整的文案(支持关键词/碎碎念/短句),选择行业/客户/人设/爆款结构/营销目的,AI完成「图片分析→文案意图理解→融合文案→分镜→配音→渲染→成片」全流程一键出片。 ## v1.2 核心新增 - **「我说你写」文案融合功能**:三档融合强度 - **AI帮我全写**:用户只给图,AI自由发挥写文案 - **我打草稿AI润色(推荐)**:用户输入关键词/碎碎念/短句,AI理解后扩写润色 - **按我的话来**:用户有明确文案,AI保留用户原话核心表达,只做衔接和微调 - **AI理解摘要卡片确认机制**:意图解析完成后,先展示AI理解的核心要点卡片(3-5条),用户确认后才进入后续流程,理解不对可编辑文案重新生成 - 进度阶段新增「AI理解你想表达」阶段 ## 技术栈 - Python 3.12 + FastAPI + Celery(现有后端栈) - React + TypeScript + Ant Design(现有前端栈) - **不引入新技术栈** ## ⚠️ 铁律:复用现有能力,禁止重写 以下模块已有部署且运行稳定,**直接调用,不重写一行代码**: - 豆包VLM多模态 → `ai_service.call_vision()` - 豆包LLM → `ai_service.call_llm()` - CosyVoice TTS(GPU已部署,有音色库)→ 现有TTS服务 - GPT-SoVITS声音克隆 → 现有服务 - FFmpeg UnifiedRenderService(图片转视频/转场/Ken Burns/ASS字幕/BGM混音/配音叠加/音量闪避)→ 直接调用 - MuseTalk数字人口型同步(Docker+GPU worker轮询架构已运行)→ 直接调用 - OSS直传、JWT认证、credits扣点、WebSocket进度、Celery队列、PostgreSQL → 全部复用 - React+TS+Ant Design前端组件、OSS上传组件、视频播放器、WebSocket hook → 全部复用 ## 周期 - Phase1:1-2周 ## 交付清单(子任务) - [ ] #2039 后端:DB模型+REST API+Celery编排器(9步流水线) - [ ] #2040 后端:Prompt模板系统(5套Prompt+三档融合+DB配置化) - [ ] #2041 前端:完整创作页面UI(三栏布局+「我说你写」+理解摘要卡片) - [ ] #2042 配置:初始数据seed + Staging端到端联调 ## 验收标准 1. 用户上传1-9张图,可选输入文案,选参数,点生成→端到端出片成功 2. 三档融合强度各走通,user_primary模式下用户核心表达不被篡改 3. AI理解摘要卡片正确展示,反馈按钮可触发重新生成 4. v1.1流程(不填文案纯AI模式)不受影响,正常出片 5. 数字人模式MuseTalk口型同步链路正常 6. credits扣点正确,失败自动回滚 7. WebSocket实时进度9阶段正确推送 8. Staging全链路通过后才能发版
xiaoxia added the backendP0featurefrontend labels 2026-09-25 21:27:54 +08:00
Author
Owner

📌 PRD升级到v1.3(2026-09-26)

新增「跟拍爆款」参考视频风格分析功能:用户上传1个爆款参考视频,AI分析运镜语言(镜头分割/推拉摇移/转场节奏/色调/BPM),按参考视频镜头语言生成新视频,三档风格强度。

新增子工单

  • #2043 [P0][后端] 爆款视频v1.3 - 参考爆款视频风格分析模块(video_analyzer+风格整合)

对现有子工单的影响

  • #2039 后端DB/API/编排器:DB表需扩展reference_video_url/style_strength/style_guide/style_template_id字段,编排器增加video_analysis步骤,API增加analyze-style/style-templates接口,WS增加style_analyzed事件,审核增加风格一致性维度
  • #2040 Prompt模板:新增VIDEO_STYLE_INTEGRATION_PROMPT风格整合Prompt和STYLE_CONSTRAINT_MODULE_PROMPT风格约束模块(三档)
  • #2041 前端UI:中栏增加"参考爆款视频(可选)"上传区+风格强度三档选择,右栏进度区增加"AI分析镜头语言中"阶段+镜头语言可视化卡片(运镜序列条+色调板+节奏标签)
  • #2042 seed/联调:新增viral_video_style_templates预置风格表(10+套),端到端测试增加风格复刻测试用例

Phase1周期调整

从1-2周调整为2-3周(video_analyzer约300行OpenCV新代码+镜头语言可视化UI组件+联调)。
现有能力复用铁律不变,FFmpeg/VLM/LLM/UnifiedRenderService/OSS全部直接调用,不重写。

## 📌 PRD升级到v1.3(2026-09-26) 新增「跟拍爆款」参考视频风格分析功能:用户上传1个爆款参考视频,AI分析运镜语言(镜头分割/推拉摇移/转场节奏/色调/BPM),按参考视频镜头语言生成新视频,三档风格强度。 ### 新增子工单 - #2043 [P0][后端] 爆款视频v1.3 - 参考爆款视频风格分析模块(video_analyzer+风格整合) ### 对现有子工单的影响 - #2039 后端DB/API/编排器:DB表需扩展reference_video_url/style_strength/style_guide/style_template_id字段,编排器增加video_analysis步骤,API增加analyze-style/style-templates接口,WS增加style_analyzed事件,审核增加风格一致性维度 - #2040 Prompt模板:新增VIDEO_STYLE_INTEGRATION_PROMPT风格整合Prompt和STYLE_CONSTRAINT_MODULE_PROMPT风格约束模块(三档) - #2041 前端UI:中栏增加"参考爆款视频(可选)"上传区+风格强度三档选择,右栏进度区增加"AI分析镜头语言中"阶段+镜头语言可视化卡片(运镜序列条+色调板+节奏标签) - #2042 seed/联调:新增viral_video_style_templates预置风格表(10+套),端到端测试增加风格复刻测试用例 ### Phase1周期调整 从1-2周调整为2-3周(video_analyzer约300行OpenCV新代码+镜头语言可视化UI组件+联调)。 现有能力复用铁律不变,FFmpeg/VLM/LLM/UnifiedRenderService/OSS全部直接调用,不重写。
Author
Owner

⚠️ 编号修正:上述评论中提到的子工单 #2043 实际编号为 #2051(#2043-#2050 已被其他已关闭/处理中工单占用)。

实际子工单:

  • #2051 [P0][后端] 爆款视频v1.3 - 参考爆款视频风格分析模块(video_analyzer+风格整合)

后续引用请以 #2051 为准。#2039/#2040/#2041/#2042 评论中提到的 #2043 也均指代 #2051。

⚠️ 编号修正:上述评论中提到的子工单 #2043 实际编号为 **#2051**(#2043-#2050 已被其他已关闭/处理中工单占用)。 实际子工单: - #2051 [P0][后端] 爆款视频v1.3 - 参考爆款视频风格分析模块(video_analyzer+风格整合) 后续引用请以 #2051 为准。#2039/#2040/#2041/#2042 评论中提到的 #2043 也均指代 #2051。
Author
Owner

v1.4 更新(2026-09-28)

PRD文档已更新到v1.4版本:viral-video-feature-PRD-v1.4.html(主对话工作目录),请开发前必读最新PRD。v1.4相对v1.2父工单的重要补充:

技术选型更新

  1. 视频生成API:调用火山引擎Seedance 2.5 API按分镜逐镜头生成→FFmpeg拼接(不是纯本地FFmpeg Ken Burns)
  2. TTS配音:第一版暂用现有云端CosyVoice,待#2075完成后切换为本地部署Qwen3-TTS 1.7B(Artificial Analysis全球TTS第一,Apache-2.0可商用,3秒零样本克隆)
  3. 声音克隆:Phase 2上线,依赖#2075 Qwen3-TTS零样本克隆,用户上传10秒参考音频

AI编导Prompt体系补充(核心资产,严格按PRD §7实现)

  • 5种人设Prompt模板
  • 10个行业知识库(痛点/卖点/强词/禁忌)
  • 4种爆款结构模板(痛点钩子/反差种草/场景代入/对比冲击)
  • 4维度随机口味(开头/语气/节奏/角度)防套路化
  • few-shot参考示例库(按行业×结构组合预置)
  • 黑名单词(禁用烂大街词+广告法极限词+医疗词)
  • 全局负面约束(字幕水印/变形人脸/商品错位/加速口播等)
  • 事实审核Prompt(生成后二次校验,最多重试2次)

防坑规则补充(严格实现)

  1. 图片分析区分"明确可见事实"和"推测",严禁编造地址/电话/价格/材质
  2. 文案结构必须按选定爆款结构的时间轴,不能自由发挥
  3. 用户核心卖点必须保留,AI只能润色扩写不能篡改
  4. 有人出镜必须注入consistency特征描述保证跨镜头人脸一致
  5. 黑名单词拼入Prompt,生成后再过审核
  6. 每个分镜必须输出完整字段:景别/角度/运镜/光线/焦点/动作/台词/音效/转场/英文prompt/负面prompt

关联工单更新

  • v1.3参考视频风格分析(跟拍爆款):#2051(对应PRD Phase 2)
  • 运营数据后台MVP(数据看板/示例库/黑名单/行业知识库):#2078
  • TTS本地部署Qwen3-TTS:#2075
  • P0 Bug:MuseTalk视频倒放修复 #2073
  • P1:P4000 NVENC编码节点接入 #2074(编码加速)
  • P2:EchoMimicV2半身数字人评估 #2076(后续升级)

注:#2077为重复工单已关闭,所有v1.4内容已合并到本工单。

## v1.4 更新(2026-09-28) PRD文档已更新到v1.4版本:viral-video-feature-PRD-v1.4.html(主对话工作目录),请开发前必读最新PRD。v1.4相对v1.2父工单的重要补充: ### 技术选型更新 1. **视频生成API**:调用火山引擎Seedance 2.5 API按分镜逐镜头生成→FFmpeg拼接(不是纯本地FFmpeg Ken Burns) 2. **TTS配音**:第一版暂用现有云端CosyVoice,待#2075完成后切换为本地部署Qwen3-TTS 1.7B(Artificial Analysis全球TTS第一,Apache-2.0可商用,3秒零样本克隆) 3. **声音克隆**:Phase 2上线,依赖#2075 Qwen3-TTS零样本克隆,用户上传10秒参考音频 ### AI编导Prompt体系补充(核心资产,严格按PRD §7实现) - 5种人设Prompt模板 - 10个行业知识库(痛点/卖点/强词/禁忌) - 4种爆款结构模板(痛点钩子/反差种草/场景代入/对比冲击) - 4维度随机口味(开头/语气/节奏/角度)防套路化 - few-shot参考示例库(按行业×结构组合预置) - 黑名单词(禁用烂大街词+广告法极限词+医疗词) - 全局负面约束(字幕水印/变形人脸/商品错位/加速口播等) - 事实审核Prompt(生成后二次校验,最多重试2次) ### 防坑规则补充(严格实现) 1. 图片分析区分"明确可见事实"和"推测",严禁编造地址/电话/价格/材质 2. 文案结构必须按选定爆款结构的时间轴,不能自由发挥 3. 用户核心卖点必须保留,AI只能润色扩写不能篡改 4. 有人出镜必须注入consistency特征描述保证跨镜头人脸一致 5. 黑名单词拼入Prompt,生成后再过审核 6. 每个分镜必须输出完整字段:景别/角度/运镜/光线/焦点/动作/台词/音效/转场/英文prompt/负面prompt ### 关联工单更新 - v1.3参考视频风格分析(跟拍爆款):#2051(对应PRD Phase 2) - 运营数据后台MVP(数据看板/示例库/黑名单/行业知识库):#2078 - TTS本地部署Qwen3-TTS:#2075 - P0 Bug:MuseTalk视频倒放修复 #2073 - P1:P4000 NVENC编码节点接入 #2074(编码加速) - P2:EchoMimicV2半身数字人评估 #2076(后续升级) 注:#2077为重复工单已关闭,所有v1.4内容已合并到本工单。
Sign in to join this conversation.
1 Participants
Notifications
Due Date
No due date set.
Dependencies

No dependencies set.

Reference: xiaoxia/xiaoxia-saas#2038