7.6 KiB
7.6 KiB
01_系统B总需求文档_v3_真人动态视频版
1. 项目名称
AI 真人多人生主题写真 / 动态视频 / 纪念短片生成系统
简称:
系统 B V3
真人照片 → 多人生主题 → 多世界模板 → 写真图集 / 图片视频 / 动态写真 / AI 真人动态视频
2. 产品一句话
用户上传本人、情侣、夫妻或家庭成员照片后,系统在授权和质检通过的前提下,生成专属多世界写真图集、纪念视频,以及带表情、动作、轻口型和镜头运动的 AI 真人动态视频。
3. V3 输出模式
3.1 高清写真图集
真人照片
→ 人物身份档案
→ 多世界写真图
→ 高清图片交付
适合:
- 情侣写真
- 婚礼照片
- 个人形象
- 父母纪念照
3.2 图片纪念视频
写真图
→ FFmpeg 推拉运镜
→ 配乐 / 旁白 / 字幕
→ MP4
效果类似高级相册视频、婚礼纪念片、照片动效视频。人物本身不做真实行动。
3.3 动态写真视频
写真图
→ 眨眼 / 微笑 / 头发衣服轻微动
→ 背景动效 / 花瓣光效
→ 轻口型,可选
→ MP4
适合婚礼纪念、情侣纪念、父母金婚银婚、个人形象短片。
3.4 AI 真人动态视频
真人照片
→ 真人身份档案
→ 身份锚点
→ 世界 / 场景 / 服装设定
→ 关键帧
→ 图生视频 / 参考图生视频
→ 人物动作 / 表情变化
→ 旁白 / 字幕 / BGM / 口型,可选
→ 合成成片
效果目标:
- 像抖音真人短剧
- 像真人婚礼电影
- 像真人穿越短片
- 人物有动作、表情和镜头运动
3.5 高端真人纪念片
高端版本支持:
- 多世界
- 多场景
- 关键镜头真人动态
- 誓言 / 旁白 / 口型
- 人工审核
- 人工精修
- 多轮修改
4. 第一阶段主打场景
第一阶段重点做:
- 结婚纪念
- 恋爱纪念
- 父母银婚金婚
- 情侣写真
- 个人形象定制
后续扩展:
- 家庭全家福
- 宝宝百日
- 儿童成长
- 闺蜜写真
- 亲子纪念
涉及未成年人时,必须启用更严格授权、审核和公开限制。
5. V3 标准流程
首页浏览
→ 登录
→ 创建项目
→ 选择人生主题
→ 选择套餐
→ 选择输出模式
→ 选择视觉风格
→ 选择世界观
→ 选择场景
→ 上传照片
→ 肖像和隐私授权确认
→ 照片质检
→ 真人身份档案
→ 生成身份锚点图
→ 用户确认像不像
→ 生成创作方案
→ 成本预估 / 支付 / 额度冻结
→ 生成预览
→ 用户确认
→ 正式图片 / 关键帧生成
→ 真人动态视频片段生成,可选
→ 视频片段质检
→ 配音 / 字幕 / BGM
→ 口型同步,可选
→ 合成成片
→ 人工审核
→ 用户确认
→ 下载交付
6. 核心业务对象
V3 在 V2 基础上新增或增强:
Project.output_mode
PersonProfile.identity_lock_status
PersonProfile.face_consistency_score
IdentityAnchor
MotionTemplate
VideoClip
LipSyncTask
FaceConsistencyCheck
ProviderConfig
ProviderLog
7. 真人身份锁定
系统必须建立“真实人物身份锁定”流程:
- 用户上传多张参考照片。
- 系统去 EXIF,私有存储。
- 检测清晰度、人脸数量、遮挡、角度和过度美颜。
- 生成人物档案。
- 生成身份锚点图。
- 用户确认“像本人”后才能进入正式生成。
- 后续图片和视频都必须引用身份锚点和人物档案。
身份锁定字段:
identity_lock_status
primary_reference_asset_id
approved_anchor_asset_id
face_consistency_score
age_preserve_rule
beautify_level
style_transform_level
privacy_level
8. 动作与视频片段
V3 需要动作模板:
smile
blink
turn_head
walk_forward
hold_hands
look_at_each_other
bow_ceremony
lift_veil
hug
wave
stand_still_cinematic
slow_camera_push
每个视频片段单独保存,记录:
project_id
scene_id
shot_id
person_ids
provider_id
input_asset_id
output_asset_id
prompt_text
duration
resolution
motion_type
lipsync_enabled
status
retry_count
cost_actual
quality_score
9. Provider 策略
系统 B V3 不直接依赖单一模型,必须通过 Provider 抽象管理:
TextProvider
ImageProvider
VideoProvider
VoiceProvider
MotionPortraitProvider
LipSyncProvider
FaceIdentityProvider
FaceConsistencyProvider
QualityCheckProvider
ModerationProvider
短剧向视频 Provider 预设:
MiniMax Hailuo 2.3 Fast
MiniMax Hailuo 2.3
Alibaba Wan2.6 I2V Flash
Alibaba Wan2.6 I2V
Vidu Q3 Turbo Reference
Vidu Q3 Pro
Jimeng / Seedance
Kling
Runway
MockVideoProvider
默认策略:
- 真实视频 Provider 默认禁用。
- 测试先启用一个 Provider。
- 先跑 1 个镜头小样。
- 设置单次和每日成本上限。
- 真实 Provider 失败不能回落 mock 假成功。
10. Prompt 方向
系统 B Prompt 必须强调真人身份保持:
真实短剧风格,保持参考照片中人物的五官、脸型、年龄感和气质,不能换脸,不能变成其他人。
人物穿着指定主题服装,在指定场景中自然微笑、转头、牵手或行礼。
镜头竖屏 9:16,电影感光影,真实表情,动作自然,适合抖音短视频纪念片。
负面约束:
不要改变人物身份
不要变年轻太多
不要变成欧美脸
不要多出第三人
不要脸部扭曲
不要手部异常
不要表情僵硬
不要恐怖感
不要过度美颜
不要低俗姿势
11. 成本控制
真人动态视频成本必须按以下维度估算:
- 视频片段秒数
- 视频模型
- 分辨率
- 候选数量
- 重试次数
- 口型任务
- 人工审核
后台配置:
max_video_seconds_per_project
max_clip_duration
max_clip_candidates
max_video_retry_per_clip
default_video_resolution
max_cost_per_project
max_cost_per_call
daily_cost_limit
示例:
AI 真人动态视频 40 秒:
8 个镜头
每个 5 秒
每镜头最多 1 次重试
默认 720P
12. 隐私与肖像权
系统 B V3 必须比系统 A 更严格:
- 用户作品默认私密。
- 用户照片默认不公开、不进案例库、不用于训练。
- 上传照片前必须确认拥有照片中所有人物授权。
- 涉及未成年人必须确认监护人授权。
- 公开案例必须单独授权。
- 后台查看、下载、删除用户原图必须记录审计日志。
新增授权文案:
我确认拥有上传照片中所有人物授权。
我授权平台仅为本项目生成图像和视频。
我理解 AI 生成结果可能与本人存在差异。
我确认不得上传未经授权的他人照片。
如涉及未成年人,我确认我是监护人或已获得监护人授权。
13. 后台运营能力
后台项目详情需新增:
- 人物身份锚点
- 人脸一致性评分
- 视频片段列表
- 动作模板
- 口型任务
- 视频 Provider
- 片段重试
- 片段替换
- 片段质检
- 成本统计
后台审核需新增:
- 像不像本人
- 是否变脸
- 是否男女混脸
- 是否年龄变化过大
- 动作是否自然
- 表情是否怪异
- 是否有不合适姿势
- 是否适合公开案例
14. MVP 验收标准
V3 第一版达到以下标准才可进入真实付费小样:
- 图集版可稳定生成 6-12 张图。
- 图片视频版可稳定合成 30-60 秒 MP4。
- 动态写真版可对关键图做轻微动效。
- AI 真人动态视频版可用 1 个真实 Provider 生成 1-3 个关键镜头。
- 每个真实视频片段可预估成本、生成、失败重试、质检、预览和替换。
- 真实视频失败时任务失败并提示原因,不能显示 mock 成功。
- 未成年人、公开案例、用户原图访问均有明确授权和审计。