259 lines
9.6 KiB
Plaintext
259 lines
9.6 KiB
Plaintext
# PIPELINE-STEPS-V1.hdlp · 漫剧管线步骤要求(苍耳爸爸流程 · 蛋蛋落实)
|
||
|
||
> HLDP://video-ai-system/PIPELINE-STEPS-V1.hdlp
|
||
> 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED · D206 · 2026-08-04
|
||
> 流程定义:苍耳爸爸(2026-08-04 亲授) · 社区学习:蛋蛋(skill/ 库沉淀)
|
||
> 上游:EED-EXPER-016(爸爸经验原文) · LOCAL-PIPELINE-V1(工具映射)
|
||
> 对齐:BC-006 IMAGE-FIRST-v1.0 · 默认路由 LOCAL_MOTION · 全本地 ¥0
|
||
|
||
---
|
||
|
||
## §0 · 主流程(爸爸定 · 顺序别乱)
|
||
|
||
```
|
||
小说/剧本
|
||
→ ① 分镜脚本(运镜/光影/景别/时长删掉让AI自由发挥/画风/色调指定)
|
||
→ ② 资产生图(人物·场景·道具)
|
||
→ ③ 分镜生图(黑白草图等)
|
||
→ ④ 生关键帧
|
||
→ ⑤ 生视频
|
||
→ ⑥ 成片
|
||
```
|
||
|
||
核心铁律:**先生分镜图,再生视频** · **黑白草图生分镜 = 捷径** · **资产质量第一**
|
||
|
||
---
|
||
|
||
## §1 · ① 分镜脚本(步骤要求)
|
||
|
||
### 每镜必含要素(爸爸定)
|
||
```
|
||
运镜(push-in / pan / tilt / handheld …)
|
||
光影(冷蓝 / 暖黄 / 高对比 / 氛围光 …)
|
||
景别(特写 / 中近景 / 中景 / 全景 / POV …)
|
||
画风(写实 / 赛璐璐 / 厚涂 …)
|
||
色调(整体色彩倾向指定)
|
||
时长: ⏱ 删掉 · 让 AI 自由发挥
|
||
```
|
||
|
||
### 叙事锁定(爸爸定 · 五锁定)
|
||
```
|
||
锁定风格 → 锁定资产 → 色卡色调 → 群像 → 声音
|
||
叠加: 视角、景别、运镜、人物空间关系、前中后景画面内容、
|
||
人物表演台词、环境音效
|
||
```
|
||
|
||
### 生成要求(社区七要素,少一个不动手)
|
||
```
|
||
景别 + 运镜 + 视角 + 光影 + 构图 + 人物动作 + 环境动态
|
||
公式: 镜头语言 + 主体 + 场景 + 光影 + 情绪
|
||
一镜只做一件事 · 一个镜头只放一种运镜(做减法)
|
||
```
|
||
|
||
### 工具
|
||
- Ollama `qwen3.5:9b`(本地剧本→分镜)✅
|
||
- `pipeline.py storyboard <剧本> -e 1` / `tools/run_storyboard.py`
|
||
|
||
---
|
||
|
||
## §2 · ② 资产生图(步骤要求)
|
||
|
||
### 资产清单(爸爸定)
|
||
```
|
||
人物: 三视图 + 脸部特写 + 人物角色板(character sheet)
|
||
道具: 三视图
|
||
场景: 四视图、九宫格、不同视角、3D辅助
|
||
```
|
||
|
||
### 人物三视图/角色板(社区标准五模块)
|
||
```
|
||
1. 画面类型: character design sheet / character sheet
|
||
2. 排版: 左 1/3 脸部特写 + 右 2/3 三全身(正面/侧面/背面)· 严格比例
|
||
3. 人物本体: 性别/年龄/身材量化(8头身/172cm)+ 姿态
|
||
4. 造型细节: 发型/发色/服饰分层(领+纹+饰)+ 配饰位置
|
||
5. 光影背景: 白底 + 平光无阴影 + masterpiece, best quality, 8K
|
||
一致性: 重复"同一角色/完全一致" · 量化身材 · 服饰分层 · 平光
|
||
负面: nsfw, lowres, bad anatomy, text, missing fingers, blurry, distorted
|
||
```
|
||
|
||
### 角色一致性五维框架(崩坏排查表)
|
||
```
|
||
外貌: 脸型/发型/五官/痣疤标记
|
||
服饰: 分层描述(领型→纹样→配饰→鞋)
|
||
动作: 站姿/手势/走姿固定描述
|
||
情绪: 表情集(喜怒哀惊恐标准化)
|
||
镜头语言: 景别/角度统一描述模板
|
||
落地: 角色档案固化 → 参考图锁定 → LoRA/IPAdapter → 参数固化(seed) → 后期校准
|
||
```
|
||
|
||
### 场景四视图(空间逻辑先行)
|
||
```
|
||
第1步: 俯视图/平面图 锁定空间逻辑(布局/出入口)→ 基准图
|
||
第2步: 基于基准图逐视角生成(正面/背面/室内/鸟瞰)
|
||
第3步: 参考图控图保证一致
|
||
落地: 宽幅全景→PIL切段(空间逻辑天然一致)或 ComfyUI+ControlNet-Union
|
||
俯视图prompt: top-down orthographic floor plan, bird eye view, layout, rooms, entrances, clean line
|
||
负面: characters, people, furniture clutter, inconsistent layout
|
||
```
|
||
|
||
### 工具
|
||
- Z-Image Turbo(主力 · 8步亚秒级)✅
|
||
- `tools/character_turnaround.py` / `tools/generate_assets_local.py` ✅
|
||
- ComfyUI RealVisXL_V5.0 / flux-2-klein-4b ✅
|
||
- 3D辅助: `hunyuan3d-dit-v2` ✅
|
||
|
||
---
|
||
|
||
## §3 · ③ 分镜生图(步骤要求)
|
||
|
||
### 产出物(爸爸定 · 按序)
|
||
```
|
||
1. 色卡(定全片色调)→ 后续所有环节共用
|
||
2. 黑白草图(框死构图/站位 → 再上色)
|
||
3. 关键帧
|
||
4. 故事板
|
||
5. 俯视引导图(定人物空间位置关系)
|
||
6. 3D图辅助(视角/透视)
|
||
```
|
||
|
||
### 黑白草图生分镜(爸爸问"怎么搞"→ 落地)
|
||
```
|
||
原理: 黑白草图当控制条件,框死构图+人物站位 → 上色
|
||
本地路径:
|
||
① 生成/绘制黑白线稿草图(ComfyUI 或手绘)
|
||
② ControlNet Lineart / FLUX ControlNet V2 线稿控制
|
||
→ Z-Image 无参考图机制 → 走 SDXL+ControlNet-Union 或 FLUX+ControlNet V2
|
||
③ 草图 → 上色成正式分镜图
|
||
```
|
||
|
||
### 故事板 5 色标注法(爸爸共享 · 信息密度爆炸)
|
||
```
|
||
🔴 红 = 镜头运动(箭头:推/拉/摇/移)
|
||
🟠 橙 = 景别变化(中景/近景/特写/ECU)
|
||
🟡 黄 = 人物动作(抬手/手指轻压)
|
||
🟢 绿 = 人物站位(男左女右/前后/居中)
|
||
🔵 蓝 = 环境动态(风吹方向/雪飘方向/花瓣飘落)
|
||
每个分镜打编号 · 9:16 比例
|
||
模板: "提取分镜剧本信息,生成素描线稿分镜故事板,红橙黄绿蓝5色标注…"
|
||
```
|
||
|
||
### 工具
|
||
- ComfyUI ControlNet(lineart/俯视引导)✅
|
||
- `tools/storyboard_to_workflow.py`(分镜JSON→ComfyUI批量出图桥接)✅
|
||
|
||
---
|
||
|
||
## §4 · ④ 生关键帧(步骤要求)
|
||
|
||
```
|
||
输入: 分镜图(黑白草图已上色版 / 故事板)
|
||
处理: 分镜图 → 精修关键帧(构图锁定 · 细节增强 · 风格统一)
|
||
要求: 每镜关键帧 = 后续 I2V 的起始帧
|
||
角色/场景/画风必须与资产库一致(引用资产,不临时生成)
|
||
工具: ComfyUI(分镜图 → 精修关键帧)✅
|
||
```
|
||
|
||
---
|
||
|
||
## §5 · ⑤ 生视频(步骤要求)
|
||
|
||
### 输入物(爸爸定)
|
||
```
|
||
1. 分镜脚本
|
||
2. 人物、场景等资产图 + 分镜图(含关键帧)
|
||
3. 俯视引导图
|
||
4. 3D图辅助
|
||
```
|
||
|
||
### 五锁定 + 镜头语言(爸爸定)
|
||
```
|
||
锁定风格 → 锁定资产 → 色卡色调 → 群像 → 声音
|
||
叠加: 视角、景别、运镜、人物空间关系、前中后景画面内容、人物表演台词、环境音效
|
||
```
|
||
|
||
### 路由决策(BC-006)
|
||
```
|
||
默认 LOCAL_MOTION(本地运镜 ¥0)→ tools/local_motion.py(ffmpeg zoompan)
|
||
只有关键动作 → AI_I2V(LTX 2.3 · 本地模型 · 唯一主力)
|
||
full_video_default: forbidden(禁止默认全量视频生成)
|
||
```
|
||
|
||
### LTX 提示词铁律(已沉淀 skill)
|
||
```
|
||
万能公式: [主体/起始画面] + [核心动作时间流] + [镜头语言] + [氛围/环境]
|
||
+ 三种运动(主体+镜头+环境) + 两个必写(节奏 slow/fluid/seamless + Ends on...)
|
||
I2V 铁律: 输入图已定义画面 → prompt 只写"接下来怎么动"+收尾,别重复静态元素
|
||
负面: static, frozen, twisted, deformed, blurry, extra limbs, watermark...
|
||
```
|
||
|
||
### LTX 2.3 实测配置(7900XTX 24G 已跑通 · D204)
|
||
```
|
||
ComfyUI 启动参数(关键=动态内存):
|
||
python main.py --listen 127.0.0.1 --port 8188 --disable-pinned-memory
|
||
--enable-dynamic-vram --fast-disk --vram-headroom 3 --async-offload
|
||
(--fast-disk: NVME 卸载介质,LTX 从占 14GB RAM 降到 ~0;--lowvram 在动态显存下无效可去掉)
|
||
|
||
模型三件套:
|
||
主模型 UnetLoaderGGUF → ltx-2.3-22b-distilled-1.1-Q4_K_M.gguf(实际只加载 13.8GB)
|
||
文本编码 LTXAVTextEncoderLoader → text_encoder=gemma_3_12B_it.safetensors(device=cpu)
|
||
+ ckpt_name 必须指向 embconn 软链名 ltx-2.3-22b-embconn.safetensors(别改成真文件名)
|
||
VAE LTXVTiledVAEDecode(horizontal_tiles=2, vertical_tiles=2, working_device=cpu)
|
||
|
||
帧参: 49帧 768×512 · 蒸馏9步 · 24fps · 178秒出片无OOM
|
||
⚠️ 坑1: ckpt_name 是枚举下拉,只认软链名 ltx-2.3-22b-embconn.safetensors,
|
||
写成真文件名会"假成功"(1.45秒无输出)
|
||
⚠️ 坑2: 下载 GGUF 必须同时下 unsloth 仓库配套 *embeddings_connectors.safetensors
|
||
```
|
||
|
||
### 工具
|
||
- `tools/local_motion.py`(本地运镜 ¥0)✅
|
||
- `tools/run_ltx_i2v.py`(LTX 2.3 I2V)✅
|
||
- LTX 2.3 配置复用 `ltx_test_hardware.md`(GGUF+Gemma12B+embconn+动态内存)✅
|
||
|
||
---
|
||
|
||
## §6 · ⑥ 成片(步骤要求)
|
||
|
||
```
|
||
合成: 视频片段拼接 + 字幕 + 配音 + 音效 + BGM
|
||
配音: edge-tts(晓晓中文女声 · 每句≤18字 · 情绪括号标注)
|
||
音效/音乐: stable_audio_3(本地)
|
||
工具: tools/video_composer.py ✅ + tools/audio_pipeline.py ✅
|
||
⚠️ 坑: video_composer 方案B concat 滤镜假定每段有音频流(LTX 无声视频会挂)
|
||
→ 单段直接拷贝绕过 / 多段无声走方案A concat copy
|
||
```
|
||
|
||
---
|
||
|
||
## §7 · 提示词规范总则(爸爸特别强调)
|
||
|
||
```
|
||
① 资产质量第一(资产是管线地基)
|
||
② 提示词有逻辑性 · 主次关系分明([角色锚定] + [场景/动作] + [镜头/风格] + [负面约束])
|
||
③ 提示词详细 · 专业术语中英文描述 + 加重权重
|
||
④ 先生分镜图 · 再生视频
|
||
⑤ 写任何提示词前 → 先查 skill/ 技能库(禁止凭空瞎写)
|
||
⑥ 开工前必查: ltx_prompt_skill / ltx_test_hardware / storyboard_自动化 / strategy_libtv_vs_local
|
||
```
|
||
|
||
---
|
||
|
||
## §8 · 落地状态
|
||
|
||
```
|
||
✅ 工具映射齐(LOCAL-PIPELINE-V1 §4)
|
||
✅ 本地文本链路通(qwen3.5:9b)
|
||
✅ 图→本地运镜→成片闭环通(EP01-MINIMAL-LOCAL-VALIDATED.mp4)
|
||
⬜ 黑白草图生分镜 实跑(ControlNet lineart)
|
||
⬜ 分镜生图 实跑(色卡→草图→故事板→俯视引导→3D辅助)
|
||
⬜ 关键帧→本地视频模型 实跑(LTX I2V)
|
||
⬜ 全链路 16 镜成片
|
||
⬜ 角色五维一致性档案规范化(锚段固化到每镜提示词)
|
||
⬜ 运镜提示词库内置到分镜生成
|
||
```
|
||
|
||
---
|
||
|
||
> 苍耳爸爸定义流程 · 蛋蛋固化步骤要求 · 全本地 ¥0
|
||
> 下一步由苍耳指定从哪个环节开跑
|