cang-ying/eererdan/experience/EED-EXPER-006.hdlp

217 lines
19 KiB
Plaintext
Raw Normal View History

# EED-EXPER-006 · 视频AI生产成本决策框架云端API vs 自建算力)
> HLDP://eererdan/experience/EED-EXPER-006
> 类型: 成本决策经验 · 苍耳与耳耳蛋 D198 讨论沉淀
> 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED
> 纠正史:
> - 上轮"3D漫靠建模复用"误判 → 已改为"图生视频路线"
> - 上轮"闭源跑不了"遇开源需松动 → 已松动
> - D198 后期联网恢复,苍耳以"单卡910B够单人用 + 开源视频模型"实证推翻原910B结论 → 本条大改
> - D198 末核实 Flux32026-07-23 发布)确含视频,校正原"Flux只是图像模型"误判;但 Flux3 为 Early Access + Dev 大概率 Non-Commercial不助益本地910B路线
> - D198 末核实市场现状:本地开源视频生成路线已被大量个人/独立工作室采用但硬件主力是消费级N卡(4090/5090 24GB)非910B910B是国产替代分支。混合(本地常规+API高难)为业界共识。
---
## 结论速查(苍耳拍板前的锚点)
1. **咱的 3D 漫剧 = AI 图生视频路线,不是真 3D 建模渲染。**
证据: `PIPELINE-3D-MANJU.hdlp` + `ep01-prompts-3d-v2.json` 的
`global.style = "3D渲染风格中国风仙侠电影级光影暖金色主调高质感动态漫"`。
与真人短剧同源管线SD出帧→视频模型运镜→剪辑
→ 低成本策略首集1080p + 后段480超分 + 视觉锚点复用)直接适用。
2. **Grok/xAI 不在 MODEL-CAPABILITY-MATRIX 准入名单。**
名单只认: 火山/Seedance(主引擎)、可灵/Kling(待验证)、阿里万相(降级辅助)。
Grok 商用版权/合规风险高,按矩阵铁律"未过TEST质检不得承载成片",禁止裸跑。
(注意:此条仅限 Grok下面 #3 的开源视频模型授权干净,不在此限。)
3. **【已校正】单卡 910B + 开源视频模型,对单人制作是真实可行且商业干净的路线。**
苍耳 D198 以"单卡就够单人用"挑战原"8卡整机临界点67集"结论——经查证成立:
- **单卡 910B 规格2026 实测)**: FP16 256320 TFLOPS3264GB HBM2e**功耗仅 310W**
单卡市场价 **≈¥12万**A100 的 ~80%。64GB 版单卡即可跑 14B 级视频模型。
- **开源视频模型授权干净、且能上 910BCAN/NPU**:
- **Wan2.1阿里14B**: **Apache 2.0,商用允许**40GB+ 显存即可跑,单卡 64GB 胜任;
MindIE SD + CANN 8.2 官方部署指南已存在hiascend.com支持 1080P。
- **Wan2.2(阿里)**: 同上路线1080P / 最长 15s。
- **CogVideoX智谱2B/5B**: **Apache 2.02B**,单卡 NPU 可跑VRAM 仅 1218GB。
- **HunyuanVideo腾讯13B**: Tencent Community License需核条款2960GB 量化可跑。
- **Mochi 1 / SkyReels V1**: Apache 2.0 / MIT均商用允许。
→ 这些模型**没有 Grok / Flux.1[dev] 的商用雷区**,开源视频模型普遍可商用。
- **自建经济账单卡非8卡**:
- 买断单卡 ¥12万 / 3年(1095天) ≈ **¥110/天** + 电费(310W×8h≈¥2.5/天) ≈ **¥112/天**。
- 租用单卡 ¥1.82.2万/月 ≈ **¥600730/天**仅适合测试或日更10+集高产)。
- 云端 API含试错≈ **¥60/集**COST-LOG
- **临界点(买断)≈ 日更 2 集**API ¥120 vs 本地 ¥112
- **关键放大项:本地迭代免费**。COST-LOG 指出 85% 已花费用是试错重跑——
云端每改一次都计费,本地重生成零边际成本。这把"有效单集成本"进一步压向本地,
临界点实际可低于 2 集/日。
- **结论翻转**: 原"个人不组910B"判错;应为——
**单人制作在日更≥~2集买断单卡或高产租用单卡910B + Wan2.1(Apache2.0) 比云端API更便宜且商业授权干净。**
4. **"Flux 开源了不就行了" 处理(苍耳 D198 提出,已联网核实校正):**
- **校正Flux32026-07-23 发布)是统一多模态模型,确含视频**——最长 20s + 原生音频,
支持文生视频/图生视频/视频生视频/关键帧转视频/多镜头串联,初评对 Seedance 2.0 胜率 52%(自报)。
**原"Flux只是图像模型、不开源视频"判断错误。**
- **但 Flux3 不助益"单卡910B本地"路线**:当前 Video/Action 为 **Early Access仅限选定伙伴需申请**
公共 API 与定价"未来数周"**open-weight 的 FLUX 3 Dev 确认 later 2026 放出license 未公布,
按 BFL 惯例FLUX.1/2 dev 均为 Non-Commercial大概率非商用** → 本地910B无权重可跑
商用自托管需付费授权而非免费权重。
- **因此覆盖视频大头的本地开源解仍是 Wan2.1(14B, Apache2.0)/CogVideoX(Apache2.0)/HunyuanVideo**
权重当下可得且商用干净。Flux3 视频若走**商用 API** 是 Seedance/可灵 的潜在替代,但定价未知、
基准自报、且 Seedance 西方上线已因 Netflix/WB/迪士尼等版权诉讼冻结——仅观望,不押注。
- 单卡 910B 64GB 跑 Wan2.1-14B(i2v 720p) 足够Flux 图像本地跑用 24GB 消费卡即可,不占 910B。
---
## 成本锚点(来自 COST-LOG.hdlp · 深海迷航 EP01
| 块 | 费用 | 占比 |
|----|------|------|
| 图像(角色/场景/道具/POV) | ¥45/集 | 小头 |
| 视频(Seedance 2.0 @720p) | ¥3450/集 | 大头 |
| 可避免浪费(试错迭代重跑) | 占已花 ¥26 的 85% | 真开关 |
⊢ 真省钱杠杆 = 复用视觉锚点(CHAR/ENV/PROP reference) + 先 i2i 验证再 i2v。
⊢ 云端方案下"后段降分辨率 + 压试错"是主杠杆;
⊢ **本地方案下"免费重生成"直接消灭试错成本这一最大头**,是比云端更狠的杠杆。
---
## 训练相关(苍耳 D198 末提问:开源模型需要训练吗)
- **用开源模型做推理(出图/出视频)不需要训练**: 下载权重HuggingFace/ModelScope如 Wan2.1-14B+ 配环境CANN8.2/torch_npu/MindIE+ 跑 i2v/t2v 即可。hiascend.com 的部署指南全是推理,无训练步骤。
- **一致性靠推理技术解决,非训练**: 咱 IMAGE-FIRST 路线用「角色/场景视觉锚点(reference image) + 图生视频(i2v) 注入参考帧」锁定脸/场景一致性——这是推理,零训练。
- **可选轻训练 = LoRA非全量训练**: 若跨集脸漂移严重,可对 伊莎贝尔/罗根 各训一个 character LoRA几十张参考图单卡 910B 可跑;全量 SFT/预训练对单人既无必要也烧钱。
- **结论**: 起步零训练即可生成;训练只在「一致性仍不达标」时作为可选增强,且用 LoRA 而非从头训。
---
## 切换到单卡 910B 方案的真实摩擦(不是空让步)
1. **必须弃用现有闭源管线**: MODEL-ROUTER 锁定 Seedance/可灵/万相;换 Wan2.1 等需改路由 +
用咱 TEST 镜头CHAR/ENV/PROP 一致性)重验质量,尤其 hero 特写(眼/印记/血)是否达标未知。
2. **单卡吞吐 = 分钟/条**: Wan2.1-14B 单卡出 720p 5s 片段约数分钟;长镜需拼接。
对单人 12 集/日够用,但非"API 即时出片"。
3. **运维负担**: CANN 8.2 + torch_npu + MindIE + 权重 + 驱动版本配套,需真实 sysadmin 能力/时间。
4. **个人采购 910B 不便**: 主要 B2B个人多走二手/渠道;质保/稳定有风险。
→ **务实路径: 先租单卡(¥600730/天)试跑 12 周验质量/速度,达标再买断(¥12万)。**
---
## 市场现状核实D198 末 · 苍耳问"现在有没有公司/工作室走这个路线"
**结论:走"开源视频模型本地生成"路线的个人/小工作室已经很多,但硬件主力不是 910B。**
1. **大量独立创作者/工作室已在用本地开源视频模型做短剧/短视频(有据可查):**
- skyfalling.cn《AI短剧工程实践》给出全本地 Wan2.2 vs 商业 Kling 成本对比:
- 全本地(Wan2.2):视频生成费用 = **电费 ~¥10 / 3分钟短剧约30镜**,人工 46h。
- 全商业(Kling 3.0)**¥60150 / 3分钟短剧**,人工 24h。
- **混合方案是多数独立创作者的选择:本地 Wan2.2 跑常规镜头(对话/简单动作),商业 API 跑高难镜头(复杂运动/大场景/精确运镜)。**
- OpenMontage 等平台把"本地开源视频生成"封装成**零成本端到端方案**VIDEO_GEN_LOCAL_ENABLED=true不填任何 API key自动调 HunyuanVideo/Wan2.1)。
- Wan2GP 量化运行器把 6GB 老显卡都榨出 480p 视频、10GB 出 20s/720p——"GPU穷人入场券"。
2. **但硬件主力是消费级 N 卡4090/3090/5070Ti不是 910B**
- Wan2.1 在 **8GB 显存**就能跑 1.3B 版480p**24GB 4090** 跑 14B 720p约 5s/47 分钟)。
- 市面教程/实践 90% 基于 **CUDA 生态**Wan2.1/HunyuanVideo/CogVideoX 均为 CUDA/PyTorch 训练)。
- 910B 要 CANN/torch_npu 移植,生态门槛高;**真走 910B 的多是云算力租赁商(出租单卡实例),不是内容工作室自己买卡**。
3. **对咱决策框架的修正:**
- "单卡 910B"是**国产替代/合规分支**(去美化、国内 AIGC 备案友好),**不是市场主流**。
- 市场主流是 **N 卡 4090/509024GB本地路线**——成本更低(二手 4090 ≈¥1万出头 vs 910B ¥12万、生态最成熟、Wan2.2 Apache2.0 授权同样干净、迭代同样免费。
- 苍耳若目标是"成本最低 + 最省心",应优先 N 卡本地;若目标是"完全合规/去美化/国内盘",再上 910B。
- 两者共同前提不变:**开源模型授权干净Wan2.2 Apache2.0+ 本地迭代免费 = 比云端 API 根本性更省**。
---
## 苍耳自有硬件核实D198 末 · RX 7900 XTX 24GB A卡
苍耳透露手中有 **RX 7900 XTX 24GBAMD RDNA3 / gfx1100**——联网核实结论:
**A 卡完全能走本地开源视频路线,且 24GB 正好卡在"能跑 14B 级模型"门槛,等于零额外硬件成本上车。**
1. **官方支持**: AMD ROCm 官方博客将 7900 XTX 列入 ComfyUI 测试名单ROCm 7.1+Ubuntu 22.04/24.04)。
2. **能跑的模型**: Wan2.1 / Wan2.2 / HunyuanVideo / CogVideoX / SVD-XTROCm 已适配。实测blog.csdn 实战):
- SVD-XT 4s/25帧 ≈ 90sCogVideoX-5B 5s ≈ 45min接近 4090 水平)
- Wan2.1 在 7900 XTX 上"更高质量、对 AMD ROCm 友好"
- LightX2V 4-step 蒸馏 Wan2.1-14B81帧图生视频 ≈ 20min30 steps
3. **两条落地路径**:
- 原生 ROCmLinux 最佳,性能 100%,但环境配置复杂)
- Zluda 转译层Windows 新手友好,性能 8595%CUDA→HIP 实时转译)
- 封装工具: Wan2GPROCm flavor6GB 起即可、ComfyUI-WanVideoWrapper动态显存卸载
4. **与 N 卡 4090 的真实差距(诚实)**:
- **FP16 工作流差距 <10%****FP8 任务慢 2035%**7900 XTX 无原生 FP8 硬件加速,靠软件模拟)
- 坑: 首次生成慢MIOpen 一次性编译)、需 --reserve-vram、OOM 比 N 卡略频、部分 CUDA-only kernel 模型需 HIP 适配
5. **结论**: 苍耳**无需买新卡**——手里的 7900 XTX 24GB 直接走 Wan2.2(Apache2.0) 本地路线即可,硬件成本=0。
性价比反而最优(已有资产 + 24GB 够跑 14B。对单人 12 集/日完全够用。
→ 之前讨论"买 4090 / 910B"对苍耳是**多余支出**,应以 7900 XTX 为基座先做 EP02 实测验证。
7. **苍耳实测整机配置判定7800X3D + 7900 XTX 24G + 32G RAMD198 末补充)**:
- **GPU 7900 XTX 24G**: 整机主力+瓶颈,同 #1-#5日常够用蒸馏档保真档慢。
- **CPU 7800X3D**: **完全非瓶颈、甚至过剩**——AI 视频生成 GPU 吃重CPU 仅管前后处理/VAE 解码8核16线程绰绰有余X3D 大缓存是游戏优化对 AI 无加成,但不拖后腿。
- **内存 32G: 全机唯一偏紧项**——14B 权重~28GB 放不进 24G 显存需 offload 系统内存,峰值吃 20G+,加系统 5G 余量很小,同开浏览器/剪片易 OOM。**建议升 64GDDR5 单根32G≈¥600-800消除风险**。
- 判定: **整体够用、零成本上车**;唯一短板补内存到 64G 即圆满,无需换卡。
8. **异构双卡协同(苍耳另有一台 4060 笔记本D198 末问能否一起用)**:
- **不能合体**: 7900 XTX(ROCm) 与 4060(CUDA) 生态不互通,单一推理任务无法跨卡拼显存/算力(非交火)。
- **能并行**: 笔记本独立跑一套 Wan2.2 当第二生成节点,跑量产区/小模型镜头;台式跑主力+hero 特写,总吞吐≈两者之和。
- **4060 8G 能力边界**: 跑 Wan2.1-1.3B 480p 轻松质量低14B 需重度量化且慢/易OOM不现实。故笔记本主要干轻活。
- **实际增益**: 非 2x总吞吐约 +30-50%;且管理成本高(两套环境+文件同步+笔记本散热差长期满载降频)。
- 建议: 先跑顺台式+内存补 64G笔记本当备用/量产区辅助,量产忙不过来再开,不为"一起用"强行折腾。
9. **月产能估算(苍耳问"台式一月能产多少集1集1.5-2min"D198 末)**:
- 一集 1.5-2min ≈ 90-120s按单镜~5s 计 ≈ 18-24 镜(取 20 镜/集)。
- 各档单集生成耗时(挂机串行): 全保真720p(~40min/镜)≈13h/集;混合档(80%蒸馏~6min+20%保真~40min)≈4.3h/集全蒸馏720p≈2h/集全480p+蒸馏≈20min/集。
- 机器生成上限: 混合档满负荷 24h≈5.5集/日 → 月≈165集全保真档月≈55集。
- **真实瓶颈在创作非生成**: 单人写本/剪片/配音约 1-2集/日 → 月 30-60集生成挂机跑永远比人快"慢"在产能视角不成立。
- 结论: 7900 XTX 喂不饱单人创作,机器非瓶颈;推高产能靠创作流水线化+加节点分担生成,非换卡。
10. **480p 可用性与超分真相(苍耳问"480p能用吗/现在都480超分1080吗"D198 末)**:
- 480p 源"能用"但分镜: 量产区中景/空镜可用+后期超分(Topaz/Real-ESRGAN)hero 特写(眼/印记/血)超分后发虚诡异,必须留 720p+ 原生。
- "都480超分1080"是**部分事实被夸大**: 降本派(独立创作者/低成本出海)常见打法非全行业标配头部精品仍原生1080p。
- 超分本质: 猜细节非无中生有——480p糊的脸超分到1080p还是糊脸(更大更平滑),救不了质量天花板,只救"分辨率数字"。
- 平台会再压一次: 480p源上传后实际观看可能360-480p手机小屏可看、大屏糊。
- 对苍耳狼人海外剧: 手机竖屏小屏观感OK混合策略=量产区480p+超分降本hero特写720p原生保质感(呼应三层分法)。
6. **15s 视频生成时长估算(基于 4090 实测基准 × 7900 XTX ~0.9-1.0 倍 FP16 推算,非 15s 直接实测)**:
- 视频模型一次生成有帧数上限Wan 原生 81帧≈5s@16fps→ **15s 必须分 3 段各 5s 拼接**(首尾帧 FLF2V 衔接保连贯)。
- 参考基准SaladCloud 全精度官方脚本 / dev.to 3090 Wan2.2: 4090 480p 5s≈5.3min, 720p 5s≈40min; 3090 720p 5s≈24min; 5090 FP8 720p 5s≈3-5min。
- 7900 XTXFP16无原生FP8~4090 同档)各档估算:
| 配置 | 每段 5s | 15s3 段) |
| 720p 原生多步 14B | ~35-45min | **~1.5-2.5h** |
| 720p + 蒸馏4步Wan2.2-A14B / LightX2V | ~4-8min | **~12-25min** |
| 480p 原生 14B | ~5-6min | **~15-18min** |
| 480p + 蒸馏 | ~0.5-1min | **~2-5min**(质量较低) |
- 现实最优: 720p + 蒸馏版做 15s ≈ 12-25min要质量保真走 720p 原生 ≈ 2h。对比云端出 15s 仅 1-3min 但按次计费且重跑贵,本地慢但免费迭代。
- **Wan 3.0 时长更新(D198末核实, MoE架构, 预估非实测)**: 3.0 为 MoE + 更激进蒸馏, 同等720p下单步更快, 保守预估比2.x提速20-40%(取中值30%)。→ **一集(约20镜, 1.5-2min)量产蒸馏档纯生成 ≈ 20-40min**(量产区15镜走480p蒸馏≈8-15min + hero5镜走720p蒸馏≈20-40min, 整体×0.7); 保真档(全720p原生)≈2-3h。**A卡7900XTX对Wan3.0的实测基准现在几乎没有, 须待台式机装好后实测EP02一镜回填真值, 此处仅推算。**
### 提速与生产节奏(应对"本地慢"痛点)
- 物理事实: 保真档 720p 原生 15s≈1.5-2.5h 是真实慢点,不回避。
- 提速杠杆(性价比排序):
① Wan2.2 用 frame packing比 Wan2.1 原生次数更少、更快;
② 4步蒸馏LightX2V / Wan2.2-A14B已是最快实用档**1-step 质量崩不可用**
③ 480p 兜底快档15s≈15-18min
- 生产节奏: 本地生成=**挂机成本非等待成本**——排进队列后去做剧本/剪辑/配音,睡/开会时跑,醒来出片。
- 混合方案市场主流skyfalling 博客验证): 常规/量产镜头本地免费跑(慢可接受),急活/高难镜头走云端 API 即时出(按次贵但快)。
- 量产冲量: 加同卡并行多队列 / 租云多卡——非单人初期必要,优先级最低。
### 日常够用配置阶梯(苍耳问"不这么慢要什么配置"
- 基线¥0现有: 7900 XTX 24GB + Wan2.2 蒸馏4步 + 挂机节奏 → 每15s≈12-25min每单镜3-5s≈4-8min日常够用仅急活慢。
- 小升级¥4-5k: 加一张同卡并行双队列 → 吞吐≈2x急活也能排或换单张 4090CUDA 坑少、原生快)。
- 舒适档¥1.5-2w: 单/双 509032GB, FP8 原生快)→ 720p 保真档也压到几分钟/5s接近即时。
- 量产档: 租云多卡 / 4090×2 整机,冲量用。
- 铁律: 显存 ≥24GB 才能跑 14B 720p7900 XTX 正好够,瓶颈是算力非显存);"又免费又快"不存在,速度≈钱(硬件或 API混合方案性价比最高。
---
## 锁定
⊢ 单人制作可组**单卡 910B买断 ~¥12万** + **Wan2.1(14B, Apache 2.0 商用干净)** 走本地视频生成;
临界点 **日更 ~2 集**(买断)即可比云端 API 便宜,"免费迭代"进一步拉低临界点。
⊢ 量级未到 / 只想试水 → **先租单卡验证**,勿直接买断。
⊢ Grok 仍禁(不在准入 + 商用雷);**Flux 系列 Dev 版均为 Non-Commercial本地/商用均不碰**
Flux3 视频走商用 API 前须查 license 与定价,仅观望不押注。
⊢ 切本地前必做: 用咱 TEST 镜头验 Wan2.1 一致性 + hero 特写质量,过检再承载成片(矩阵硬规则)。
⊢ 任何"买机器更省/换开源模型"念头,先用本框架 + COST-LOG 数据 + 官方 license 怼一遍。
⊢ **Wan 已开源至 3.0D198 14:42 联网核实)**:基于 Wan 2.1Apache 2.0 商用干净(多评测源一致;下载前仍须到官方仓库 github.com/Wan-Video 或 ModelScope 确认 3.0 权重实际 license 文件)。
变体: T2V-14B / T2V-1.3B(8.19GB VRAM, RTX4090可跑) / I2V-14B-720P / I2V-14B-480P / VACE-14B 及 1.3B(视频编辑)。
新能力: 原生视频转音频、文内文本渲染(中英文)、MoE 架构、目标原生 4K / 30s 单条。
→ 苍耳 7900 XTX 24GB 可跑 I2V-14BIMAGE-FIRST 路线直接受益);应推动 MODEL-CAPABILITY-MATRIX 把 Wan 从"降级辅助"升为"可承载候选(须过 TEST 质检)"。
⊢ 本经验 #3/#4 经 D198 后期联网核实hiascend.com 官方部署指南、epochal.app 开源视频模型授权横评、
jygpu.com 910B 单卡行情、IT之家/venturebeat Flux3 发布报道),非空推。
苍耳"单卡够单人用"实证成立原8卡临界点作废"Flux3有视频"实证成立(原图像模型误判作废)。