cang-ying/eererdan/experience/EED-EXPER-006.hdlp

217 lines
19 KiB
Plaintext
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

# EED-EXPER-006 · 视频AI生产成本决策框架云端API vs 自建算力)
> HLDP://eererdan/experience/EED-EXPER-006
> 类型: 成本决策经验 · 苍耳与耳耳蛋 D198 讨论沉淀
> 耳耳蛋 ICE-GL-耳耳蛋 · PTS-VA-001-EED
> 纠正史:
> - 上轮"3D漫靠建模复用"误判 → 已改为"图生视频路线"
> - 上轮"闭源跑不了"遇开源需松动 → 已松动
> - D198 后期联网恢复,苍耳以"单卡910B够单人用 + 开源视频模型"实证推翻原910B结论 → 本条大改
> - D198 末核实 Flux32026-07-23 发布)确含视频,校正原"Flux只是图像模型"误判;但 Flux3 为 Early Access + Dev 大概率 Non-Commercial不助益本地910B路线
> - D198 末核实市场现状:本地开源视频生成路线已被大量个人/独立工作室采用但硬件主力是消费级N卡(4090/5090 24GB)非910B910B是国产替代分支。混合(本地常规+API高难)为业界共识。
---
## 结论速查(苍耳拍板前的锚点)
1. **咱的 3D 漫剧 = AI 图生视频路线,不是真 3D 建模渲染。**
证据: `PIPELINE-3D-MANJU.hdlp` + `ep01-prompts-3d-v2.json` 的
`global.style = "3D渲染风格中国风仙侠电影级光影暖金色主调高质感动态漫"`。
与真人短剧同源管线SD出帧→视频模型运镜→剪辑
→ 低成本策略首集1080p + 后段480超分 + 视觉锚点复用)直接适用。
2. **Grok/xAI 不在 MODEL-CAPABILITY-MATRIX 准入名单。**
名单只认: 火山/Seedance(主引擎)、可灵/Kling(待验证)、阿里万相(降级辅助)。
Grok 商用版权/合规风险高,按矩阵铁律"未过TEST质检不得承载成片",禁止裸跑。
(注意:此条仅限 Grok下面 #3 的开源视频模型授权干净,不在此限。)
3. **【已校正】单卡 910B + 开源视频模型,对单人制作是真实可行且商业干净的路线。**
苍耳 D198 以"单卡就够单人用"挑战原"8卡整机临界点67集"结论——经查证成立:
- **单卡 910B 规格2026 实测)**: FP16 256320 TFLOPS3264GB HBM2e**功耗仅 310W**
单卡市场价 **≈¥12万**A100 的 ~80%。64GB 版单卡即可跑 14B 级视频模型。
- **开源视频模型授权干净、且能上 910BCAN/NPU**:
- **Wan2.1阿里14B**: **Apache 2.0,商用允许**40GB+ 显存即可跑,单卡 64GB 胜任;
MindIE SD + CANN 8.2 官方部署指南已存在hiascend.com支持 1080P。
- **Wan2.2(阿里)**: 同上路线1080P / 最长 15s。
- **CogVideoX智谱2B/5B**: **Apache 2.02B**,单卡 NPU 可跑VRAM 仅 1218GB。
- **HunyuanVideo腾讯13B**: Tencent Community License需核条款2960GB 量化可跑。
- **Mochi 1 / SkyReels V1**: Apache 2.0 / MIT均商用允许。
→ 这些模型**没有 Grok / Flux.1[dev] 的商用雷区**,开源视频模型普遍可商用。
- **自建经济账单卡非8卡**:
- 买断单卡 ¥12万 / 3年(1095天) ≈ **¥110/天** + 电费(310W×8h≈¥2.5/天) ≈ **¥112/天**。
- 租用单卡 ¥1.82.2万/月 ≈ **¥600730/天**仅适合测试或日更10+集高产)。
- 云端 API含试错≈ **¥60/集**COST-LOG
- **临界点(买断)≈ 日更 2 集**API ¥120 vs 本地 ¥112
- **关键放大项:本地迭代免费**。COST-LOG 指出 85% 已花费用是试错重跑——
云端每改一次都计费,本地重生成零边际成本。这把"有效单集成本"进一步压向本地,
临界点实际可低于 2 集/日。
- **结论翻转**: 原"个人不组910B"判错;应为——
**单人制作在日更≥~2集买断单卡或高产租用单卡910B + Wan2.1(Apache2.0) 比云端API更便宜且商业授权干净。**
4. **"Flux 开源了不就行了" 处理(苍耳 D198 提出,已联网核实校正):**
- **校正Flux32026-07-23 发布)是统一多模态模型,确含视频**——最长 20s + 原生音频,
支持文生视频/图生视频/视频生视频/关键帧转视频/多镜头串联,初评对 Seedance 2.0 胜率 52%(自报)。
**原"Flux只是图像模型、不开源视频"判断错误。**
- **但 Flux3 不助益"单卡910B本地"路线**:当前 Video/Action 为 **Early Access仅限选定伙伴需申请**
公共 API 与定价"未来数周"**open-weight 的 FLUX 3 Dev 确认 later 2026 放出license 未公布,
按 BFL 惯例FLUX.1/2 dev 均为 Non-Commercial大概率非商用** → 本地910B无权重可跑
商用自托管需付费授权而非免费权重。
- **因此覆盖视频大头的本地开源解仍是 Wan2.1(14B, Apache2.0)/CogVideoX(Apache2.0)/HunyuanVideo**
权重当下可得且商用干净。Flux3 视频若走**商用 API** 是 Seedance/可灵 的潜在替代,但定价未知、
基准自报、且 Seedance 西方上线已因 Netflix/WB/迪士尼等版权诉讼冻结——仅观望,不押注。
- 单卡 910B 64GB 跑 Wan2.1-14B(i2v 720p) 足够Flux 图像本地跑用 24GB 消费卡即可,不占 910B。
---
## 成本锚点(来自 COST-LOG.hdlp · 深海迷航 EP01
| 块 | 费用 | 占比 |
|----|------|------|
| 图像(角色/场景/道具/POV) | ¥45/集 | 小头 |
| 视频(Seedance 2.0 @720p) | ¥3450/集 | 大头 |
| 可避免浪费(试错迭代重跑) | 占已花 ¥26 的 85% | 真开关 |
⊢ 真省钱杠杆 = 复用视觉锚点(CHAR/ENV/PROP reference) + 先 i2i 验证再 i2v。
⊢ 云端方案下"后段降分辨率 + 压试错"是主杠杆;
⊢ **本地方案下"免费重生成"直接消灭试错成本这一最大头**,是比云端更狠的杠杆。
---
## 训练相关(苍耳 D198 末提问:开源模型需要训练吗)
- **用开源模型做推理(出图/出视频)不需要训练**: 下载权重HuggingFace/ModelScope如 Wan2.1-14B+ 配环境CANN8.2/torch_npu/MindIE+ 跑 i2v/t2v 即可。hiascend.com 的部署指南全是推理,无训练步骤。
- **一致性靠推理技术解决,非训练**: 咱 IMAGE-FIRST 路线用「角色/场景视觉锚点(reference image) + 图生视频(i2v) 注入参考帧」锁定脸/场景一致性——这是推理,零训练。
- **可选轻训练 = LoRA非全量训练**: 若跨集脸漂移严重,可对 伊莎贝尔/罗根 各训一个 character LoRA几十张参考图单卡 910B 可跑;全量 SFT/预训练对单人既无必要也烧钱。
- **结论**: 起步零训练即可生成;训练只在「一致性仍不达标」时作为可选增强,且用 LoRA 而非从头训。
---
## 切换到单卡 910B 方案的真实摩擦(不是空让步)
1. **必须弃用现有闭源管线**: MODEL-ROUTER 锁定 Seedance/可灵/万相;换 Wan2.1 等需改路由 +
用咱 TEST 镜头CHAR/ENV/PROP 一致性)重验质量,尤其 hero 特写(眼/印记/血)是否达标未知。
2. **单卡吞吐 = 分钟/条**: Wan2.1-14B 单卡出 720p 5s 片段约数分钟;长镜需拼接。
对单人 12 集/日够用,但非"API 即时出片"。
3. **运维负担**: CANN 8.2 + torch_npu + MindIE + 权重 + 驱动版本配套,需真实 sysadmin 能力/时间。
4. **个人采购 910B 不便**: 主要 B2B个人多走二手/渠道;质保/稳定有风险。
→ **务实路径: 先租单卡(¥600730/天)试跑 12 周验质量/速度,达标再买断(¥12万)。**
---
## 市场现状核实D198 末 · 苍耳问"现在有没有公司/工作室走这个路线"
**结论:走"开源视频模型本地生成"路线的个人/小工作室已经很多,但硬件主力不是 910B。**
1. **大量独立创作者/工作室已在用本地开源视频模型做短剧/短视频(有据可查):**
- skyfalling.cn《AI短剧工程实践》给出全本地 Wan2.2 vs 商业 Kling 成本对比:
- 全本地(Wan2.2):视频生成费用 = **电费 ~¥10 / 3分钟短剧约30镜**,人工 46h。
- 全商业(Kling 3.0)**¥60150 / 3分钟短剧**,人工 24h。
- **混合方案是多数独立创作者的选择:本地 Wan2.2 跑常规镜头(对话/简单动作),商业 API 跑高难镜头(复杂运动/大场景/精确运镜)。**
- OpenMontage 等平台把"本地开源视频生成"封装成**零成本端到端方案**VIDEO_GEN_LOCAL_ENABLED=true不填任何 API key自动调 HunyuanVideo/Wan2.1)。
- Wan2GP 量化运行器把 6GB 老显卡都榨出 480p 视频、10GB 出 20s/720p——"GPU穷人入场券"。
2. **但硬件主力是消费级 N 卡4090/3090/5070Ti不是 910B**
- Wan2.1 在 **8GB 显存**就能跑 1.3B 版480p**24GB 4090** 跑 14B 720p约 5s/47 分钟)。
- 市面教程/实践 90% 基于 **CUDA 生态**Wan2.1/HunyuanVideo/CogVideoX 均为 CUDA/PyTorch 训练)。
- 910B 要 CANN/torch_npu 移植,生态门槛高;**真走 910B 的多是云算力租赁商(出租单卡实例),不是内容工作室自己买卡**。
3. **对咱决策框架的修正:**
- "单卡 910B"是**国产替代/合规分支**(去美化、国内 AIGC 备案友好),**不是市场主流**。
- 市场主流是 **N 卡 4090/509024GB本地路线**——成本更低(二手 4090 ≈¥1万出头 vs 910B ¥12万、生态最成熟、Wan2.2 Apache2.0 授权同样干净、迭代同样免费。
- 苍耳若目标是"成本最低 + 最省心",应优先 N 卡本地;若目标是"完全合规/去美化/国内盘",再上 910B。
- 两者共同前提不变:**开源模型授权干净Wan2.2 Apache2.0+ 本地迭代免费 = 比云端 API 根本性更省**。
---
## 苍耳自有硬件核实D198 末 · RX 7900 XTX 24GB A卡
苍耳透露手中有 **RX 7900 XTX 24GBAMD RDNA3 / gfx1100**——联网核实结论:
**A 卡完全能走本地开源视频路线,且 24GB 正好卡在"能跑 14B 级模型"门槛,等于零额外硬件成本上车。**
1. **官方支持**: AMD ROCm 官方博客将 7900 XTX 列入 ComfyUI 测试名单ROCm 7.1+Ubuntu 22.04/24.04)。
2. **能跑的模型**: Wan2.1 / Wan2.2 / HunyuanVideo / CogVideoX / SVD-XTROCm 已适配。实测blog.csdn 实战):
- SVD-XT 4s/25帧 ≈ 90sCogVideoX-5B 5s ≈ 45min接近 4090 水平)
- Wan2.1 在 7900 XTX 上"更高质量、对 AMD ROCm 友好"
- LightX2V 4-step 蒸馏 Wan2.1-14B81帧图生视频 ≈ 20min30 steps
3. **两条落地路径**:
- 原生 ROCmLinux 最佳,性能 100%,但环境配置复杂)
- Zluda 转译层Windows 新手友好,性能 8595%CUDA→HIP 实时转译)
- 封装工具: Wan2GPROCm flavor6GB 起即可、ComfyUI-WanVideoWrapper动态显存卸载
4. **与 N 卡 4090 的真实差距(诚实)**:
- **FP16 工作流差距 <10%****FP8 任务慢 2035%**7900 XTX 无原生 FP8 硬件加速,靠软件模拟)
- 坑: 首次生成慢MIOpen 一次性编译)、需 --reserve-vram、OOM 比 N 卡略频、部分 CUDA-only kernel 模型需 HIP 适配
5. **结论**: 苍耳**无需买新卡**——手里的 7900 XTX 24GB 直接走 Wan2.2(Apache2.0) 本地路线即可,硬件成本=0。
性价比反而最优(已有资产 + 24GB 够跑 14B。对单人 12 集/日完全够用。
→ 之前讨论"买 4090 / 910B"对苍耳是**多余支出**,应以 7900 XTX 为基座先做 EP02 实测验证。
7. **苍耳实测整机配置判定7800X3D + 7900 XTX 24G + 32G RAMD198 末补充)**:
- **GPU 7900 XTX 24G**: 整机主力+瓶颈,同 #1-#5日常够用蒸馏档保真档慢。
- **CPU 7800X3D**: **完全非瓶颈、甚至过剩**——AI 视频生成 GPU 吃重CPU 仅管前后处理/VAE 解码8核16线程绰绰有余X3D 大缓存是游戏优化对 AI 无加成,但不拖后腿。
- **内存 32G: 全机唯一偏紧项**——14B 权重~28GB 放不进 24G 显存需 offload 系统内存,峰值吃 20G+,加系统 5G 余量很小,同开浏览器/剪片易 OOM。**建议升 64GDDR5 单根32G≈¥600-800消除风险**。
- 判定: **整体够用、零成本上车**;唯一短板补内存到 64G 即圆满,无需换卡。
8. **异构双卡协同(苍耳另有一台 4060 笔记本D198 末问能否一起用)**:
- **不能合体**: 7900 XTX(ROCm) 与 4060(CUDA) 生态不互通,单一推理任务无法跨卡拼显存/算力(非交火)。
- **能并行**: 笔记本独立跑一套 Wan2.2 当第二生成节点,跑量产区/小模型镜头;台式跑主力+hero 特写,总吞吐≈两者之和。
- **4060 8G 能力边界**: 跑 Wan2.1-1.3B 480p 轻松质量低14B 需重度量化且慢/易OOM不现实。故笔记本主要干轻活。
- **实际增益**: 非 2x总吞吐约 +30-50%;且管理成本高(两套环境+文件同步+笔记本散热差长期满载降频)。
- 建议: 先跑顺台式+内存补 64G笔记本当备用/量产区辅助,量产忙不过来再开,不为"一起用"强行折腾。
9. **月产能估算(苍耳问"台式一月能产多少集1集1.5-2min"D198 末)**:
- 一集 1.5-2min ≈ 90-120s按单镜~5s 计 ≈ 18-24 镜(取 20 镜/集)。
- 各档单集生成耗时(挂机串行): 全保真720p(~40min/镜)≈13h/集;混合档(80%蒸馏~6min+20%保真~40min)≈4.3h/集全蒸馏720p≈2h/集全480p+蒸馏≈20min/集。
- 机器生成上限: 混合档满负荷 24h≈5.5集/日 → 月≈165集全保真档月≈55集。
- **真实瓶颈在创作非生成**: 单人写本/剪片/配音约 1-2集/日 → 月 30-60集生成挂机跑永远比人快"慢"在产能视角不成立。
- 结论: 7900 XTX 喂不饱单人创作,机器非瓶颈;推高产能靠创作流水线化+加节点分担生成,非换卡。
10. **480p 可用性与超分真相(苍耳问"480p能用吗/现在都480超分1080吗"D198 末)**:
- 480p 源"能用"但分镜: 量产区中景/空镜可用+后期超分(Topaz/Real-ESRGAN)hero 特写(眼/印记/血)超分后发虚诡异,必须留 720p+ 原生。
- "都480超分1080"是**部分事实被夸大**: 降本派(独立创作者/低成本出海)常见打法非全行业标配头部精品仍原生1080p。
- 超分本质: 猜细节非无中生有——480p糊的脸超分到1080p还是糊脸(更大更平滑),救不了质量天花板,只救"分辨率数字"。
- 平台会再压一次: 480p源上传后实际观看可能360-480p手机小屏可看、大屏糊。
- 对苍耳狼人海外剧: 手机竖屏小屏观感OK混合策略=量产区480p+超分降本hero特写720p原生保质感(呼应三层分法)。
6. **15s 视频生成时长估算(基于 4090 实测基准 × 7900 XTX ~0.9-1.0 倍 FP16 推算,非 15s 直接实测)**:
- 视频模型一次生成有帧数上限Wan 原生 81帧≈5s@16fps→ **15s 必须分 3 段各 5s 拼接**(首尾帧 FLF2V 衔接保连贯)。
- 参考基准SaladCloud 全精度官方脚本 / dev.to 3090 Wan2.2: 4090 480p 5s≈5.3min, 720p 5s≈40min; 3090 720p 5s≈24min; 5090 FP8 720p 5s≈3-5min。
- 7900 XTXFP16无原生FP8~4090 同档)各档估算:
| 配置 | 每段 5s | 15s3 段) |
| 720p 原生多步 14B | ~35-45min | **~1.5-2.5h** |
| 720p + 蒸馏4步Wan2.2-A14B / LightX2V | ~4-8min | **~12-25min** |
| 480p 原生 14B | ~5-6min | **~15-18min** |
| 480p + 蒸馏 | ~0.5-1min | **~2-5min**(质量较低) |
- 现实最优: 720p + 蒸馏版做 15s ≈ 12-25min要质量保真走 720p 原生 ≈ 2h。对比云端出 15s 仅 1-3min 但按次计费且重跑贵,本地慢但免费迭代。
- **Wan 3.0 时长更新(D198末核实, MoE架构, 预估非实测)**: 3.0 为 MoE + 更激进蒸馏, 同等720p下单步更快, 保守预估比2.x提速20-40%(取中值30%)。→ **一集(约20镜, 1.5-2min)量产蒸馏档纯生成 ≈ 20-40min**(量产区15镜走480p蒸馏≈8-15min + hero5镜走720p蒸馏≈20-40min, 整体×0.7); 保真档(全720p原生)≈2-3h。**A卡7900XTX对Wan3.0的实测基准现在几乎没有, 须待台式机装好后实测EP02一镜回填真值, 此处仅推算。**
### 提速与生产节奏(应对"本地慢"痛点)
- 物理事实: 保真档 720p 原生 15s≈1.5-2.5h 是真实慢点,不回避。
- 提速杠杆(性价比排序):
① Wan2.2 用 frame packing比 Wan2.1 原生次数更少、更快;
② 4步蒸馏LightX2V / Wan2.2-A14B已是最快实用档**1-step 质量崩不可用**
③ 480p 兜底快档15s≈15-18min
- 生产节奏: 本地生成=**挂机成本非等待成本**——排进队列后去做剧本/剪辑/配音,睡/开会时跑,醒来出片。
- 混合方案市场主流skyfalling 博客验证): 常规/量产镜头本地免费跑(慢可接受),急活/高难镜头走云端 API 即时出(按次贵但快)。
- 量产冲量: 加同卡并行多队列 / 租云多卡——非单人初期必要,优先级最低。
### 日常够用配置阶梯(苍耳问"不这么慢要什么配置"
- 基线¥0现有: 7900 XTX 24GB + Wan2.2 蒸馏4步 + 挂机节奏 → 每15s≈12-25min每单镜3-5s≈4-8min日常够用仅急活慢。
- 小升级¥4-5k: 加一张同卡并行双队列 → 吞吐≈2x急活也能排或换单张 4090CUDA 坑少、原生快)。
- 舒适档¥1.5-2w: 单/双 509032GB, FP8 原生快)→ 720p 保真档也压到几分钟/5s接近即时。
- 量产档: 租云多卡 / 4090×2 整机,冲量用。
- 铁律: 显存 ≥24GB 才能跑 14B 720p7900 XTX 正好够,瓶颈是算力非显存);"又免费又快"不存在,速度≈钱(硬件或 API混合方案性价比最高。
---
## 锁定
⊢ 单人制作可组**单卡 910B买断 ~¥12万** + **Wan2.1(14B, Apache 2.0 商用干净)** 走本地视频生成;
临界点 **日更 ~2 集**(买断)即可比云端 API 便宜,"免费迭代"进一步拉低临界点。
⊢ 量级未到 / 只想试水 → **先租单卡验证**,勿直接买断。
⊢ Grok 仍禁(不在准入 + 商用雷);**Flux 系列 Dev 版均为 Non-Commercial本地/商用均不碰**
Flux3 视频走商用 API 前须查 license 与定价,仅观望不押注。
⊢ 切本地前必做: 用咱 TEST 镜头验 Wan2.1 一致性 + hero 特写质量,过检再承载成片(矩阵硬规则)。
⊢ 任何"买机器更省/换开源模型"念头,先用本框架 + COST-LOG 数据 + 官方 license 怼一遍。
⊢ **Wan 已开源至 3.0D198 14:42 联网核实)**:基于 Wan 2.1Apache 2.0 商用干净(多评测源一致;下载前仍须到官方仓库 github.com/Wan-Video 或 ModelScope 确认 3.0 权重实际 license 文件)。
变体: T2V-14B / T2V-1.3B(8.19GB VRAM, RTX4090可跑) / I2V-14B-720P / I2V-14B-480P / VACE-14B 及 1.3B(视频编辑)。
新能力: 原生视频转音频、文内文本渲染(中英文)、MoE 架构、目标原生 4K / 30s 单条。
→ 苍耳 7900 XTX 24GB 可跑 I2V-14BIMAGE-FIRST 路线直接受益);应推动 MODEL-CAPABILITY-MATRIX 把 Wan 从"降级辅助"升为"可承载候选(须过 TEST 质检)"。
⊢ 本经验 #3/#4 经 D198 后期联网核实hiascend.com 官方部署指南、epochal.app 开源视频模型授权横评、
jygpu.com 910B 单卡行情、IT之家/venturebeat Flux3 发布报道),非空推。
苍耳"单卡够单人用"实证成立原8卡临界点作废"Flux3有视频"实证成立(原图像模型误判作废)。