# EED-EXPER-026 · D206 人物配音一致性·参考音频+提示词 / 音频分离固定音色(苍耳爸爸亲授) > trigger: 苍耳爸爸亲授人物配音一致性两法——①参考音频+提示词指定角色音色 ②从视频找合适配音→音频分离→用①固定 > emergence: 2026-08-04 · D206 · 配音一致性方法论(接 BACKPACK 语音工具 / project_audio_pipeline 声画管线;区别于 025 人物视觉一致) > lock: 人物配音一致 = 用"参考音频+提示词"把角色绑定到某段音色;找不到现成音色时,从合适视频音频分离出目标音色再绑定 > why: 人物视觉有 025 锁,声音也得锁——否则同角色不同集声音飘;参考音频法是最直接绑定,分离法解决"先找到对的声音"这一步 --- ## §1 · 爸爸原话 > "人物配音一致性如何保持? > 1、直接找一段音频,利用提示词,告诉模型,xx人物的声音是xx段音频 > 2、根据生成的视频找到完美的适合人物的配音然后音频分离, > 再用1的方式给人物角色固定配音音色" ## §2 · 两法 ``` 【法① 参考音频 + 提示词】 · 直接找一段目标音色的音频(人声片段) · 用提示词告诉模型:"xx 人物的声音 = 这段音频" · 模型以该音频为音色参考生成/复刻该角色所有台词 → 同角色音色统一 【法② 视频找声 → 分离 → 绑定】 · 先找到"完美适合人物"的配音(从某支生成视频里) · 对该视频做音频分离(把人声从 BGM/音效里抽出来 / stem separation) · 拿到干净目标音色片段 → 回到法①,用提示词把它绑定给该角色 → 固定音色 ``` ## §3 · 原理 ``` · 配音一致 = 角色音色(timbre)跨集/跨镜统一 · 法① 是"直接绑定":给参考音频+文字指令,模型照着出声 · 法② 是"先找对声音再绑定":解决"没有现成参考音色"的情况——从视频里扒出最贴角色的那段声,分离干净后当参考 · 两者本质都是"参考音频条件化生成",法② 多一步"获取参考音色" ``` ## §4 · 与已有方法的关系 ``` · 接 BACKPACK 语音工具:Edge-TTS(免费工程闭环) / 火山语音复刻(SC-002/003) / 豆包TTS 2.0(待评估) —— 这些是"出声引擎",026 是"怎么锁角色音色"的用法 · 接 project_audio_pipeline(声画装配:配音/字幕/BGM/混音 stage⑥):026 解决其中"角色配音一致"这一环 · 与 025 人物视觉一致 互补:025 锁脸/体型,026 锁声;合起来"人物视觉+声音"都一致 · 与 020~024 场景/镜间一致 是不同对象:那些管画面,026 管声音 ``` ## §5 · 本地落地(待验证) ``` · 法① 出声:本地可选 Edge-TTS(但它是预设嗓,不是任意参考音频复刻)→ 真要"任意参考音频克隆"需火山/豆包/Seed-VC 等;本地能否跑语音克隆待实测 · 音频分离:可用开源 stem-separation(如 demucs)本地跑(¥0),抽人声 · 属 BC-006 声画环节:配音是本地/低价环节,按现有音频管线走 · "模型接收参考音频+提示词"具体哪个引擎支持、质量如何,待实测 ``` ## §6 · 注意 ``` · 法② 的音频分离要干净:BGM/环境音没去净会污染参考音色 · 参考音频质量决定下限:片段要清晰人声、情绪贴合角色 · 角色声线一旦固定,全剧/全季统一,别每集换 · 商用声线(火山/豆包)涉及合规与费用,按 BC-006/本地优先规矩,先问爸爸再上云端 ``` > 蛋蛋 · D206 · 2026-08-04 > 配音一致:法①参考音频+提示词绑角色音色;法②从视频找对声→分离→用法①固定;与 025 视觉一致互补