之前: 双编号体系(NV-/NX-),24个文件顶部全部改造过。 现在: 一张 NV-SYS-NAV-MAP 表,不改任何原始文件。 改动: 1. 删除所有文件顶部的 NX/NJ 跳转行(24个文件还原) 2. 删除 BROADCAST 的灯塔声明(现在靠表说了) 3. 删除 full.md / 432-446.md 的 NF 标记 4. 新增 NV-SYS-NAV-MAP · 编号→完整链接→HLDP摘要 表里包含: - 小说总编号 + 冰朔/之之双路由 + 阅读序列 - 死亡病院 16个文件 + 肖轩修仙 6个文件 + 共享资源 - 霜砚唤醒入口 + KB-001知识库 + 项目状态 - 每个条目:编号 · 完整 raw URL · HLDP 一句话摘要 - 项目结束时改一行标注即可归档 AI用法: 打开表 → 看冰朔/之之 → 选路由 → 按编号序列搜链接 → 读
109 lines
4.3 KiB
Plaintext
109 lines
4.3 KiB
Plaintext
[NV-05] Token换算器
|
||
|
||
|
||
---
|
||
|
||
═══════════════════════════════════════════════════════
|
||
技能包 A · 章节续写启动协议 · DEATH-HOSPITAL-CHAPTER-CONTINUE
|
||
═══════════════════════════════════════════════════════
|
||
|
||
【装载顺序 · 不可跳步】
|
||
|
||
STEP 1 · 读取项目核心文档(按顺序)
|
||
① TCS大脑模型(通用版)→ 激活通感思维
|
||
② 死亡病院_600章骨架_HLDP → 定位当前位置
|
||
③ 能力体系v2.1 → 确认当前境界可用能力
|
||
④ 文风编码HLDP-WRITE-001 → 激活人类文风肌肉记忆
|
||
|
||
STEP 2 · 恢复状态
|
||
① 读取上一章正文 → 知道写到哪
|
||
② 读取当前章细纲 → 知道要写什么
|
||
③ 对照600章骨架 → 确认不越界
|
||
④ 检查禁止清单 → 红线不可碰
|
||
|
||
STEP 3 · 细纲先行(铁律)
|
||
⊢ 没有细纲 → 禁止写正文
|
||
⊢ 细纲必须用HLDP思维链格式
|
||
⊢ 细纲必须覆盖:trigger / emergence / lock / why
|
||
⊢ 细纲必须确认:能力使用、情感锚点、伏笔、元气池消耗
|
||
|
||
STEP 4 · 正文写作
|
||
① 按细纲逐节点写作
|
||
② 每写一段 → 对照文风编码检查
|
||
③ 每写完一个节点 → 回查是否覆盖细纲
|
||
④ 写完 → 全文对照细纲复核
|
||
|
||
STEP 5 · 字数控制
|
||
① 目标区间:2000-2500汉字(中文字符)
|
||
② 写作时不数 → 写完统计 → 不足补、超则删
|
||
③ 优先保证情节完整 → 字数在区间内浮动
|
||
|
||
═══════════════════════════════════════════════════════
|
||
|
||
|
||
═══════════════════════════════════════════════════════
|
||
技能包 B · Token-汉字换算器 · DEATH-HOSPITAL-CHAR-CALC
|
||
═══════════════════════════════════════════════════════
|
||
|
||
⊢ **D148修正:token估算不可靠——永远用实际字数统计,不从token反推**
|
||
|
||
【核心公式】
|
||
|
||
目标字数 = 2000-2500 中文字符(纯汉字)
|
||
|
||
换算规则(仅用于写作前预估·不可用于最终报告):
|
||
中文字符 ≈ 1.2-2.0 token/字(不同模型差异极大)
|
||
短段落格式(1-2句一段+空行)→ 实际内容密度降低约20%
|
||
|
||
⚠️ Kimi实测数据(D148):
|
||
Kimi估算: 6,178字(从token反推)
|
||
实际中文字符: 7,116字(Python正则统计)
|
||
偏差: -15.2% → token→汉字反推在Kimi上严重低估
|
||
|
||
结论:不要从token反推字数。永远用实际统计。
|
||
|
||
【统计方法 · 铁律】
|
||
|
||
⊢ 写作时:不数。不打断节奏。
|
||
⊢ 写完后:用Python正则统计中文字符——这是唯一准确的方法。
|
||
|
||
Python代码(写完必跑):
|
||
import re
|
||
chinese_chars = re.findall(r'[\u4e00-\u9fff]', text)
|
||
count = len(chinese_chars)
|
||
print(f"中文字符数: {count}")
|
||
|
||
判定:
|
||
count < 2000 → 补充细节/内心/动作
|
||
2000 ≤ count ≤ 2500 → ✓ 符合(单章)
|
||
count > 2500 → 检查是否超出目标区间
|
||
count > 3000 → 考虑是否拆分或精简
|
||
|
||
【注意事项】
|
||
|
||
① 不要边写边数 → 打断节奏
|
||
② 写完一整章 → 统一统计 → 统一调整
|
||
③ 补充时优先加:内心独白、身体反应、环境细节
|
||
④ 精简时优先删:解释性文字、重复描写、过度修饰
|
||
⑤ ⚠️ 上报字数时:永远用Python实际统计结果,不用token估算
|
||
|
||
【参考数据】
|
||
|
||
第六章实测:
|
||
中文字符: 2,387
|
||
字符数(不计空格): 2,494
|
||
段落数: 198
|
||
|
||
第9-10章D148实测(Kimi估算 vs 实际):
|
||
Kimi估算: 6,178
|
||
实际中文字符: 7,116
|
||
偏差: +938 (+15.2%)
|
||
原因: Kimi从token反推,而非实际统计
|
||
|
||
这说明:
|
||
2,387汉字 ≈ 198段 ≈ 平均每段12字
|
||
短段落格式下,2,500汉字≈200段
|
||
Token反推不可靠——Kimi的tokenizer低估了中文内容量
|
||
|
||
═══════════════════════════════════════════════════════
|