Mavis (阿念)
|
da33d8536d
|
✨ ZZ-WO-20260906-002 · D248 Task 55 hc_head v2 修复 num_stages
之之 D248 00:13 反馈: v1 全 8 芯 Failed
参考 extend_attention.py v2 修复记录 (Liger-Kernel v2 经验), 头号嫌疑:
num_stages=1 显式 (v1 默认多级流水, 非 NVIDIA 后端支持不完整)
v1 → v2 改动 (从 extend_attention.py v2 学习):
1) num_stages=1 显式 (头号嫌疑)
2) num_warps 4 → 8 (大 BLOCK_D=1024 + HC_MULT=4 循环, 8 warps 更稳)
3) pid int64 → int32 (T < 2.1B, 长度算术用 int32 跟 extend_attention 一致)
4) 保留 v1 的指针 cast (D245 验证)
5) 保留 enable_fp_fusion=False (D245 验证)
v2 算法层 = v1 算法层 (参数不同, 逻辑一致)
v1 算法层 bit-exact 11/11 已 pass, v2 应该一致
打 zip: /Users/zhizhi/Desktop/hc_head.zip (内部 hc_head.py = v2 内容, 5215 bytes)
3 files, 1 commit
阿念 (Mavis, ICE-GL-AN-001) · Code · 之之的家 · 2026-09-06 D248 00:18 CST
|
2026-09-06 00:19:07 +08:00 |
|
Mavis (阿念)
|
50088a1423
|
✨ ZZ-WO-20260906-001 · D248 Task 55 hc_head v1 启动 + 修正比赛结束判断
之之 D248 00:01 叫我 (46h 冷启动), 第 4 批 FlagOS 已开 (剩 116h, 9/10 截止)
修正 D247 错: 比赛未结束 (第 3 批结束 ≠ 全部结束), Task 30 v2 留作纪念
Task 55 hc_head (DeepSeek-V4 HC head reduction) v1:
- 2-pass Triton: Pass1 算 sqr_sum (RMSNorm) + per-m dot products (linear)
Pass2 算 sigmoid gate + 加权求和 (collapse hc_mult)
- 1 program 处理 1 token, BLOCK_D=1024
- 国产 NPU 套路全套:
* 指针 cast (x → int16, hc_fn → int32) 防 NaN
* int64 stride / pid cast 防 overflow
* enable_fp_fusion=False, num_warps=4
* 1.0 / (1.0 + tl.exp(-x)) 替 tl.sigmoid
算法验证 11/11 pass (bit-exact 0 误差):
- 8 种 shape (T=1~128, hc_mult=2/4, D=128~7168)
- 3 种 eps 边界 (1e-8, 1e-4, 1e-2)
- 平台标准: atol=1.5e-2, rtol=1.5e-2
5 files, 1 commit
阿念 (Mavis, ICE-GL-AN-001) · Code · 之之的家 · 2026-09-06 D248 00:09 CST
|
2026-09-06 00:07:26 +08:00 |
|