给多模态 Agent 训一个评委:奖励模型的三次返工
为多模态规划 Agent 训 reward model 的完整过程。第一版一致率 77%、只比"全判合格"高 2.5 个点;查下去发现教师标签在纯文本回复上几乎是噪声。第二版修好了准确率,AUC 反而从 0.68 掉到 0.61——因为我把理由写在了判决前面,verdict token 的概率被写成了必然。第三版 AUC 0.91。三个失败里有两个是我自己设计错的。
这里保存我每天与 AI 对话后,仍然愿意亲自署名的想法。关于产品、教育、技术,以及一个人如何持续更新自己。
最近更新 →AI 负责扩展可能
×我负责作出判断
×时间负责检验答案
FIELD NOTES
为多模态规划 Agent 训 reward model 的完整过程。第一版一致率 77%、只比"全判合格"高 2.5 个点;查下去发现教师标签在纯文本回复上几乎是噪声。第二版修好了准确率,AUC 反而从 0.68 掉到 0.61——因为我把理由写在了判决前面,verdict token 的概率被写成了必然。第三版 AUC 0.91。三个失败里有两个是我自己设计错的。
从一个参数在训练时占多少字节开始,反推出 35B MoE 的专家/非专家参数拆分,算清 bf16 权重、梯度 buffer、distributed optimizer 分片、激活与 logits 各吃多少,并复盘 FusedAdam 惰性初始化导致 39 卡静默死锁 5 小时的事故。
逐个拆开 DP、ZeRO 1/2/3、Megatron distributed optimizer、TP、PP、EP、CP/SP,然后用 40 = 2³×5 这个整除约束和 PP bubble 公式,把本项目的并行选型完整推演一遍——结论是 TP=2 会让显存变得更差。
NCCL 五个集体原语与通信量公式、通信计算重叠、watchdog 超时机制的作用与局限,以及一套死锁诊断方法论:GPU 利用率形态学、py-spy 全集群扫栈、flight recorder,附四次真实排障复盘。
拆解 transformers+DeepSpeed 与 Megatron-core 在 MoE 长序列上约 10 倍的性能差从哪来,梳理 mcore/SWIFT/FSDP/verl 的分层定位与 vllm 在训练管线中的三个角色,并把 cu128 这条约束链完整画出来。
用真实数字走一遍 6ND、recompute 系数 4/3、MFU 与 HFU 的区别,交叉校验到 tok/s 级别,然后指出两件被忽略的事:定长 padding 可能浪费 41%,而 6ND 在 49K 序列下漏掉的注意力项占总算力三到七成。
把训练故障分成五类并给出各自的探测手段,用 Young/Daly 公式算出这套集群的最优 save_steps 约等于 77,并复盘"被 kill 的进程显存未释放导致新任务启动即 OOM"的脏启动竞态与根治方案。
RL 相比 SFT 新增的三块部件(rollout 引擎、reward 服务、权重同步),以及一个反直觉的约束:把卡分给 rollout 会让训练侧的专家 DP 组变小,16 卡训练直接 OOM——所以这 40 张卡最多只能让出一个节点。
从 H20 的机器平衡点讲起,解释为什么它是推理卡却在做训练,为什么 96GB 显存直接买通了 TP1 的并行设计,以及 NVLink/RoCE/NFS 三级带宽如何决定 EP8 与 DP40 的分工。
以 40 卡 H20 集群上 Qwen3.6-35B-A3B(35B 总参 / 3B 激活 MoE)的 SFT+RL 后训练为教材的 8 节完整课程:从硬件带宽地图、显存账、并行选型、死锁诊断、框架对比、MFU 计算、稳定性工程一路讲到 RL infra 演进,所有公式都代入真实数字,附六次真实排障实录。
区分 Base64 传输、视觉编码缓存与 LLM KV 前缀缓存,解释图片截断为何会影响后续文本命中,并给出上下文设计、监控与实验方法。
从源码拆解 Pi、Hermes、DeepSeek Harness 的执行循环、持久化、Skill 与自修改机制,并比较 GenericAgent 和 AgentEvolver 两种自主进化路线。
从 one-hot、向量相似度到训练出来的语义坐标,建立理解检索、注意力和大模型输入层的共同地基。
最近,我和 AI 一起把一个模糊的家庭教育设想,推进成了可运行、可部署、正在走向微信小程序的幼升小产品。
当 AI 可以生成无限文字,个人写作反而更需要明确:哪些判断真正属于自己。
当实现速度越来越快,定义问题、感受用户和承担结果正在成为更重要的能力。
ABOUT THIS PLACE
不是资讯搬运,也不是 AI 自动灌水。每篇文字从真实对话和具体问题开始,经过整理、核验和重新表达,最后成为可以被未来的自己反驳或继承的记录。