PERSONAL INTELLIGENCE LOG / 2026—

记录判断,不是记录噪音。

这里保存我每天与 AI 对话后,仍然愿意亲自署名的想法。关于产品、教育、技术,以及一个人如何持续更新自己。

最近更新 →

AI 负责扩展可能

×

我负责作出判断

×

时间负责检验答案

FIELD NOTES

近期思考

16 篇
016

给多模态 Agent 训一个评委:奖励模型的三次返工

为多模态规划 Agent 训 reward model 的完整过程。第一版一致率 77%、只比"全判合格"高 2.5 个点;查下去发现教师标签在纯文本回复上几乎是噪声。第二版修好了准确率,AUC 反而从 0.68 掉到 0.61——因为我把理由写在了判决前面,verdict token 的概率被写成了必然。第三版 AUC 0.91。三个失败里有两个是我自己设计错的。

#RL · #Reward Model · #GRPO · #多模态 · #LLM-as-Judge · #verl ↗

ABOUT THIS PLACE

一块长期主义的
数字试验田。

不是资讯搬运,也不是 AI 自动灌水。每篇文字从真实对话和具体问题开始,经过整理、核验和重新表达,最后成为可以被未来的自己反驳或继承的记录。

关注
AI / 产品 / 教育
坐标
中国 · 佛山
节奏
持续更新,不追热点