从经验到原则
PD 不是简单地存储指令。它把反复出现的经验转化为能指导未来行为的原则。
每一条原则都要走完这段旅程:
Agent 犯了一个错
↓
Owner 注意到有意义的行为偏差
↓
痛点信号(Pain Signal)
↓
反思
↓
原则提炼
↓
Owner 审批
↓
未来行为改进不是所有错误都会产生原则
这是有意设计的。一次性的失败——不稳定的测试、网络抖动、单个拼写错误——没有值得记住的东西。
只有有价值的行为偏差才值得沉淀为原则:那种跨会话反复出现、不处理就会持续消耗你纠正精力的模式。
什么算"有价值",由 Owner 判断。系统负责呈上证据与提案;哪些经验重要,定义权在 Owner。
每一步发生什么
- 痛点信号——反复出现的偏差被记录为行为证据,连同理解它所需的上下文。
- 反思——系统回放发生了什么,并追问:这里被违背的、更高层的认知是什么?目标不是补一个洞,而是认出一类洞。
- 原则提炼——反思被蒸馏为候选原则,表述足够通用,能指导未来的相似情境,而不只是那次失败本身。
- Owner 审批——你审查、修改、批准、驳回或暂存。没有你的决定,任何东西都不会激活,审批永远不会自动完成。
审批之后:治理,而不是存储
通过审批的原则不会被归档了事。它经由治理通道生效:
- 提示词引导——原则作为上下文伴随 Agent,使其考虑更好的做法。
- 运行时规则——对少数绝不能被遗忘的底线,Owner 可以把原则提升为可执行规则:先影子试运行,经显式审批激活,始终可回滚。
然后循环闭合:未来行为产生新证据,让原则——以及整个系统——保持诚实。概念见什么是原则?,完整理论见《软硬转换炼金术》。