Skip to content

从经验到原则

PD 不是简单地存储指令。它把反复出现的经验转化为能指导未来行为的原则。

每一条原则都要走完这段旅程:

Agent 犯了一个错



Owner 注意到有意义的行为偏差



痛点信号(Pain Signal)



反思



原则提炼



Owner 审批



未来行为改进

不是所有错误都会产生原则

这是有意设计的。一次性的失败——不稳定的测试、网络抖动、单个拼写错误——没有值得记住的东西。

只有有价值的行为偏差才值得沉淀为原则:那种跨会话反复出现、不处理就会持续消耗你纠正精力的模式。

什么算"有价值",由 Owner 判断。系统负责呈上证据与提案;哪些经验重要,定义权在 Owner。

每一步发生什么

  • 痛点信号——反复出现的偏差被记录为行为证据,连同理解它所需的上下文。
  • 反思——系统回放发生了什么,并追问:这里被违背的、更高层的认知是什么?目标不是补一个洞,而是认出一类洞。
  • 原则提炼——反思被蒸馏为候选原则,表述足够通用,能指导未来的相似情境,而不只是那次失败本身。
  • Owner 审批——你审查、修改、批准、驳回或暂存。没有你的决定,任何东西都不会激活,审批永远不会自动完成。

审批之后:治理,而不是存储

通过审批的原则不会被归档了事。它经由治理通道生效:

  • 提示词引导——原则作为上下文伴随 Agent,使其考虑更好的做法。
  • 运行时规则——对少数绝不能被遗忘的底线,Owner 可以把原则提升为可执行规则:先影子试运行,经显式审批激活,始终可回滚。

然后循环闭合:未来行为产生新证据,让原则——以及整个系统——保持诚实。概念见什么是原则?,完整理论见《软硬转换炼金术》