38-学习循环(二)-让Agent持续进化
38 · 学习循环(二)——让Agent持续进化小林在使用 Hermes 写技术文档时,发现它生成的目录结构跟自己习惯的层级不太一样——小林喜欢用两级标题加编号,而 Hermes 总是用三级标题。他纠正了一次,Hermes 说"好的,记住了"。第二次,它还是用三级标题。小林有些不耐烦了,又说了一遍。但这次之后,Hermes 再也没有犯过同样的错误。因为它不只是"记住了"这个指令,而是触发了 Skill 自改进机制,从根本上修改了生成文档的规则。这就是学习循环后两个环节的力量。一、Skill自改进机制Skill 自改进是学习循环中最"聪明"的一环。它不是在记忆中添加一条新信息,而是直接修改已有的行为规则。触发条件:Skill 自改进由用户的纠正行为触发。当 Hermes 检测到以下信号时,会启动自改进流程:显式纠正:用户说"不对"、“应该这样做”、"请修改"等明确指令结果拒绝:用户要求重做,或者对输出质量表现出明显不满模式识别:同一个 Skill 在多次执行中产生了类似的问题改进流程:问题定位:Hermes 分析是哪个 Skill 或哪个步骤导致了错误根本原因分析:是规则定义不清?是缺失了某个分支判断?还是参数配置错误?规则修正:基于用户的反馈自动修改 Skill 的指令内容验证确认:用修改后的 Skill 重新执行相同任务,确认问题已解决版本记录:记录修

相关新闻