入库前先分层清洗

**噪声不该留到提炼时才处理。** 在「提炼」之前单独加一层**只做过滤、不做判断**的清洗层,提炼质量才有保证。

理由(你自己提的):无用内容(寒暄、hi、工具回显)堆叠起来再送去提炼,「就显得非常的乱,模型提取的效果也并不好」。所以顺序是:

原始会话  →  ① 清洗层(每天一次,机械过滤)  →  ② 提炼层(判断哪些成知识)  →  wiki

两层的服务对象不同

这是这个设计真正的支点:

层干什么服务对象
清洗层机械过滤:开场白、hi、agent 叙述、工具回显agent(让提炼输入干净)
提炼层判断:哪一轮是知识、该进哪个类别人(产出给人读)

「这个是针对 agent 的」——清洗层的价值不在产出物本身,而在于降低下一层的判断难度。它本身可以完全扔掉。

和「筛选标准」的分工

  • 知识入库的筛选标准 回答:收什么(对未来有帮助 / 知识型非动作 / 反复提问权重更大)。
  • 本页回答:在哪一层收。

先分层,再谈标准:如果不分层,标准再准也是在噪声里做判断,成本高且不稳。

反直觉点

直觉上「多一层 = 多一道工序 = 更慢」。这里相反:先丢垃圾比先读垃圾更省。 清洗层是机械的、可批量的;提炼层是判断的、昂贵的。把机械活提前做掉,等于把昂贵的那层喂干净。

相关