入库前先分层清洗
理由(你自己提的):无用内容(寒暄、hi、工具回显)堆叠起来再送去提炼,「就显得非常的乱,模型提取的效果也并不好」。所以顺序是:
原始会话 → ① 清洗层(每天一次,机械过滤) → ② 提炼层(判断哪些成知识) → wiki
两层的服务对象不同
这是这个设计真正的支点:
| 层 | 干什么 | 服务对象 |
|---|---|---|
| 清洗层 | 机械过滤:开场白、hi、agent 叙述、工具回显 | agent(让提炼输入干净) |
| 提炼层 | 判断:哪一轮是知识、该进哪个类别 | 人(产出给人读) |
「这个是针对 agent 的」——清洗层的价值不在产出物本身,而在于降低下一层的判断难度。它本身可以完全扔掉。
和「筛选标准」的分工
- 知识入库的筛选标准 回答:收什么(对未来有帮助 / 知识型非动作 / 反复提问权重更大)。
- 本页回答:在哪一层收。
先分层,再谈标准:如果不分层,标准再准也是在噪声里做判断,成本高且不稳。
反直觉点
直觉上「多一层 = 多一道工序 = 更慢」。这里相反:先丢垃圾比先读垃圾更省。 清洗层是机械的、可批量的;提炼层是判断的、昂贵的。把机械活提前做掉,等于把昂贵的那层喂干净。
相关
- 清洗合并会破坏源格式语义 —— 过滤之后若要合并,必须做渲染级验收
- 放宽过滤会连噪声一起放进来 —— 过滤层调参时,「修漏」与「修假」必须同时管