知识入库的筛选标准
1. 对未来有帮助
- 是知识型内容,不是动作层面
- 有反复的疑问和思考、反复的提问 —— 这一条权重更大
为什么这样定
- 全量入库 = 噪音淹没信号。判断成本只是从「提炼时」挪到了「检索时」,而检索时没有上下文,更判不动。
- 「反复提问」是需求强度的天然标注:不用额外打分,行为本身已经把权重标好了。同一个疑问跨天跨 session 出现,说明它是真痛点,不是随口一问。
- 「动作层面」不收:文件路径、命令参数、执行步骤都会过期,复用价值低。
衍生的质疑(未决)
- 概念 / topic 的划分是 agent 界定的,不是你先定义的 —— 你当场追问「这是你界定的吗」。 分类法若由 agent 单方面给出,使用者长期会错位;schema 必须由使用者确认过一次才算数。
- 「知识单元 / 知识簇」同样是被追问后才补的定义,不是先有框架再落地。
相关
- 入库前先分层清洗(在哪一层收)
- 一词多义先确认所指
- 放宽过滤会连噪声一起放进来 —— 放宽准入时,噪声会从新开的口子涌入
- 定义要由使用者确认 —— 「概念/topic 的划分是谁定的」这一追问的综合判断