gbrain concept-synthesis:把数千条概念存根提炼成分层知识图谱的完整实战指南
2026/9/23 2:31:20 网站建设 项目流程
  • 人工智能
  • RAG
  • Agent 记忆
  • MCP 服务
  • 知识管理

【免费下载链接】gbrain

Garry's Opinionated OpenClaw/Hermes Agent Brain

项目地址:https://gitcode.com/gh_mirrors/gb/gbrain
点击查看免费下载

本文围绕 gbrain 插件变体 gbrain-coding 中的concept-synthesis技能展开,它解决的是个人大脑(brain)库中最典型的"数据多、信息少"问题:信号检测器、语音笔记、链接摄入等管道每天都会为每个被提及的想法创建一张概念页,数月之后库中堆满数千张重复、近似重复、缺乏关联的存根页。读完本文,你将掌握该技能的五阶段处理管线——确定性去重合并、打分分层、LLM 综合、聚类成图、可逆策展剔除——以及每个阶段的判定规则、CLI 操作命令、输出页面格式与质量验收标准,能够直接把一套"从原始概念存根到分层知识图谱"的完整流水线复刻到自己的 gbrain 环境中。

一、这个技能解决什么问题

concept-synthesis(概念合成)的定位在技能 frontmatter 的description字段中写得非常明确:将原始概念存根去重并合成为一张分层知识图谱(tiered intellectual map,T1 Canon 到 T4 Riff),跨时间、跨来源追踪思想的演化,把数千张原始概念页变成一份可被策展的个人智力指纹(intellectual fingerprint)。技能声明为mutating: truewrites_pages: true,写入目录为concepts/(见 plugin-variants/gbrain-coding/skills/concept-synthesis/SKILL.md)。

它针对的核心痛点,是 gbrain 生态中多个摄入管道长期运行的必然结果:

  • 存根泛滥signal-detector(文本渠道)、voice-note-ingest(音频渠道)、idea-ingest(链接/文章渠道)会为每一个被提及的想法创建一张概念页,数月后积累出数千张页面,其中大量是重复或近似重复;
  • 时间线碎片化:同一条来源被反复抄进多张概念页,时间线条目互相重复;
  • 零综合:页面只记录"用户在某天提过 X",没有任何合成意义上的提炼;
  • 无分层:所有概念平铺,没有 Canon / Developing / Speculative / Riff 的层级区分;
  • 无聚类:相关的想法之间没有链接,无法形成领域结构。

在根技能库 skills/_brain-filing-rules.md 中,concepts/目录被明确指定为"可复用框架/论点"类内容(即心智模型)的归档位置,而 concept-synthesis 正是对这片目录进行治理的核心技能。

二、五阶段架构总览

该技能把整个治理过程拆成五个阶段,前四个阶段"只向上合并、从不删除",第五阶段才引入可逆的策展剔除(curation cull):

Phase 1: Dedup + merge(确定性) N 张存根 → 约 N/4 个规范概念 ├── Jaccard 去重(标题 + 首段词重叠) ├── 子串去重("founder mode" vs "founder mode vs manager mode") ├── 语义去重(LLM 判定:"这是同一个想法吗?") └── 把重复页的时间线与别名合并进规范页 Phase 2: Score + tier(确定性 + 启发式) 每个规范概念 → 打分并分层 ├── Frequency:引用该概念的不同来源数 ├── Timespan:首次提及到末次提及的天数 ├── Breadth:出现的不同月份数 ├── Engagement:概念承载来源的平均互动量(如有) └── Tier:T1 Canon | T2 Developing | T3 Speculative | T4 Riff Phase 3: Synthesize(LLM,仅 T1+T2) T1 + T2 概念 → 富综合 ├── Evolution narrative:想法随时间如何锐化 ├── Best articulation:互动最高或最精确的引文 ├── Related concepts:指向其他概念的交叉链接 ├── Context:想法出现/演化时的背景 └── Counter-positions:这个想法反对什么 Phase 4: Cluster + map(LLM) 全部分层概念 → 智力聚类 ├── 把相关概念归入领域(LLM 自动命名) ├── 生成聚类摘要页 ├── 构建主 concepts/README.md 完整地图 └── 识别思想谱系(概念 A → 演化为概念 B) Phase 5: Curation cull(评分表 + 可逆合并) 每个概念 → 硬判定:ELITE | KEEP | MERGE/REWRITE | DELETE ├── 6 轴评分表(实质 2x、包装 1x)+ 最低实质门槛 ├── Grounding 标签(VERIFIED / OPINION / NEEDS_SOURCE / UNSAFE) ├── 聚类预算 + 声誉风险门 ├── 带反向链接合并进聚类规范页(完全可逆) └── merge_count / independent_sources → 涌现式分层提升

三、Phase 1:确定性去重与合并

第一阶段的目标是把N张存根压到约N/4张规范概念。去重分三层递进:

  1. Jaccard 去重——基于标题 + 首段的词重叠度做确定性去重,重叠达到阈值即视为重复候选;
  2. 子串去重——处理"founder mode"与"founder mode vs manager mode"这类包含关系,短标题被长标题吸收;
  3. 语义去重——交给 LLM 回答"这两条是否表达同一个想法"。

判定为重复后,把重复页的时间线与别名(aliases)合并进规范页,别名会写进规范页 frontmatter 的aliases字段,用于后续检索。

从技能路由验证数据 routing-eval.jsonl 可以看到,该技能面向的意图正是这类批处理任务("dedupe stubs and tier them""fold the redundant stubs into canonical heads"),同时路由测试也明确了一个边界:单页删除等一次性操作不应路由到本技能(预期技能为null),也就是说本技能只处理语料级治理。

四、Phase 2:打分与分层

每个规范概念进入评分管线,四个维度共同决定其层级:

维度含义
Frequency引用该概念的不同来源数量
Timespan首次提及到末次提及相隔的天数
Breadth该概念出现的不同月份数
Engagement概念承载来源的平均互动量(如有)

四个层级对应不同的"生命周期阶段":

  • T1 Canon(经典):跨年复现的永久智力指纹;
  • T2 Developing(发展中):正在锐化、可能升级为 Canon;
  • T3 Speculative(推测):公开试验中的想法;
  • T4 Riff(即兴片段):单次提及的碎片。

分层结果写入概念页 frontmatter(tiertier_label)。质量门对层级有硬性约束:T1 不得少于 4 个月跨度或 6 次提及;T4 跨度不得超过 3 个月(详见后文"质量门"一节)。分层只写元数据,不生成综合内容——综合仅保留给 T1/T2。

五、Phase 3:T1/T2 的富综合输出格式

仅对 T1 与 T2 概念,agent 读取时间线与关联来源页,通过put_page把综合章节写入概念页。T1 Canon 的完整输出格式如下:

--- title: "concept name" type: concept tier: 1 tier_label: "Canon" mention_count: 18 distinct_months: 8 first_mention: "YYYY-MM-DD" last_mention: "YYYY-MM-DD" composite_score: 78.4 aliases: ["alternate phrasing 1", "alternate phrasing 2"] related: ["sibling-concept-1", "sibling-concept-2"] --- # concept name **Tier 1 — Canon** | 18 mentions across 8 months ## Synthesis [2-4 段叙述性文字,以第三人称分析视角追溯想法如何演化、 在用户世界观中的含义、为何重要] ## Best Articulation > "来自来源的逐字引文——这个想法最精确或互动最高的表达。" — Date ## Evolution | Period | Expression | Signal | |--------|-----------|--------| | YYYY-MM | "First articulation" | First use — aspiration frame | | YYYY-MM | "Sharpening" | Anti-pattern emerges | | YYYY-MM | "Peak form" | Cleanest expression | ## Related Concepts - sibling concept — relationship description - sibling concept — relationship description ## Timeline [含去重条目的完整时间线、引文、来源链接]

而 T3/T4 保持存根形态,不消耗 LLM 预算做综合

--- title: "concept name" type: concept tier: 4 tier_label: "Riff" mention_count: 1 --- # concept name **Tier 4 — Riff** | 1 mention > "Quote from the source" — Date

综合章节有明确的质量纪律:必须呈现演化而非复述、必须用逐字引文而非转述、相关概念用 Markdown 链接(非 wiki 链接)、严禁编造来源或日期。引文规范细节见 conventions/quality.md——该约定强制要求每条写入大脑页的事实都带[Source: ...]内联引用,并规定了引文优先级(用户直接陈述 > 编译真相 > 时间线原始证据 > 外部来源)。

六、Phase 4:聚类与概念地图

第四阶段把所有已分层概念聚成"智力宇宙",由 LLM 完成:

  • 将相关概念归入领域并自动命名;
  • 为每个聚类生成摘要页;
  • 构建主地图concepts/README.md
  • 识别思想谱系(概念 A 演化为概念 B)。

concepts/README.md的规范结构:

# Intellectual Universe ## Canon (T1) — N concepts The permanent intellectual fingerprint. Ideas that recur across years. ### [Cluster Name] - concept-slug — one-line characterization - ... ## Developing (T2) — N concepts Sharpening. Might become canon. ## Speculative (T3) — N concepts Testing in public. ## Stats - Total concepts: N - T1 Canon: N - T2 Developing: N - T3 Speculative: N - T4 Riff: N - Earliest source: YYYY-MM-DD - Latest source: YYYY-MM-DD

技能的反模式清单特别警告:聚类名不许用"Various Topics"这类泛称——"如果无法给聚类命名,说明这个聚类不存在"。

七、调用方式与 CLI 操作

该技能本质上是 Markdown agent 指令:agent 复用 gbrain 既有操作 + LLM 通道执行各阶段。核心命令序列:

# 1. 列出全部概念页 gbrain query "type:concept" --limit 10000 --json # 2. Phase 1 去重 —— agent 本地执行 Jaccard + 子串去重, # 再由 LLM 通道识别语义重复。 # 3. Phase 2 分层 —— agent 按 frequency / timespan / breadth # 为每个规范概念打分,并把层级写入 frontmatter。 # 4. Phase 3 综合 —— 对每个 T1/T2,agent 读取时间线 + # 关联来源页,通过 put_page 把综合章节写到概念页。 # 5. Phase 4 聚类 —— agent 读取分层后的概念清单, # 写出包含完整智力地图的 concepts/README.md。

这些命令对应 gbrain CLI 的实际能力:gbrain query负责结构化检索,gbrain search负责混合检索(RRF 融合打分,见 src/commands/search.ts),gbrain get / put / delete负责页面读写与软删除,gbrain history / revert负责版本历史与回滚。技能文档还特别强调一点:不要对合并候选硬编码相似度阈值——gbrain search返回的是混合(RRF 融合)分数而非原始余弦相似度,任何写死的数字都会随语料与搜索模式变化而失效。

八、Phase 5:策展剔除(Curation Cull)——本技能的核心新增

Phase 1–4 只向上合并、从不删除,数月后语料里会堆积"空洞存根稀释真正有价值的复利概念"的问题。Phase 5 就是剔除通道:为每个概念给出硬判定(ELITE | KEEP | MERGE/REWRITE | DELETE),按节奏或按需运行,且每一步破坏性操作都可逆。

约定:执行前必须阅读 conventions/test-before-bulk.md——先剔除 3–5 个聚类,读取真实输出,确认无误后才跑全量。

8.1 核心之问

如果用户两年后冷不丁翻出这个概念,它是能锐化一个想法、种下一颗新种子,还是会被当作填充物直接划走?

划走 = DELETE。

8.2 六轴评分表(每轴 1–5 分)

三个"实质"轴权重2x,三个"包装/契合"轴权重1x。实质承载概念,包装为其赢得曝光面积。

SUBSTANCE(2x 权重):

135
Insight & tension(洞察与张力)——承载真正的智力负荷:一个机制、一个非显而易见的因果链、一个反转、一个隐藏成本陈词滥调("创业很难")熟悉想法带一个具体角度一个可复用的具名机制
Originality & surprise(原创与惊喜)——颠覆预期的崭新框架,而非谁都能写的套话心灵鸡汤("自律胜过动力")透过用户视角的已知想法感觉新造且可移植的框架
Specificity & completeness(具体与完整)——自洽的主张/机制/区分,带具体细节,而非缺上下文的碎片含糊或残缺完整但泛泛具体、有据、完全自足

PACKAGING & FIT(1x 权重):

135
Voltage & wit(电压与机锋)——语言中的电荷:急转、压缩、一句落地的话平淡 / 教科书式干净可引用、有弹性
Representative(代表性)——像用户说的话,或与用户记录在案的世界观相连任何账号都写得出来与用户视角兼容无疑是用户本人的指纹
Powerful & legible(有力且可读)——可用的弹药(文章小节、演讲台词、会议框架)同时能传递用户是谁惰性琐事稍加打磨可用可直接部署 + 让别人更理解用户

8.3 评分 → 判定

加权分 = (Insight + Originality + Specificity) × 2 + (Voltage + Representative + Powerful) × 1。满分45,换算为百分比。

加权百分比判定必须同时成立的门槛
≥85%ELITE— 保留并标记可复用无任何轴 < 3;至少 2 个 5 分,且至少一个在 SUBSTANCE 轴上
75-84%KEEP(Insight ≥4 或 Originality ≥4) 且 Specificity ≥3 且 (Representative ≥3 或 Powerful ≥4)
55-74%MERGE/REWRITE 或弱保留想法好但躯干差 → 并入聚类规范页或重写为独立页。仅当来源罕见或填补覆盖空白时按原样保留,否则 DELETE
<55%DELETE

最低实质门槛(覆盖百分比):若 Insight < 3 或 Originality < 3,概念永远不能被判定为 KEEP 或 ELITE。风格不能为空洞想法买单。

MERGE/REWRITE 是真实的第三判定,不是逃避选项。许多存根里困着一个有生命力的想法,只是躯干孱弱——应并入聚类规范页或重写为独立页。使用时机:Insight ≥ 3 但 Specificity 或 Voltage 拖低总分时。

8.4 硬删除触发器(任一命中即删除,不看分数)

  • 心灵鸡汤式复述——正确但没有一句是贺卡不会写的;套话、无机制。
  • 碎片——依赖不可获取的上下文,无法自足(除非来源罕见,且即便如此也须可理解、有用)。
  • 扭曲的提取——转录乱码、思路中断、语无伦次,或伪装成概念的块头(chunk header)。
  • 偏离使命的琐事——准确但用户不会去构建、相信或使用的东西。
  • 聚类内重复——未通过 8.7 节操作重复测试。
  • 无依据的事实断言——错误或未注明来源却以事实口吻陈述的事实/历史/因果断言(见 grounding 标签),软化或删除。

8.5 Grounding 标签(仅事实类概念)——打标签而非单纯罚分

任何事实、历史、科学或因果断言都要经过真值检查,并在 frontmatter 中写入grounding:标签:

  • VERIFIED— 准确且有来源 → 可保留并部署;
  • OPINION— 明确表述为用户观点或论证 → 可保留;
  • NEEDS_SOURCE— 看似合理但以事实口吻出现且无来源 → 仅当改写为观点/主张后保留;
  • UNSAFE— 错误,或"很抓眼球但其实是错的" → 删除或软化。

技能文档的告诫值得原文保留:不要存储自信的错误——一旦被部署,它们只会让用户"更不被理解",而不是更被理解。引用规范遵循 conventions/quality.md。

8.6 声誉风险门

一个概念如果"抓眼球"但可能歪曲用户本人——让用户听起来残忍、轻视他人、或持有其实并不持有的立场——那它是负债而非弹药。即使电压得分再高,也要标记重写或删除。Powerful 的意思是使用时不招致反噬

8.7 聚类预算("大规模平庸"问题)

当大量概念来自同一来源或共享同一想法时,要评估的是集合而非单个概念。每个语义聚类的默认预算:

  • 1 个规范概念(该机制最锐利的表述)——始终保留;
  • +1–2 个,仅当每个都新增一个不同的机制、具体例子、不同情绪基调、新受众,或用户独有的措辞;
  • 超过 3 个,仅当与活跃项目绑定。

其余一律 MERGE(优先,见 8.9)或 DELETE。同一主题下四十条近乎相同的存根 → 一条规范机制概念,也许再加一句好句子,其余全部合并。

8.8 操作重复测试

不要目测"重叠百分比"。把候选概念与聚类内最佳现有概念对比,回答:它是否新增了机制、例子、情绪基调、受众或用户专属措辞?没有 → MERGE(并保留信号)或 DELETE。有 → 它新增的东西正是保留它的理由。

8.9 带反向链接的合并(Merge-with-Backlinks,可逆——什么都不销毁)

对冗余聚类,剔除是倒置的:不要删除尾巴——把它合并进规范头,让合并台账变成显著性度量。一个想法被独立推导 N 次不是膨胀,而是语料在 N 种不同语境下标记"这很重要"。删除重复会扔掉这个信号;合并则捕获它。

每次合并会在规范页上增加三个 frontmatter 字段和一个正文章节:

  • merge_count(int)——吸收的页面原始数量,含同源重复提取;
  • independent_sources(int)——聚类来源的不同来源数。这才是真正的显著性度量——原始 merge_count 在单一来源被反复提取时会虚高,independent_sources 就是修正;
  • backlinks{source, angle, date}列表)——每张被吸收页的来源及其带来的具体角度。所有框架都保留下来,只是不再作为独立顶层页存在;
  • ## Facets(正文)——规范机制放最上,然后每张被吸收页一行"as seen in {source}: {angle}"。概念变成多角度的,而非冗余的。

合并质量门(拒绝不完整合并):仅当 (a)## Facets章节为每张被吸收页提供一行(来源 + 具体角度),且 (b) 每个backlinks条目都含 source + angle + date 时,合并才被写入。空 Facets 或悬空条目 = 拒绝合并并标记该聚类人工审查。不允许半合并。

区分度守卫是硬否决,不是建议。两条看起来像重复的概念,除非 LLM 裁判肯定地确认它们陈述的是同一个机制,否则不合并。默认是不合并;裁判必须"挣来"这个合并,且其 yes/no 与理由要按聚类记录。不同机制/例子/基调 → 各自独立成规范页。相似性负责提议,判断力负责裁决。

寻找合并候选——定性区间,而非数值截止线。不要硬编码相似度阈值:gbrain search返回混合(RRF 融合)分数而非原始余弦相似度,任何钉死的数字都会随语料和搜索模式变化而失效。做法是定性地搜:用每个概念的标题 + 首段搜索,当两个概念在结果列表顶部互现、且与其余结果存在可见分差时,才把另一个概念当作合并候选。共享词汇但不共享机制的概念会落在列表中部——这正是区分度守卫大显身手的区间。全量处理前,先在自己的语料分布上做校准。

8.10 合并机制(渐进式、完全可逆)

# 0. 盘点被剔除的分层 gbrain query "type:concept" --limit 10000 --json # 1. 探测合并候选(双向顶部命中) gbrain search "concept title + first paragraph" --limit 10 # 2. 在触碰被吸收页之前,先原样归档到 _merged/ 下 # (并在其 frontmatter 加 merged_into: <canonical-slug>)。 # _merged/ 树就是撤销按钮。 gbrain get concepts/absorbed-stub gbrain put concepts/_merged/cluster-name/absorbed-stub # 3. 生长规范头:merge_count、independent_sources、 # backlinks,以及 ## Facets 章节 gbrain put concepts/canonical-slug # 4. 软删除被吸收的原页(在清除前可恢复) gbrain delete concepts/absorbed-stub # 撤销路径:gbrain restore <slug>(清除窗口内)、 # _merged/ 副本(清除后仍存活)、以及逐页版本历史: gbrain history concepts/canonical-slug gbrain revert concepts/canonical-slug <version_id>

分步提交。剔除期间不硬删除任何内容;_merged/树 + 软删除 + 页面历史让每一步都可逆。

8.11 合并台账 → 涌现式分层提升

independent_sources喂回 Phase 2 的 Frequency 轴。当规范概念的independent_sources越过语料直方图中的自然间隙——看分布,不要硬编码整数——它就成为分层提升候选(T4→T3、T3→T2、T2→T1 评审)。无规模上限:一个持续吸收合并的概念理应长胖。分层边界因此是涌现的而非手工划定的——语料在告诉你一个反复出现的想法已经挣得了自己的层级。

九、质量门

去重质量

  • 不允许两张概念页是"换了个说法的同一个想法";
  • 别名保存在 frontmatter 中供检索;
  • 运行gbrain query "type:concept"抽查数量下降情况。

分层质量

  • T1 应让人感觉"对,这就是我反复使用的框架之一"——可辨识、复现、锐利;
  • T2 应让人感觉"我正在打磨这个,它越来越清晰";
  • 任何概念不得在跨度 < 4 个月或提及 < 6 次时被标为 T1;
  • 任何概念不得在跨度 > 3 个月时停留在 T4。

综合质量

  • 呈现演化,而非复述;
  • 使用逐字引文,而非转述;
  • 链接相关概念(Markdown 链接,非 wiki 链接);
  • 不编造来源或日期。

剔除质量

  • 不得删除持有聚类内唯一机制表述的概念——规范概念挺过每一次剔除;
  • 每次合并都通过合并质量门:填充完整的## Facets+ 完整的backlinks条目,无半合并;
  • 区分度守卫裁决按聚类记录;任何合并写入前,裁判都明确说了"是";
  • 不得以事实口吻保留任何标记 UNSAFE 的主张;
  • 每张被吸收页在原件软删除前都有一份逐字_merged/副本。

十、Cron 集成

这是重活,应按节奏运行而非每个信号都触发:

  • 在大型摄入批次完成后(signal-detector 爆发、archive-crawler 运行等);
  • 每周 cron 做新增晋级 T1/T2 概念的增量综合;
  • 语料发生重大偏移时手动触发完整再综合;
  • Phase 5 剔除比综合更少运行——每月一次,或在大规模摄入波明显推高存根数之后。始终先 test-before-bulk。

十一、反模式清单

以下是技能明确列出的反模式,逐条规避即可避免最常见的事故:

  • 对 T3/T4 跑综合——把 API 预算浪费在可能永远不会锐化的想法上;
  • 编造引文或日期——时间线必须能对照既有大脑页验证;
  • 泛化聚类名("Various Topics")——无法命名的聚类不是真聚类;
  • 在无新来源材料的情况下重复综合已综合过的 T1——尊重幂等性;
  • 对合并候选硬编码数值相似度截止线——搜索分数是语料与模式相对的,用定性区间,让区分度守卫裁决;
  • 仅凭相似度合并——共享词汇不等于共享机制,区分度守卫是硬否决而非建议;
  • 删除冗余概念而非向上合并——删除会扔掉驱动分层提升的频率信号;
  • 因为措辞漂亮就保留空洞概念——最低实质门槛正是为此而设;
  • 剔除期间硬删除——归档到_merged/+ 软删除,让每条撤销路径存活;
  • 不做 3–5 个聚类抽查就全量剔除(conventions/test-before-bulk.md)。

test-before-bulk约定还给出了渐进式批量协议(10 → 100 → 500 → 全量),并要求每轮都做 count-before/count-after 核对、抽查输出、错误率 < 2%,且优先使用 gbrain 原生机制(--pace--progress-json--dry-run)而不是手写 shell 循环——这些同样适用于 Phase 5 的批量剔除。

十二、相关技能与契约

concept-synthesis是摄入管道的下游治理者,上游是三个产生原始存根的技能:

  • signal-detector——从文本渠道产生原始概念存根;
  • voice-note-ingest——从音频渠道产生原始概念存根;
  • idea-ingest——从链接/文章产生原始概念存根。

技能契约(Contract)保证:路由匹配 frontmatter 中的规范触发器;输出写入writes_to:声明的目录;遵循所引用的约定(quality.md_brain-filing-rules.md等);保留隐私契约——不含真实姓名、不含 fork 专用文件系统路径、不含上游 fork 引用。技能的输出格式与契约声明都有对应的结构一致性测试(见test/skills-conformance.test.ts),路由行为则由 routing-eval.jsonl 中的正负例持续验证。

结语

concept-synthesis的价值在于把"积累"升级为"复利":前四阶段用确定性算法 + LLM 把存根去重、分层、综合、聚类成可检索的知识图谱,第五阶段用一套可操作的评分表与可逆合并机制对语料做策展,让"重复出现"本身成为显著性信号而非垃圾。如果你正被个人知识库中的存根淹没,这套五阶段管线——尤其是independent_sources驱动的涌现式分层提升与_merged/归档的完全可逆剔除——是值得直接落地实践的完整方案。

  • 人工智能
  • RAG
  • Agent 记忆
  • MCP 服务
  • 知识管理

【免费下载链接】gbrain

Garry's Opinionated OpenClaw/Hermes Agent Brain

项目地址:https://gitcode.com/gh_mirrors/gb/gbrain
点击查看免费下载

相关推荐

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询