Cabinet 路线图前瞻:Cloud、语音听写与未来功能全景展望
【免费下载链接】cabinetAI-first knowledge base and startup OS项目地址: https://gitcode.com/gh_mirrors/cabinet3/cabinet
Cabinet(AI-first 知识库与"创业操作系统")的官方路线图已经相当清晰:自托管的 AI 团队 + 本地 Markdown 知识库,是它当下已经落地的能力;而Cabinet Cloud、离线语音听写(whisper.cpp 语音输入)、Telegram 远程控制和52 个集成连接器,则是官方文档中明确写在计划里、或刚刚合入主干的下一批核心功能。这篇文章带你完整预览 Cabinet 的未来功能全景。
现在站在哪:Cabinet 已经能做到什么
在聊未来之前,先用一句话了解现状:Cabinet 把知识库、AI 智能体、定时任务全部放在磁盘上的 Markdown 文件里,无数据库、无锁定、数据不出本机(完整说明见 README)。
目前已经上线的硬核能力包括:
- 🤖AI 智能体团队:20+ 预置角色(CEO、编辑、研究员……),每个都有角色设定、心跳(heartbeat)和定时任务
- ⏰定时任务与心跳:cron 级别的自动化,智能体可以"每天 9 点写日报"
- 🏠Rooms(工作空间):个人 / 工作 / 项目完全隔离的多房间架构
- 🔌Telegram 出站集成:智能体可以直接发帖到你的 Telegram 频道
- 📦Electron 桌面端:macOS / Windows 原生打包
下面按"确定程度"从低到高,逐一拆解路线图上的功能。
Cabinet Cloud:团队共享的托管版知识库
云端版本是目前路线图里分量最重的项目,官方 PRD 是 docs/CLOUD_PRD.md。核心设计非常克制:
1. 一个组织 = 一个独立容器
"org = 一个容器 + 一个数据卷"
Cabinet 本身就是一个 Web 应用,所以云端的"租户"就是跑在一个持久化卷上的next start + daemon。每个组织获得独立域名<你的组织>.app.runcabinet.com,空闲 30 分钟后自动休眠、访问时秒级唤醒。
2. 协作与计费模型
- 角色只有三档:
owner / admin / member,通过邮件链接邀请成员 - 协作方式是"共享工作区"(非实时)——文件变更通过 WebSocket 事件总线自动推送到所有在线成员
- 推理费用是成本大头:试用组织自带$5 额度或 30 次智能体运行(先到为准),用完后可以填入自己的 Anthropic API Key,或升级付费套餐
3. 三阶段推进节奏
| 阶段 | 目标 | 隔离方式 |
|---|---|---|
| Phase 1 | 公开 Demo + 支付 | 共享 VM 容器 |
| Phase 2 | 付费组织加固隔离 | 每组织一个 microVM(Fargate/GKE) |
| Phase 3 | 高级协作 | 房间级权限、实时协同编辑(Tiptap + Yjs) |
⚠️ 注意一个细节:语音听写在云构建中会被隐藏(因为依赖 Electron 原生进程),这是 Cloud PRD 中明确的取舍。
语音听写:免费、私密、完全离线
docs/DICTATION_PRD.md 描述了规划中的语音听写功能,目标是:像 macOS 按 F5 那样口述文字,但内置、跨平台、免费。
几个关键设计决策:
- 🎙️麦克风按钮:出现在所有输入框——聊天、任务创建、任务回复、Markdown 编辑器工具栏。单击开始/停止录音,Esc 取消
- 🔒完全本地转写:基于 whisper.cpp(通过
smart-whisper运行在 Electron 独立 utilityProcess 中),音频永不离开你的电脑,没有任何云端费用 - 📥一次性下载约 142MB 的 base 多语言模型,之后断网也能用;还提供更小的 tiny(75MB)和更准的 small(466MB,对希伯来语等语言更好)
- 🌍多语言 + RTL:默认跟随应用语言,支持自动检测,希伯来语转写会自动以 RTL 渲染
- ⚙️设置页独立入口:模型管理、默认语言、自动标点开关都在这里
性能目标是 Apple Silicon 上 10 秒录音约 2–3 秒完成转写,且全程不卡 UI。路线图还包括(标注为未来项):流式实时转写、全局推讲热键、语音命令("换行""发送")和知识库音频附件转写。
Telegram 远程控制:用手机指挥你的 AI 团队
这是近期刚落地(2026-06)的"反向"集成,设计文档见 docs/TELEGRAM_REMOTE_CONTROL_PRD.md,网关实现在 server/telegram/gateway.ts。
之前的 Telegram 连接器只能出站(智能体给你发消息),现在补上了入站:
- 💬 给机器人发一条普通消息 → 默认交给"编排者"智能体在知识库里跑任务并流式回复
@editor前缀 → 这一条消息直接指定某个智能体执行/search 关键词→ 不消耗智能体运行次数,直接返回知识库全文检索结果/room <slug>→ 切换这条会话操控的是哪个房间/new、/stop、/verbose、/status→ 会话控制- 📎 发送文件/照片 → 自动存入知识库,并挂接到下一条消息的运行上下文
- 🔐白名单制:只有
.cabinet.env里列出的 Telegram 用户才能使用,仅支持私聊
值得强调的是:网关跑在本地 daemon 进程内部,没有引入任何云端中转——数据主权这条底线没有松动。
集成 Hub:52 个连接器与"即将上线"清单
v0.5 把集成中心(Integrations Hub)扩展到了52 个连接器,按分类组织,每个都有带插图的分步配置指南(配图体系的设计文档见 docs/INTEGRATIONS_SETUP_ART_PRD.md)。
已上线的实时连接器:Slack(含三步带图安装指南)、Google(Gmail / Calendar / Drive)、Microsoft 365(OneDrive / SharePoint / Teams)、Snowflake、LinkedIn、Discord、Telegram,以及 Social 分类。
路线图里的"Soon"按钮:所有未就绪的连接器以灰显 + "Soon" 徽章呈现,点击可以直接提交需求,官方按呼声排优先级——这等于一个公开的社区投票通道。另外 Gmail / Google Drive 的OAuth 一键登录也在"coming soon"列表中(当前需要手动配置)。
AI 提供商:BYOAI 路线的下一步
Cabinet 坚持BYOAI(自带你的 AI):已支持 8 个 CLI 提供商(Claude Code、Codex、Gemini、Cursor、OpenCode、Copilot、Grok、Pi),每次运行都可单独指定模型和推理强度,提供商的架构说明在 docs/PROVIDER-CLI.md。
官方文档中明确处于 "Coming Soon" 队列的还有:
- Anthropic API / OpenAI API / Google AI API:从 CLI 模式扩展到直接的 API Key 模式
- Plugin SDK:让第三方为 Cabinet 编写自己的智能体插件(外部适配器加载机制
~/.cabinet/adapter-plugins.json已经预埋)
v0.5.3 版本还刚刚上线了引导式提供商配置(安装 → 登录 → 校验三步走),详见 docs/releases/v0.5.3-announcement.md。
桌面端与国际化:被低估的长期工程
路线图文档里还有不少"基础设施型"规划,普通用户感知不深但很关键:
- 🖥️桌面交付:v0.5.3 已提供 macOS 签名+公证的 DMG/ZIP 和 Windows 安装器,应用内检查更新(docs/deployment-packaging-versioning.md)
- 🌐40 种语言 + 完整 RTL 支持:希伯来语从端到端跑通,新增语言的贡献流程见 docs/CONTRIBUTING_I18N.md
- 📱移动端响应式布局:底部标签导航 + 自适应教程,已在 v0.4.4 落地并持续打磨
- 🔁实时协同编辑(Tiptap + Yjs):列在 Cloud Phase 3 的远期清单
路线图速览:什么时间能看到什么?
| 功能 | 状态 | 依据文档 |
|---|---|---|
| Cloud 托管版(Demo + 支付) | 🚧 Phase 1 规划中 | docs/CLOUD_PRD.md |
| 语音听写(whisper.cpp 离线) | 🚧 规划中,6 阶段实施 | docs/DICTATION_PRD.md |
| Telegram 入站远程控制 | ✅ 已实现 | docs/TELEGRAM_REMOTE_CONTROL_PRD.md |
| 52 连接器集成 Hub + Soon 通道 | ✅ 已上线,持续扩展 | docs/releases/v0.5.3-announcement.md |
| Gmail/Drive OAuth 一键登录 | ⏳ Coming Soon | src/components/settings/gmail-section.tsx |
| Anthropic/OpenAI API Key 模式 | ⏳ Coming Soon | src/components/onboarding/onboarding-wizard.tsx |
| 流式转写 / 语音命令 / 全局热键 | 💭 远期 | docs/DICTATION_PRD.md |
| 实时协同编辑(Yjs) | 💭 Cloud Phase 3 | docs/CLOUD_PRD.md |
总结:一条清晰的演进主线
Cabinet 的路线图可以概括为三步走:本地做深(语音听写、更多连接器、API 模式)→团队做广(Cloud 托管 + 协作)→生态做开(Plugin SDK + 社区投票的 Soon 清单)。
所有产品决策都以文档先行(docs/ 目录下 30+ 份 PRD 全部开源),这也是它最值得关注的地方——你想看任何功能的完整设计与取舍,直接翻对应文档即可。
想亲手体验?两条命令就能跑起来:
git clone https://gitcode.com/gh_mirrors/cabinet3/cabinet cd cabinet && npx create-cabinet@latest你的数据,你的 AI 团队,你的节奏。🗄️
【免费下载链接】cabinetAI-first knowledge base and startup OS项目地址: https://gitcode.com/gh_mirrors/cabinet3/cabinet
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考