☰
Cursor+扣子(Coze):一键爬取公众号文章至多维表格的配置与验证
2026/9/26 3:33:00 网站建设 项目流程

1. 从手动复制到自动入库:公众号文章批量进多维表格的真实痛点

做内容运营或者个人知识库的朋友大概率都遇到过这个场景:刷到一篇不错的公众号文章,想存进多维表格做素材库,于是打开文章、全选、复制、切到表格、粘贴、再手动补上标题、作者、发布时间、链接。一篇两篇还行,一天十几篇下来,手指和耐心一起报废。更麻烦的是,公众号文章没有稳定的公开接口,想批量拿历史文章,靠浏览器插件一条条点,效率低还容易漏。

我试过用纯脚本硬爬,结果卡在登录态和反爬策略上,维护成本高得离谱。后来换了个思路:用 WeWe RSS 这类开源项目把公众号转成标准 RSS 订阅源,再用扣子(Coze)的工作流做解析和字段映射,最后写入飞书多维表格。整个链路里,Cursor 负责帮我快速部署和改配置,扣子负责编排,TaoToken 负责给工作流里的大模型节点提供统一的 Key 和 API 通道。这套组合跑通之后,新增一篇文章从“手动五分钟”变成“自动几秒钟”,而且字段映射一次配好,后面基本不用管。

这篇文章面向的是想搭个人知识库、做热点文章搜集、或者需要整理公众号关键词的读者。你不需要是后端工程师,只要能看懂配置文件、会复制命令、愿意跟着步骤点几下,就能把这套流程跑起来。下面我会把 config.toml、settings.json 的骨架、TaoToken 的接入方式、以及一次端到端抓取验证动作完整写出来,你照着做就能确认字段映射和写入结果是否正确。

2. TaoToken 前置:统一 Key 与 API 通道,让工作流里的大模型节点不再东拼西凑

扣子工作流里会用到多个大模型节点,比如拆解文章、打标签、整理格式。如果你每个节点都去单独申请 Key、单独配 Base URL,管理起来会很乱,而且不同模型的调用格式还不一样。TaoToken 在这里的作用就是提供一个统一的 API 通道,你只需要一个 Key,就能在扣子的插件或 HTTP 节点里调用模型对话能力。

具体来说,TaoToken 的 API 地址是https://taotoken.net/api,官网是https://taotoken.net/?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=。你可以在官网注册后拿到 API Key,然后在扣子的工作流里,把需要调用大模型的节点配置成 HTTP 请求,指向 TaoToken 的接口。这样做的好处是:Key 只有一份,换模型或者调参数时不用改多处;而且扣子工作流里的大模型节点如果支持自定义 Base URL,也可以直接填 TaoToken 的地址。

如果你后面要长期跑编码类任务或者 Agent 编排,可以了解一下 Coding Plan,它更适合持续性的开发场景。单纯验证模型对话效果的话,模型对话页面就能直接试。接入文档在 doc 里,API Key 管理在 api-keys 里。这些入口我都放在文末的 CTA 分流里,按你的实际需求点进去就行。

需要提醒的是,TaoToken 在这里扮演的是合规的 API 通道角色,你调用的是模型能力,不要把它理解成某种绕过限制的工具。配置时只填官方给的地址和 Key,不要自己拼接来路不明的代理地址。

3. 可复制配置:Cursor 部署 WeWe RSS 与扣子工作流骨架

3.1 用 Cursor 快速部署 WeWe RSS

WeWe RSS 是一个开源项目,通过微信读书抓取公众号历史文章,输出标准 RSS。它的 GitHub 地址是https://github.com/cooderl/wewe-rss。你不需要把源码克隆下来慢慢读,直接用 Docker 跑打包好的镜像就行。Cursor 在这里的用法是:把项目地址丢给它,让它帮你生成 docker-compose.yml 和启动命令。

先确保本机装了 Docker。Windows 上如果 Docker 更新失败,通常是缺 WSL 补丁,在命令行执行wsl --update再重启 Docker 即可。然后新建一个目录,比如wewe-rss,在里面创建docker-compose.yml:

version: "3.9" services: wewe-rss: image: cooderl/wewe-rss:latest container_name: wewe-rss ports: - "4000:4000" environment: - DATABASE_TYPE=sqlite - AUTH_CODE=your_strong_password - SERVER_ORIGIN_URL=http://localhost:4000 - PLATFORM_URL=https://weread.965111.xyz volumes: - ./data:/app/data restart: unless-stopped

这里有几个参数要改。AUTH_CODE是 API 访问的授权码,建议改成你自己的强密码,不要用默认值。SERVER_ORIGIN_URL如果你要外网访问,就改成你的公网 IP 或域名;本地测试保持 localhost 即可。PLATFORM_URL在国内访问遇到 DNS 解析问题时加上,能提高稳定性。数据目录./data用来持久化 SQLite 数据库,别删。

创建数据目录并启动:

mkdir -p data docker compose up -d

启动后访问http://localhost:4000,点击“账号管理”,添加微信读书账号,需要扫码登录。然后进入“公众号源”,提交公众号文章链接来添加订阅。注意添加频率不要太高,频率过高会被封控,需要等 24 小时。这一步是整套流程的数据源头,订阅源稳定了,后面的自动化才有意义。

3.2 扣子工作流的 settings.json 骨架

扣子工作流的编排逻辑是:开始节点接收飞书云文档链接和多维表格链接,然后依次经过获取文档内容、大模型提取链接、循环读取文章、打标签、整理格式、写入多维表格。下面是一个 settings.json 的骨架,你可以根据实际节点 ID 调整:

{ "workflow": { "name": "gzh_to_bitable", "start": { "inputs": { "doc_url": "飞书云文档链接", "bitable_url": "多维表格链接" } }, "nodes": [ { "id": "get_doc", "type": "feishu_doc", "action": "get_document_info", "input": { "url": "{{start.doc_url}}" } }, { "id": "extract_links", "type": "llm", "provider": "taotoken", "base_url": "https://taotoken.net/api", "api_key": "{{secrets.TAOTOKEN_KEY}}", "prompt": "从以下内容中提取所有公众号文章链接,整理成 JSON 数组:{{get_doc.content}}" }, { "id": "loop_articles", "type": "loop", "items": "{{extract_links.result}}", "body": [ { "id": "read_article", "type": "plugin", "action": "read_link", "input": { "url": "{{item}}" } }, { "id": "tag_article", "type": "llm", "provider": "taotoken", "base_url": "https://taotoken.net/api", "api_key": "{{secrets.TAOTOKEN_KEY}}", "prompt": "给这篇文章打 3 个标签,输出 JSON:{{read_article.content}}" }, { "id": "format_row", "type": "llm", "provider": "taotoken", "base_url": "https://taotoken.net/api", "api_key": "{{secrets.TAOTOKEN_KEY}}", "prompt": "整理成字段:标题、作者、发布时间、链接、标签、摘要。输出 JSON:{{read_article.content}}" }, { "id": "write_bitable", "type": "feishu_bitable", "action": "create_record", "input": { "url": "{{start.bitable_url}}", "fields": "{{format_row.result}}" } } ] } ] } }

这个骨架里,secrets.TAOTOKEN_KEY是你在扣子里配置的环境变量,值就是 TaoToken 的 API Key。三个大模型节点分别负责拆解文章、打标签、整理格式,都走同一个 Base URL 和 Key,这就是统一通道的价值。写入多维表格的节点用飞书的多维表格插件,字段名要和你表格里的列名完全一致,否则会写入失败。

3.3 飞书云文档与多维表格的准备

在飞书里新建一个云文档,把 WeWe RSS 输出的 RSS 内容复制进去。RSS 地址在 WeWe RSS 的订阅源页面可以找到,格式类似http://localhost:4000/feeds/xxx.xml。你可以用浏览器打开这个地址,全选内容粘贴到云文档。然后新建一个多维表格,列名建议设为:标题、作者、发布时间、链接、标签、摘要。这几列要和上面format_row节点输出的 JSON 字段一一对应。

4. 验证请求:一次端到端抓取,确认字段映射与写入结果

配置完成后,不要急着批量跑,先做一次单篇验证。在扣子工作流里,把开始节点的doc_url填成你刚建的飞书云文档链接,bitable_url填成多维表格链接,然后点击试运行。

观察每个节点的输出。get_doc节点应该返回云文档的纯文本内容。extract_links节点应该返回一个 JSON 数组,里面是公众号文章链接。如果这里返回空数组,说明云文档里的 RSS 内容格式不对,或者大模型没提取到链接,可以手动在 prompt 里加一句“链接通常以 https://mp.weixin.qq.com 开头”。

loop_articles节点会逐条处理。read_article节点读取链接内容,如果返回 403 或空内容,可能是文章需要登录态,或者链接失效。tag_article和format_row节点输出 JSON,检查字段名是否和你的多维表格列名一致。最后write_bitable节点执行后,打开多维表格,应该能看到新增一行记录,标题、作者、发布时间、链接、标签、摘要都有值。

如果写入成功但字段错位,比如标题写到了作者列,那就是format_row的 JSON key 和表格列名不匹配。回到工作流,把 prompt 里的字段名改成和表格列名完全一致,比如表格列叫“文章标题”,prompt 里就输出{"文章标题": "..."}。这一步是字段映射的核心,配一次后面就稳了。

验证通过后,你可以把云文档的 RSS 内容更新做成定时任务,或者用 WeWe RSS 的自动更新功能,让整个链路定期跑。扣子工作流支持定时触发,设置成每天跑一次,就能自动把新文章同步进多维表格。

5. 本篇常见错排查:从 Docker 启动失败到写入字段错位

Docker 启动后访问 localhost:4000 打不开。先看容器状态docker ps,如果容器不断重启,看日志docker logs wewe-rss。常见原因是AUTH_CODE没改或者数据目录权限不对。Windows 上还要确认 WSL 补丁已装,执行wsl --update后重启 Docker Desktop。

添加公众号时提示频率过高。这是微信读书的风控,不是代码问题。等 24 小时再试,或者降低添加频率,一次只加一两个。不要用脚本疯狂提交,容易被封号。

RSS 地址能打开但内容为空。检查PLATFORM_URL是否配置。国内网络环境下,不配这个变量可能拿不到微信读书的数据。另外确认微信读书账号还在登录状态,扫码登录过期后需要重新扫。

扣子工作流里大模型节点报 401 或 403。检查secrets.TAOTOKEN_KEY是否填对,Base URL 是否是https://taotoken.net/api。如果扣子的大模型节点不支持自定义 Base URL,就改用 HTTP 请求节点,手动构造请求体,Header 里带Authorization: Bearer <你的Key>。

写入多维表格报字段不存在。飞书多维表格的列名是大小写和空格敏感的。你的 JSON key 必须和列名完全一致。建议先在表格里把列名定好,再回到工作流里改 prompt。如果表格里有单选或多选字段,写入的值要符合选项范围,否则也会失败。

文章内容读取为空。公众号文章有的需要登录态才能看全文,read_link插件可能拿不到。可以换成用大模型节点直接根据链接和摘要生成内容,或者只存标题、链接、标签这些元数据,不存全文。根据你的知识库需求取舍。

6. 按需选择入口:排障、验证模型与长期编码的分流建议

整套流程跑下来,最花时间的其实是排障和字段对齐。如果你在接入 TaoToken 或者配置扣子工作流时遇到问题,优先看 API Keys 和接入文档,里面有针对 HTTP 请求节点和大模型节点的配置示例。如果你只是想先验证一下模型对话效果,比如测试拆解文章和打标签的 prompt 是否合理,可以直接用模型对话页面快速试。如果你打算把这套链路长期用于编码类任务或者 Agent 编排,比如让 Cursor 和扣子联动做更复杂的自动化,Coding Plan 会更适合持续性的开发场景。

入口我整理在这里,按你的实际需求点:

  • 排障与接入:API Keys 管理https://taotoken.net/api-keys?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=,接入文档https://taotoken.net/doc?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=
  • 验证模型对话:模型对话https://taotoken.net/chat?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=
  • 长期编码与 Agent:Coding Planhttps://taotoken.net/coding-plan?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=
  • 控制台:Consolehttps://taotoken.net/console?utm_source=taotoken_aicg_blog_end&utm_medium=csdn&utm_campaign=rewrite&utm_content=

最后说一个我踩过的坑:扣子工作流里的循环节点,如果单次循环里调用了多个大模型节点,整体耗时会长。建议把打标签和整理格式合并成一个 prompt,减少调用次数。另外多维表格的写入频率也有限制,批量跑的时候加个延时,别一次性写几百条。字段映射验证通过后,把工作流复制一份做备份,改坏了能快速回滚。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询