qiaomu-anything-to-notebooklm图片OCR功能:扫描版PDF如何变成可学习的内容源
【免费下载链接】anything-to-notebooklmClaude Skill: Multi-source content processor for NotebookLM. Supports WeChat articles, web pages, YouTube, PDF, Markdown, search queries → Podcast/PPT/MindMap/Quiz etc.项目地址: https://gitcode.com/GitHub_Trending/an/qiaomu-anything-to-notebooklm
qiaomu-anything-to-notebooklm 是一款开源的多源内容智能处理工具,内置图片 OCR 功能,能把扫描版 PDF、截图、拍照文件自动识别成文字,再一键上传 Google NotebookLM,生成播客、PPT、思维导图和 Quiz 等可学习内容源。
一、为什么扫描版 PDF 用不了?
普通的电子 PDF 内部就有文字层,复制、搜索都没问题。但扫描版 PDF 不一样——它本质上是一张张图片,没有任何可提取的文字:
- ❌ 选中文字复制:失败
- ❌ 全文搜索关键词:找不到
- ❌ 丢给 AI 学习:AI 只能"看图说话",无法精读
而 OCR(Optical Character Recognition,光学字符识别)的作用,就是把图片里的文字"读"出来,变成真正的文本。这样扫描件就和原生 PDF 一样,可以被上传、检索、学习和再利用。
二、OCR 功能的工作原理:三步流水线
qiaomu-anything-to-notebooklm 的 OCR 处理是一条全自动流水线,你只需要给文件路径,剩下的由 main.py 主入口和 SKILL.md 中定义的技能规则自动完成:
扫描件/图片 ──① markitdown OCR──▶ 纯文本 TXT ──② notebooklm source add──▶ NotebookLM ──③ AI 生成──▶ 播客/PPT/思维导图/Quiz- OCR 识别:由 requirements.txt 中声明的
markitdown[all]负责,自动识别 PDF 扫描件和图片中的文字,并保存为 TXT 文件 - 上传内容源:通过 NotebookLM 命令行把 TXT 上传为学习源(Source)
- AI 生成:根据你的自然语言指令,生成播客、PPT、思维导图等格式
💡 整个过程无需手动指定"这是扫描件",工具会自动判断输入类型,识别到扫描件时自动走 OCR 分支。
支持 OCR 的文件格式
| 文件类型 | 格式 | OCR 处理 |
|---|---|---|
| 扫描版 PDF | markitdown OCR 提取全文 → TXT | |
| 图片 | JPEG / PNG / GIF / WebP | 自动 OCR 识别文字 → TXT |
| 压缩包 | .zip | 自动解压后批量 OCR |
三、扫描版 PDF 变播客的快速上手步骤
第 1 步:一键安装(只需 Python 3.9+)
cd ~/.claude/skills/ git clone https://gitcode.com/GitHub_Trending/an/qiaomu-anything-to-notebooklm cd qiaomu-anything-to-notebooklm ./install.shinstall.sh 会自动安装 markitdown(OCR 依赖)、Playwright 浏览器和 NotebookLM CLI,全程无需手动装依赖。装完可以运行 check_env.py 做 13 项环境自检,全部打勾即代表 OCR 链路就绪。
第 2 步:一次性认证 NotebookLM
notebooklm login notebooklm list # 验证登录成功第 3 步:说一句话,剩下的交给 AI
在 Claude Code 中直接对扫描件下达自然语言指令即可,例如:
把这个扫描PDF做成报告 /path/to/scan.pdf工具会自动执行:检测扫描件 → markitdown OCR 提取文字 → 上传 NotebookLM → 生成报告,最后把结果文件路径告诉你。
四、OCR 的 4 个实用场景
场景 1:扫描版论文 → 播客🎙️ 把扫描 PDF 路径丢给工具,要求"生成播客",通勤路上就能听完一篇论文精华。
场景 2:拍照笔记 → 思维导图🗺️ 手机拍的照片(JPG/PNG)同样支持 OCR。识别成文字后生成思维导图,理清知识结构。
场景 3:批量扫描件 → 综合学习📦 一个 ZIP 包里放多份扫描文件,工具会自动解压并批量 OCR,合并成统一的内容源,再生成 PPT 或报告。
场景 4:扫描书籍 → 深度分析📚 对识别后的全文启用深度分析模式(--deep-analysis),自动生成 10 个核心问题并逐一递归提问,输出结构化 JSON 分析结果。
五、常见问题 FAQ
Q:OCR 识别准确率怎么样?清晰扫描(300 DPI 以上、排版工整)的中文/英文文档识别率很高;手写体、模糊照片的准确率会下降,建议先放大或二值化图片。
Q:支持多长的扫描件?识别后的文本约 1000~10000 字生成效果最佳,上限约 50 万字。过短的文档(<500 字)AI 发挥空间有限。
Q:不装 OCR 相关依赖可以吗?OCR 是随 install.sh 自动安装的 markitdown 能力,无需额外配置。如果只想处理原生 PDF、网页、播客等内容源,OCR 分支本来也不会被触发。
Q:处理完的中间文件会残留吗?OCR 产出的 TXT 临时文件保存在/tmp/目录,系统重启后自动清理,不用担心占空间。
六、相关文件导航
想深入了解 OCR 分支的判定规则和命令映射,可以查阅仓库内这些文件:
- 技能定义与触发词:SKILL.md
- CLI 主入口:main.py
- 一键安装脚本:install.sh
- 环境自检脚本:check_env.py
- Python 依赖清单(含 markitdown):requirements.txt
- URL 抓取与转写脚本:scripts/
一句话总结:扫描版 PDF 不再是"死图"——qiaomu-anything-to-notebooklm 用 markitdown 的 OCR 能力把图里的字读出来,再交给 NotebookLM 变成播客、PPT 和思维导图,让纸质文档真正进入你的 AI 学习工作流。
【免费下载链接】anything-to-notebooklmClaude Skill: Multi-source content processor for NotebookLM. Supports WeChat articles, web pages, YouTube, PDF, Markdown, search queries → Podcast/PPT/MindMap/Quiz etc.项目地址: https://gitcode.com/GitHub_Trending/an/qiaomu-anything-to-notebooklm
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考