☰
一本书变有声书还带同步字幕:abogen 完整转换实操指南
2026/9/26 10:11:40 网站建设 项目流程

一本书变有声书还带同步字幕:abogen 完整转换实操指南

【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen

想把小说读给孩子听,却不想自己花一个月录完?或者手头一堆 EPUB、PDF 常年吃灰,abogen 能把这些格式变成 MP3、M4B 有声书,并同步生成字幕,不用你开口就能"听"书。下面按真实操作流程走一遍完整转换。

从零到可用:三步装好 abogen

一键克隆仓库并安装

打开终端,先拿到代码:

git clone https://gitcode.com/GitHub_Trending/ab/abogen

然后用官方推荐的 uv 安装,Python 版本会帮你固定好:

uv tool install --python 3.12 abogen

有 NVIDIA 显卡的话,加装 CUDA 版本(老驱动选 cuda126、新驱动选 cuda130)转换速度会明显更快;AMD 显卡则需要在 Linux 下安装 rocm 版本。Windows 用户更省事:直接双击仓库根目录的WINDOWS_INSTALL.bat,它自带内嵌 Python,不用单独装环境。

装系统级依赖 espeak-ng

abogen 靠它提供发音提示,必须单独安装:Ubuntu/Debian 用sudo apt install espeak-ng,macOS 用brew install espeak-ng,Windows 下载官方 msi 安装包运行即可。

首次启动

两个界面任选:

abogen # 桌面端 abogen-web # Web 端,启动后在浏览器打开 localhost:8808

完成一次完整转换:从 EPUB 到有声书

1. 导入书籍

把 EPUB、PDF、TXT、MD 或字幕文件(SRT/ASS/VTT)拖进输入区,没有文件也可以用内置文本编辑器直接粘贴。处理 EPUB 和 PDF 时,还能在章节控制里只挑指定章节,选择每章存成独立音频文件,或再合并出一个完整版。

2. 选语音、设语速

语音是两位代码:第一位是语言(a 美式英语、b 英式英语、e 西班牙语、f 法语、i 意大利语、j 日语、p 巴西葡萄牙语、z 中文),第二位是性别(m 男、f 女)。选完点一下语音预览按钮,先试听再开始,避免跑完才觉得不合适。语速支持 0.1x 到 2.0x 调节。

3. 定字幕粒度和输出格式

字幕模式从粗到细:Line(按行)、Sentence(按句)、Sentence + Comma,以及 1/2/3 个词一档的词级模式。注意词级时间戳只有英文可用(Kokoro 只对英文输出时间戳标记),其他语言会回退到句级。字幕可存 SRT 和多种 ASS 样式;音频输出 WAV、FLAC、MP3、OPUS,或带章节标记的 M4B。

4. 开始转换看成品

点开始后日志窗口实时刷新。官方演示数据:一台 RTX 2060 Mobile 级别的中端显卡上,约 3000 字符的文本 11 秒转成 3 分 28 秒的音频。实际运行状态见下图:

调优成品:三个目标导向的设置

想要专属声音:语音权重怎么调

预设语音不满意时打开语音混合器:它能把多个语音模型混在一起,拖动每个模型的权重并即时试听混音效果,满意后保存成配置文件,以后直接调用。

想转换更快:开启 GPU 加速

启动时如果看到 "CUDA GPU is not available. Using CPU",说明回退到了 CPU,功能不受影响只是更慢。解决办法是按驱动对应的 CUDA 版本重装 PyTorch,README 的故障排查部分按 cuda126/cuda128/cuda130 列好了对应命令。AMD 显卡在 Windows 上不受支持,请改用 Linux + ROCm。

想直接看字幕播放:M4B + mpv

输出选 M4B(带章节),再用 mpv 播放——它没有视频轨也能显示字幕,README 里还附了一份推荐配置,直接拷进mpv.conf就能用。

批量转换与常见坑

队列模式:一次转完整个书架

文本和字幕文件可以直接点"添加文件"或拖进队列,EPUB、PDF 则在主窗口点"加入队列"。每个队列项会保留加入那一刻的设置,之后再改主窗口配置不影响它们;想统一全部项,勾选"用当前设置覆盖"即可,鼠标悬停还能查看每项的具体配置。

更后台的方式是 Web 界面:abogen-web启动后浏览器打开 localhost:8808,拖入文件、选好参数点 Create job,进度和日志在页面实时刷新,完成后直接下载音频和字幕。它还额外支持 Supertonic 引擎、LLM 辅助文本规范化,以及转完自动推送进 Audiobookshelf 书库。

三个高频坑

  1. Linux 下 uv 安装后提示 "not on PATH":把~/.local/bin加进 PATH 再重开终端。
  2. 日语语音不出声:需要补装 Kokoro 的日语依赖,见 README 故障排查部分。
  3. 非英文想要词级字幕:受 Kokoro 限制暂不可用,切到句级模式即可。

到这里,任何一本书都能被你变成带字幕的有声书。完整配置项与运行细节见 docs/getting-started.md 和 docs/developer-guide.md;abogen 的 TTS 引擎是可插拔设计,内置 Kokoro 与 Supertonic 两个插件,实现代码在 plugins/。

【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询