如何把电子书转成有声书:ebook2audiobook 上手完整教程
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
想通勤路上听完手里这本 EPUB 时,你不需要自己录音。ebook2audiobook 是一个电子书转有声书工具:它自动解析电子书的文字与章节,再用 TTS 引擎合成音频文件,适合想把"读"变成"听"的任何人。
一分钟看懂
它的流程分三步。
输入:你在网页里丢进一本电子书,EPUB、MOBI、PDF、TXT 等 20 余种格式都行,扫描版 PDF 也能通过内置 OCR 识别出文字。
处理:程序先抽取文本、检测章节结构,再把长文切成适合合成的段落;如果你上传了一段自己的录音,还会对这段语音做克隆,并用它来朗读整本书。
输出:分段音频被拼接成完整文件,带章节信息,直接在页面里试听或下载到本地播放器。
📚 能力清单
语言与语音
- 1158+ 种语言:从中文、英文到较冷门的小语种都能选,选语言后会自动匹配兼容的引擎
- 语音克隆:上传 1~5 分钟的录音即可,自带背景噪声的录音也会被自动清理
- 8 种 TTS 引擎:XTTSv2、Bark、VITS、YourTTS 等,按音质与速度需求切换
- SML 控制标签:文本里写
[break]、[pause:3]控制停顿,用[voice:...]中途换声音
格式兼容
- 20+ 种输入格式:.epub、.mobi、.azw3、.pdf、.txt、.html 等,其中 EPUB 和 MOBI 的章节检测效果最好
- 10 种输出格式:m4b、m4a、mp3、flac、wav、ogg 等,默认单声道 m4b
- 批量转换:headless 模式下传一个文件夹路径,一次转完里面所有电子书
硬件门槛
- 低配置可跑:最低 2GB 内存 / 1GB 显存,推荐 8GB / 4GB
- 跨平台:Windows、macOS(含 Apple Silicon)、Linux 均有启动脚本
- Docker 可用:官方镜像自包含依赖,支持 headless 模式
🚀 上手实操
第一步:准备
克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook启动脚本会自动安装缺失的 Python 依赖和系统工具,不需要你手动建虚拟环境。
第二步:首次运行
Linux/macOS 在终端执行下面这条命令,Windows 直接双击ebook2audiobook.cmd:
./ebook2audiobook.command终端打印本地地址后,浏览器打开http://localhost:7860/进入界面。
在 Input Options 页把电子书拖进上传框,下拉选择语言;不克隆声音就留空语音区,处理器按机器情况选 CPU 或 GPU。
第三步:拿到结果
设置完成后点击Convert,进度条走完后下方出现结果区:
先用 Listen 播放器试听几段,再从 Audiobooks 下拉框选中文件点 Download 保存。默认输出是单声道m4b,存到audiobooks/目录后可导入 Audiobookshelf 播放;想换格式或输出目录,改 lib/conf.py 里的默认配置即可。
⚙️ 参数详解
第一次转换不用动任何参数。只有当你觉得"声音太机械"、"同一句话老重复"或"生成太慢"时,才需要打开 Audio Generation Preferences 页调这些滑杆:
| 参数 | 作用 | 建议值 |
|---|---|---|
--temperature | 创造性,越高越不可预测,越低越平 | 默认 0.65 |
--speed | 朗读语速 | 默认 1,范围 0.5~3 |
--repetition_penalty | 越高越不容易重复短语 | 默认 2.5 |
--top_k | 采样候选词数,越小生成越快 | 默认 50,嫌慢就调小 |
--top_p | 选词累计概率截断,越小越保守 | 默认 0.8 |
--enable_text_splitting | 长文切段后分块合成 | 超长书籍开启 |
以上滑杆对应 headless 命令行参数,XTTS 引擎专用;Bark 则用--text_temp和--waveform_temp两个参数。
👥 适用人群与场景
- 如果你通勤时间长,可以把下载好的 EPUB 转成有声书一路听完
- 如果你手头只有扫描版 PDF,内置 OCR 能先把图片里的字认出来再合成
- 如果你想做播客或旁白,克隆自己的声音整本书生成
- 如果你只是想快速测试,页面里的文本框可直接输入短文本生成音频试听
⚠️ 避坑指南
- GPU 检测不到→ CUDA/ROCm 版本或驱动不匹配 → 按 README 里 GPU 排查章节检查,或先用 CPU 跑通
- CPU 模式非常慢→ 现代 TTS 引擎在 CPU 上开销大 → 换 GPU,或改用 YourTTS、Tacotron2 这类轻量引擎
- 脚本重启后网页连不上→ 浏览器还连着旧会话 → 刷新页面重新连接
- 音频中途截断→ 该语言的句子切分逻辑不完善 → 在仓库 issue 里附上出问题的文本片段帮助修复
收尾
读完就可以动手:克隆仓库、挑一本 EPUB 跑一遍,有 GPU 的机器用 XTTS,没有的就选轻量引擎,第一本有声书今晚就能出声。
版本记录在仓库根目录的 VERSION.txt,升级前先看一眼。
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考