如何把电子书转成有声书:ebook2audiobook 上手完整教程
2026/9/7 4:55:55 网站建设 项目流程

如何把电子书转成有声书:ebook2audiobook 上手完整教程

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

想通勤路上听完手里这本 EPUB 时,你不需要自己录音。ebook2audiobook 是一个电子书转有声书工具:它自动解析电子书的文字与章节,再用 TTS 引擎合成音频文件,适合想把"读"变成"听"的任何人。

一分钟看懂

它的流程分三步。

输入:你在网页里丢进一本电子书,EPUB、MOBI、PDF、TXT 等 20 余种格式都行,扫描版 PDF 也能通过内置 OCR 识别出文字。

处理:程序先抽取文本、检测章节结构,再把长文切成适合合成的段落;如果你上传了一段自己的录音,还会对这段语音做克隆,并用它来朗读整本书。

输出:分段音频被拼接成完整文件,带章节信息,直接在页面里试听或下载到本地播放器。

📚 能力清单

语言与语音

  • 1158+ 种语言:从中文、英文到较冷门的小语种都能选,选语言后会自动匹配兼容的引擎
  • 语音克隆:上传 1~5 分钟的录音即可,自带背景噪声的录音也会被自动清理
  • 8 种 TTS 引擎:XTTSv2、Bark、VITS、YourTTS 等,按音质与速度需求切换
  • SML 控制标签:文本里写[break][pause:3]控制停顿,用[voice:...]中途换声音

格式兼容

  • 20+ 种输入格式:.epub、.mobi、.azw3、.pdf、.txt、.html 等,其中 EPUB 和 MOBI 的章节检测效果最好
  • 10 种输出格式:m4b、m4a、mp3、flac、wav、ogg 等,默认单声道 m4b
  • 批量转换:headless 模式下传一个文件夹路径,一次转完里面所有电子书

硬件门槛

  • 低配置可跑:最低 2GB 内存 / 1GB 显存,推荐 8GB / 4GB
  • 跨平台:Windows、macOS(含 Apple Silicon)、Linux 均有启动脚本
  • Docker 可用:官方镜像自包含依赖,支持 headless 模式

🚀 上手实操

第一步:准备

克隆仓库并进入目录:

git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook

启动脚本会自动安装缺失的 Python 依赖和系统工具,不需要你手动建虚拟环境。

第二步:首次运行

Linux/macOS 在终端执行下面这条命令,Windows 直接双击ebook2audiobook.cmd

./ebook2audiobook.command

终端打印本地地址后,浏览器打开http://localhost:7860/进入界面。

在 Input Options 页把电子书拖进上传框,下拉选择语言;不克隆声音就留空语音区,处理器按机器情况选 CPU 或 GPU。

第三步:拿到结果

设置完成后点击Convert,进度条走完后下方出现结果区:

先用 Listen 播放器试听几段,再从 Audiobooks 下拉框选中文件点 Download 保存。默认输出是单声道m4b,存到audiobooks/目录后可导入 Audiobookshelf 播放;想换格式或输出目录,改 lib/conf.py 里的默认配置即可。

⚙️ 参数详解

第一次转换不用动任何参数。只有当你觉得"声音太机械"、"同一句话老重复"或"生成太慢"时,才需要打开 Audio Generation Preferences 页调这些滑杆:

参数作用建议值
--temperature创造性,越高越不可预测,越低越平默认 0.65
--speed朗读语速默认 1,范围 0.5~3
--repetition_penalty越高越不容易重复短语默认 2.5
--top_k采样候选词数,越小生成越快默认 50,嫌慢就调小
--top_p选词累计概率截断,越小越保守默认 0.8
--enable_text_splitting长文切段后分块合成超长书籍开启

以上滑杆对应 headless 命令行参数,XTTS 引擎专用;Bark 则用--text_temp--waveform_temp两个参数。

👥 适用人群与场景

  • 如果你通勤时间长,可以把下载好的 EPUB 转成有声书一路听完
  • 如果你手头只有扫描版 PDF,内置 OCR 能先把图片里的字认出来再合成
  • 如果你想做播客或旁白,克隆自己的声音整本书生成
  • 如果你只是想快速测试,页面里的文本框可直接输入短文本生成音频试听

⚠️ 避坑指南

  • GPU 检测不到→ CUDA/ROCm 版本或驱动不匹配 → 按 README 里 GPU 排查章节检查,或先用 CPU 跑通
  • CPU 模式非常慢→ 现代 TTS 引擎在 CPU 上开销大 → 换 GPU,或改用 YourTTS、Tacotron2 这类轻量引擎
  • 脚本重启后网页连不上→ 浏览器还连着旧会话 → 刷新页面重新连接
  • 音频中途截断→ 该语言的句子切分逻辑不完善 → 在仓库 issue 里附上出问题的文本片段帮助修复

收尾

读完就可以动手:克隆仓库、挑一本 EPUB 跑一遍,有 GPU 的机器用 XTTS,没有的就选轻量引擎,第一本有声书今晚就能出声。

版本记录在仓库根目录的 VERSION.txt,升级前先看一眼。

【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询