3 步落地电子书转有声书:ebook2audiobook 本地实操笔记
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
ebook2audiobook 做电子书转有声书这件事:支持 EPUB、PDF、MOBI 等 20 多种格式、语音克隆和 1158 种语言,适合通勤听书、辅助视障阅读和旁白素材制作的人。
🚀 用最短路径跑起来
先克隆仓库并进入目录:
git clone https://gitcode.com/GitHub_Trending/eb/ebook2audiobook cd ebook2audiobook再运行启动脚本(macOS / Linux,Windows 用户改用ebook2audiobook.cmd):
./ebook2audiobook.command最后打开浏览器里的http://localhost:7860/,拖入一本 epub 点 Convert;首次运行要下载模型,进度条走完后就能听到第一段音频。
完成第一次电子书转换
页面主体是电子书上传框,右侧依次是语言下拉框和设备选择(CPU 或 CUDA 等 GPU 设备)。你拖入文件,语言保持 eng,设备选好,点 Convert 开始。页面还有文本输入框,想先试听一小段话,直接粘贴进去就行。
转换结束后下方出现播放器,逐段试听没问题就下载。第一次别急着调参数,用默认配置出成品,确认整条链路跑通,再回头精调。
🎙️ 让声音更像你自己
克隆声音靠 TTS(文本转语音)引擎的零样本能力:上传 5-10 秒录音,它照着这个音色朗读;录音带杂音也没关系,系统会自动清理。
高级设置里的参数各管一件事,平时用默认值就行:温度控制随机性,朗读类保持默认,对话密集想更自然时再调高;语速在 0.5 到 3 倍之间,只有要压缩或放慢节奏时才改;重复惩罚防止短语复读,听到机械重复再调高;文本分割只在超长章节合成中断时开启。
从一本书到一书架
headless 是无界面批量模式,一条命令扫完目录里所有书:
./ebook2audiobook.command --headless --ebooks_dir ./my_books --language eng换语言只动--language,它收 ISO 三字母代码,比如中文是 zho,1158 种语言代码可在 lib/conf_lang.py 里查:
./ebook2audiobook.command --headless --ebook book.epub --language zho本机依赖装不干净就用容器(别人打包好的运行环境),GPU 机器用 compose 一行拉起:
DEVICE_TAG=cu128 docker compose --profile gpu up选对工具对场景
引擎按场景挑:有 GPU、要多语言高质量,用默认 XTTSv2(给几秒样本就能模仿其音色的多语言引擎);只有 CPU 时换 YourTTS、Tacotron2 或 Piper,速度优先但音色偏机器;要语气和情绪起伏用 Bark,代价是更慢。
格式跟着用途走:长篇小说选 M4B(自带章节标记的有声书格式);要剪短片段选 MP3;存档选 FLAC 无损。
硬件最低 2GB 内存加 1GB 显存就能跑,推荐 8GB 加 4GB,中篇以上用 XTTSv2 不卡。
最常踩的几个坑
转换太慢:优先切到 CUDA 设备;纯 CPU 环境改选 Piper、YourTTS 这类轻量引擎,现代大引擎在 CPU 上非常慢。
缺章节标记:EPUB、MOBI 会自动保留章节结构,其他格式转换后需要手动补。
克隆声音不像:换一段 5-10 秒、无背景音乐、情绪平稳的录音,样本越干净相似度越高。
中文支持吗:支持,语言选 zho 即可,也可以上传中文录音做克隆。
默认输出格式、设备等设置改 lib/conf.py,更多用法看 README.md。
【免费下载链接】ebook2audiobookGenerate audiobooks from e-books, voice cloning & 1158+ languages!项目地址: https://gitcode.com/GitHub_Trending/eb/ebook2audiobook
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考