abogen 快速上手指南:3 步把 EPUB 变成带同步字幕的有声书
【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen
想做一部有声书,或给课程视频配上逐句同步字幕,最省事的办法是直接用 abogen 做文本转语音:丢一个文件进去,它就生成有声书音频,同时产出时间轴精确对齐的字幕文件。下面按"装好→跑通→按需加料"的顺序带你走一遍。
先跑起来:安装与启动
安装推荐用 uv,一行搞定:
uv tool install --python 3.12 abogen依赖里还需要 espeak-ng,Windows 用户可以直接运行仓库里的WINDOWS_INSTALL.bat一键装齐。装好后有两条启动路径:
- 桌面版:终端执行
abogen,打开 PyQt 界面 - Web 版:执行
abogen-web,浏览器访问localhost:8808
Web 版功能更全(多模型、LLM 文本规整、Audiobookshelf 推送等),新手建议从 Web 版入手。首次运行会自动下载 TTS 模型和语音包,之后可以离线使用。
实战演示:上传文件到出片,真实操作顺序
第 1 步:上传文件
把文件拖进页面或点上传按钮。EPUB、PDF、TXT、Markdown,甚至 SRT/ASS/VTT 字幕文件都认。EPUB 和 PDF 还能按章节或页码范围勾选,只转你需要的部分。
第 2 步:配置参数
- 语速:0.1x 到 2.0x 之间调
- 音色:语言代号+性别选,比如
a是美音、m男声;拿不准就先点语音试听 - 字幕粒度:按行、整句、或每 1~3 个词一条,随视频风格选
- 输出格式:WAV、FLAC、MP3、OPUS,想要带章节标记的 M4B 就选它
- 混音:单一音色不满意时,打开语音混合器,给多个语音模型分别设权重,调出想要的听感
第 3 步:排队并出结果
点Create job,任务立刻进入队列。队列按顺序逐个处理,每个文件保留入队时的参数,互不串扰。完成后直接在页面下载音频和字幕。参考演示中,约 3000 字文本在消费级显卡上十几秒就能产出 3 分多钟音频。
进阶技巧:按需上手
- 语音配置文件:调好的混合比例可存成 profile,下次一键套用,也能整体导出、分享给别人
- GPU 加速:有 NVIDIA 显卡的话,安装时选
[cuda]扩展(如uv tool install abogen[cuda]),转换速度明显提升;AMD 显卡走 ROCm,Windows 上暂不支持 - 批量处理:用队列一次塞入多个文件,各自保留独立配置;也可勾选"用当前配置覆盖队列项",统一强制同一套参数
谁会用得上
- 教育课程:讲义、课件批量配音,字幕与语音逐句对齐,直接压进视频
- 小说朗读:整本 EPUB 转成带章节的 M4B 有声书,可按章拆分或合并
- 播客与短视频:口播稿快速出配音和 SRT 字幕,改稿后重跑成本很低
更多细节可以看 README.md 和 docs/getting-started.md。第一次生成不太满意?调个参数重新入队就行,abogen 把"生成有声书"这件事做到了几分钟内出结果。
【免费下载链接】abogenGenerate audiobooks from EPUBs, PDFs and text with synchronized captions.项目地址: https://gitcode.com/GitHub_Trending/ab/abogen
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考