tts-voiceover · 文字转语音配音

把文案/脚本合成为 AI 语音口播、旁白、朗读音频的 skill,同步输出分句 SRT 字幕。
默认走闭源云 TTS(有情感、接近真人);无 key 时退到 edge-tts 兜底(偏机械)。配音可再与 BGM 混音,或作为旁白加入视频。
调用示例:在聊天框中说"把这段文案配成女声旁白,顺带出一份字幕文件"。
产品详解
定位
tts-voiceover 是文本→语音的配音工具:把文案/脚本合成为 AI 语音(口播、旁白、朗读)。它做人声配音,不做背景音乐。
核心能力
- 双引擎:配置了
VOICE_PROVIDER+VOICE_API_KEY时默认走闭源云 TTS(按句合成 + 拼接 + 分句 SRT,有情感、像真人);无 key 时退到 edge-tts 兜底(偏机械/AI 味);--engine可强制指定。 - 音色可选:默认晓晓(zh-CN-XiaoxiaoNeural,女声,温暖亲和);晓伊(活泼年轻)、云希(清朗男声)、云扬(沉稳播报)、云健(浑厚有力)等常用中文音色;另有粤语、台式音色。
- 参数微调:语速 / 音量 / 音调可调;长文本推荐走
--file避免命令行过长。 - 同步字幕:
--subtitle同步输出 SRT 字幕文件,供视频烧字幕用。 - 输出格式:mp3(默认),可选 wav / m4a。
- 后处理复用共享脚本:配音 + BGM 混音、响度归一化到 -14 LUFS、把配音作为旁白加入视频。
工作流程
- 可选:
voices挑音色(常用中文音色 + 简介;全量需外网) speak合成配音(可选同步出 SRT)- 可选后处理:混音 / 归一化 / 加到视频
输入与输出
| 输入 | 说明 |
|---|---|
| text / file | 必填,待配音文本或文本文件路径(长文本推荐 --file) |
| voice | 选填,音色(默认晓晓) |
| rate / volume / pitch | 选填,语速 / 音量 / 音调微调 |
| output | 选填,默认 outputs/主题名/{name}.mp3 |
输出:配音音频文件(mp3 / wav / m4a),可选同步 SRT 字幕,落盘于 outputs/主题名/。
与相邻 skill 的区别
- ai-music:背景音乐/配乐(无人声或带演唱);tts-voiceover(本):人声口播/旁白/朗读。两者可组合:BGM + 旁白经
video_ops.py bgm混音。
适用场景
- 短视频旁白、口播配音
- 有声内容朗读、知识类解说
- 需要同步字幕文件的配音任务
使用前准备
- edge-tts 调微软在线服务,必须能访问外网(内网环境先设代理,脚本自动透传)。
- 闭源云 TTS 需配置
VOICE_PROVIDER+VOICE_API_KEY(按量计费);配置检查走model_registry.py configured --group voice,不用环境变量是否显示判断。 - 有 Profile 时可读取账号偏好音色/语速;无 Profile 时用默认音色晓晓、正常语速。
tts-voiceover 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。