audio-mix · 音频混音

音频混合 skill:把旁白口播、背景音乐、音效同时叠加混成一轨。核心能力是闪避(ducking)——旁白说话时自动压低 BGM,保证人声清晰、音乐不抢。
三者至少给一个即可工作,最典型的是"旁白 + BGM"。BGM 自动循环补足到旁白长度并在末尾淡出;音效可指定各自的出现时间点。输出单轨音频并附报告(轨数、时长、是否闪避)。
调用示例:在聊天框中说"把这段旁白和这首 BGM 混在一起,旁白说话时音乐压低"。
产品详解
定位
audio-mix 是多轨音频叠加混音器:把旁白、BGM、音效同时混成一轨,输出纯音频。它做的是"同时叠加",不是前后拼接。
核心能力
- 闪避(ducking):旁白说话时自动压低 BGM(ffmpeg sidechaincompress,以人声为控制信号),默认开启;纯叠加时可关闭。
- BGM 循环对齐:BGM 比旁白短时自动循环补足、裁切对齐,末尾淡出;有旁白时输出时长跟旁白走。
- 定时音效:每个音效可指定出现时间点(如第 3.5s 一个叮、第 8s 一个 whoosh),可调音量。
- 音量调参:BGM 音量(默认 0.25)、音效音量(默认 0.9)可调;闪避过猛时可关闭闪避手动压 BGM。
- 输出报告:轨数、时长、是否启用闪避。
工作流程
- 给出旁白/BGM/音效(三者至少一个)
- 设定参数(闪避开关、BGM 音量、音效时间点)
- 混音并输出单轨音频(mp3/wav/m4a,按输出后缀)+ 报告
输入与输出
| 输入 | 说明 |
|---|---|
| 旁白 | 选填,口播/配音主轨;给了则触发闪避并决定输出时长 |
| BGM | 选填,背景音乐,自动循环补足 |
| 音效 | 选填,一个或多个,可指定出现时间点 |
输出:混音后的单轨音频 + 报告,统一进 outputs/主题名/。
与相邻 skill 的区别
| skill | 分工 |
|---|---|
| audio-mix(本) | 多轨同时叠加混音,输出纯音频 |
| audio-editing concat | 音频前后顺序拼接(一段接一段) |
| video-editing bgm | 给视频配乐(视频剪辑的一部分) |
| audio-denoise | 音频降噪 |
适用场景
- 口播视频/播客的旁白 + BGM 混合
- 需要旁白说话时音乐自动避让的成品音频
- 片头片尾加定时音效的音频包装
使用前准备
- 准备好旁白、BGM、音效文件;三者至少一个。
- 混音不做响度归一(保留相对音量);需统一响度先用 audio-editing 的 normalize。
- 本地 ffmpeg 脚本处理,无第三方 API 费用。
audio-mix 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。