audio-visualizer · 音频可视化视频

把纯音频(播客片段、音乐、口播金句、电台)渲染成带动态波形/频谱的视频、配封面与标题的 skill。
四种模式:cqt 音乐频谱、bars 律动柱状、waves 波形线、spectrum 滚动声谱;让只收视频的平台也能发布音频内容。
调用示例:在聊天框中说"把这期播客金句做成竖版波形视频,配封面和标题"。
产品详解
定位
audio-visualizer 是音频→视频的转换器:把音频渲染成带动态波形/频谱的视频,配封面与标题,让纯音频内容进入只收视频的平台分发。
核心能力
- 四种可视化模式:
cqt(默认):全屏音符频谱,随旋律跳动,音乐最好看bars:底部频谱柱,律动感强,适合音乐、卡点、电台waves:底部波形线,简洁干净,适合播客、口播、访谈spectrum:全屏滚动声谱图,科技感,适合电子/科技类
- 封面与标题:封面图等比缩放居中,顶部标题自动描边保证可读;背景图、背景色、波形颜色可自定义。
- 音频完整嵌入:原声完整嵌入输出,不重采样丢质量。
- 画幅必须确认:横版/竖版制作前必须追问并等用户确认,不按平台、Profile 或默认值静默推断。
工作流程
- 确认音频文件、横版/竖版(必须用户确认)
- 选模式、封面、标题
- 运行
audio_viz.py render - 输出可视化视频与报告(模式、时长、画幅)
输入与输出
| 输入 | 说明 |
|---|---|
| 音频文件 | 必填,播客 / 音乐 / 口播片段(没给就问) |
| 画幅 | 必填,制作前必须确认横版/竖版(或具体分辨率) |
| 模式 | 选填,cqt(默认)/ bars / waves / spectrum |
| 封面 | 选填,居中封面图(专辑封面/头像/主题图) |
| 标题 | 选填,顶部标题文字 |
输出:可视化视频(*.mp4,音频已嵌入),落盘于 outputs/主题名/。
与相邻 skill 的区别
- audio-mix:输出音频(混音);本 skill 输出视频。
- slideshow-video:用图片做视频;本 skill 用音频驱动画面。
- auto-subtitle:给已有视频加字幕。
适用场景
- 播客金句/访谈片段发到抖音/B站/视频号
- 音乐作品发布到视频平台
- 口播/电台内容的可视化分发
使用前准备
- 无需 API key(ffmpeg 滤镜封装脚本)。
- 长音频先截出金句片段再可视化,避免整集渲染。
audio-visualizer 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。