auto-short-video · 一键短视频

一句话主题到成品短视频的端到端编排 skill:自动串联口播文案、逐句配图(或 AI 视频片段)、配音、字幕、BGM 与最终合成。
画面默认逐句配图加 Ken Burns 缓动,只有需要动态时才逐段生成视频。缺失 API key 的环节自动降级(如跳过配音),不中断整体出片。画幅必须在制作前明确确认。
调用示例:在聊天框中说"做一条 60 秒竖屏口播视频,主题是三分钟讲清复利"。
产品详解
定位
auto-short-video 是一条"一键出片"的编排流水线:输入一个主题,输出一条成品短视频。它本身是编排层,把已有的制作零件(文案、配图、配音、字幕、BGM)串成一条自动流程,而非单一生成工具。
核心能力
- 全环节编排:文案 → 配图/视频 → 配音 → 字幕 → BGM → 合成,一次跑完。
- 逐句分镜:口播文案按句子拆成 N 个分镜,每句配一个画面描述。
- 静态图优先策略:单条口播/资讯向视频默认逐句配图加 Ken Burns 缓动,只有需要动态时才逐段调用图生视频。
- 自动降级:缺图像/视频/TTS API key 的环节自动降级(图卡兜底、跳过配音),并如实告知用户。
- 画幅硬门:横/竖版未明确时,制作前必须追问并等确认,不从默认值推断。
- 先出 Plan:涉及多个付费 API 时,先说明将调用哪些、大致耗时与花费,确认后再跑。
- 中间产物留档:分镜图、配音、字幕、storyboard 全部保留,可单独替换后重新合成。
工作流程
- 写脚本分镜(口播文案拆句,每句配画面描述)
- 生成画面(逐句生图 / 图生视频 / 用户素材 / 图卡兜底)
- 配音(TTS 合成口播,同时产出 SRT)
- 字幕(TTS 附带 SRT,或自动生成)
- BGM(AI 生成或用户提供,可选)
- 合成成片(storyboard + assemble.py:配音、BGM 混音、烧录字幕)
- 交付 final.mp4,附制作说明(用了哪些环节、哪些降级了)
输入与输出
| 输入 | 说明 |
|---|---|
| 主题/文案 | 必填 |
| 目标时长 | 选填 |
| 画幅 | 必填(横/竖版须明确确认) |
| 风格 | 选填 |
| 配音/字幕/BGM 开关 | 选填 |
| 画面来源 | 选填(AI 生图 / 图生视频 / 用户素材) |
输出:outputs/主题名/final.mp4 成片,以及 assets/ 下的分镜图、配音、字幕与 storyboard。
与相邻 skill 的区别
- short-drama:多集剧情短剧产线,每镜强制图生视频、处理角色一致性与多集连续剧情。
- video-script:只产出口播脚本,不做画面与成片。
- ai-video-gen:单次视频生成的原子能力,被本 skill 在内部调用。
适用场景
- 口播/资讯类账号批量生产短视频内容
- 用一句话主题快速生成讲解类视频草稿
- 为图文内容补一条同主题的视频版本
- 测试不同口播角度的市场反应
使用前准备
- 生图、生视频、配音、音乐依赖按量计费的云 API,需自备 API key 并配置于项目
.env;key 仅存于本地。 - 配了
VOICE_PROVIDER会走闭源高质量嗓音,否则回退免费机械音——对口播质感有要求务必配好。 - 制作前确认好画幅(横/竖版),这一步不能跳过。
auto-short-video 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。