ai-video-gen · AI 视频生成

单次 AI 视频生成原子能力:文生视频、图生视频、数字人首帧驱动,一句话描述或一张输入图生成一段视频。
支持通义万相 Wan、火山 Seedance、快手可灵、OpenAI 兼容等多种 provider,可插拔切换;异步提交→轮询→下载,支持 16:9/9:16/1:1 画幅与原生音频选项。需用户自备 API key,按量计费,生成前须确认画幅。
调用示例:在聊天框中说"把这张产品图变成 5 秒竖版视频"。
产品详解
定位
ai-video-gen 是从 0 用 AI 生成新视频的原子能力:文生视频、图生视频、数字人首帧驱动。它只负责生成单个视频片段,不负责策划、剪辑与成片合成。
核心能力
- 文生视频:prompt 描述画面、镜头、风格 → 生成视频片段。
- 图生视频:一张输入图 + 可选运动描述 → 让静态图片动起来;可做数字人首帧驱动。
- 多 provider 可插拔:通义万相 Wan、火山 Seedance、快手可灵、OpenAI 兼容、agnes 等,统一接口切换。
- 模型能力探测:
capabilities查询支持的时长/画幅/音频;probe-dialogue真发一次生成 + ASR,判定模型能否逐字忠实说出指定台词,决定用原生对白还是后期配音。 - Profile 感知:有账号 Profile 时从
style.md取视觉风格倾向注入 prompt。
工作流程
- 确认配置与能力:先跑
check校验 key,再capabilities确认模型支持的时长/画幅/音频 - 确认画幅:横版/竖版必须由用户明确确认,不做默认推断
- 按规范写好 prompt(镜头、运镜、风格、时长)
- 提交生成:异步任务自动轮询到完成再下载到
outputs/主题名/ - 后续加工:片段可交给 video-editing 剪辑、auto-subtitle 加字幕、tts-voiceover 配音,或进入 auto-short-video 端到端流程
输入与输出
| 输入 | 说明 |
|---|---|
| prompt | 必填,画面/镜头/风格描述 |
| 输入图 | 图生视频必填,本地路径或 URL |
画幅 --ratio |
16:9 / 9:16 / 1:1,生成前必须确认 |
时长 --duration |
可选 |
原生音频 --audio |
auto / on / off,可选 |
输出:视频文件,写入 outputs/主题名/ 指定目录。
与相邻 skill 的区别
| skill | 分工 |
|---|---|
| ai-video-gen(本) | 从 0 生成新视频片段 |
| video-strategy | 视频选型与内容策略,不生成 |
| video-editing | 对已有素材的剪辑处理 |
| clipify | 英文口播找笑点切片+动态人脸 pan |
| short-drama | 多集短剧全流程产线,内部调用本 skill |
适用场景
- 为短视频/短剧生产单个镜头素材
- 产品图、插画转动态视频
- 数字人口播、讲解类视频的首帧驱动
- 快速验证某个视觉创意的成片效果
使用前准备
- 需在项目
.env配置所选 provider 的 API key(如DASHSCOPE_API_KEY、ARK_API_KEY、KLING_ACCESS_KEY+KLING_SECRET_KEY);key 仅存本地,skill 不索取、不上传。 - 视频生成 API 均为异步、耗时较长(数十秒到数分钟)且按量计费,先跑
check确认配置,生成前与用户确认。
ai-video-gen 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。