clipify · 长视频智能切片

从长视频自动提取精彩片段、切成独立短视频的 skill:Whisper 逐字转写定位笑点,逐段裁剪,支持 16:9→9:16 竖版转制(人脸追踪 pan 或分屏),并烧录逐字高亮字幕。
输出 10–25 秒、带高亮字幕的短视频成品,适合把英文访谈、播客、直播录像切成 TikTok/Reels 传播。
调用示例:在聊天框中说"把这个访谈视频切成 3 条竖屏短视频,配逐字字幕"。
产品详解
定位
clipify 是一条长视频→短视频的智能切片产线:找笑点、切片段、转竖版、烧字幕,全流程脚本化。它为英文口播内容做了专项优化。
核心能力
- Whisper 逐字转写:英文用 tiny.en 模型(比 small.en 快约 10 倍),非英文用 base 模型;带词级时间戳。
- 笑点定位:按反转、金句、尴尬停顿、自嘲、音量峰值等信号筛选 3–5 个候选片段(目标 10–25 秒),每个候选给出起止时间、笑点理由与建议标题,由用户确认后再切。
- 画幅转制:16:9→9:16;双人对话可选人脸追踪 pan(硬切跟随说话人脸)或上下分屏(说话者在上);单人只做居中裁切。
- 字幕烧录:三种预设风格——opus(大字白底、当前词高亮)、karaoke(4 词分块)、minimal(干净细体);也可按用户提供的示例定制 ASS。
- 交付与迭代:产物输出到源目录
clipify_out/,并支持换风格、换转制方式、重调字幕的迭代。
工作流程
- 提取音频,Whisper 转写全源,挑选候选片段并请用户确认
- 逐段精确裁剪
- 确认目标画幅(9:16 / 16:9 / 1:1)
- 转制:人脸 ROI 定位 → 说话人时间线 → pan/分屏渲染
- 烧录逐字字幕
- 输出到
clipify_out/并报告每条片段的时长、笑点与路径
输入与输出
| 输入 | 说明 |
|---|---|
| 视频文件路径 | 必填(没给就问) |
| 目标画幅 | 选填,9:16 / 16:9 / 1:1(未指定时选完候选后再问) |
| 字幕风格 | 选填,opus / karaoke / minimal(未指定时字幕前问) |
输出:带烧录字幕的短视频文件,落盘于源目录 clipify_out/。
与相邻 skill 的区别
- video-highlights:更通用(中文/直播皆可),静态转竖版更稳;clipify 专做英文口播找笑点 + 动态人脸 pan。
- video-editing:通用剪辑的单点操作,不做智能找笑点、人脸追踪与逐字字幕烧录。
适用场景
- 英文播客/访谈切片成 TikTok/Reels 短视频
- 直播录像/长视频的高光剪辑
- 需要逐字高亮字幕的口播短视频
使用前准备
- 需要本地安装 ffmpeg、ffprobe 与 whisper;无需 API key。
- 英文内容用 tiny.en 快速模型;非英文用 base 模型。
- 只在需要定位笑点时转写全源;片段选定后对裁剪片段重跑转写,字幕时间戳更准。
clipify 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。