voice-clone · 声音克隆配音

上传本人语音样本克隆专属音色,再用该音色合成口播、旁白或带货语音。走云端 provider(阿里 CosyVoice、MiniMax、Fish Audio 等),本地无需 GPU。
流程分两步:先登记音色(enroll 得到 voice_id),再用该音色合成任意文案。需用户自备 provider 的 API key。合规红线:只能克隆本人或已获明确授权的声音。
调用示例:在聊天框中说"用我自己的声音配这段口播文案"。
产品详解
定位
voice-clone 是"我的声音"的配音工具:先克隆专属音色,再用它合成任意文案。它解决个性化音色需求;用公共现成音色时改用 tts-voiceover。
核心能力
- 音色登记(enroll):上传本人语音样本(一般 10 秒–1 分钟,清晰无噪),得到 voice_id。
- 任意文案合成(clone):用已登记音色合成口播、旁白、带货语音,支持语速调节。
- 多 provider:阿里 CosyVoice、MiniMax、Fish Audio、OpenAI 兼容、Gemini TTS,统一脚本切换。
- 合规红线:只能克隆本人或已获明确授权的声音;不得克隆他人/名人声音用于误导、诈骗、冒充、伪造;合成内容不得用于虚假信息或侵权。越线不做。
- 下游串联:合成语音可接 audio-mix 加 BGM、接 auto-subtitle 出字幕、接视频。
工作流程
- 选 provider,在
.env配置对应 API key,先check离线校验 - 登记音色:上传语音样本,得到 voice_id
- 合成:指定 voice_id + 文案 + 语速,输出到
outputs/主题名/ - (可选)接 audio-mix 混 BGM、接 auto-subtitle 生成字幕
输入与输出
| 输入 | 必填 | 说明 |
|---|---|---|
| 语音样本 | 克隆时必填 | 本人清晰无噪的语音(10s–1min,依 provider 要求) |
| 文案 | 合成时必填 | 要用克隆音色说出来的文字 |
| provider | 是 | dashscope / minimax / fish-audio / openai-compatible / gemini |
输出:合成的语音音频(mp3/wav),位于 outputs/主题名/。
与相邻 skill 的区别
| skill | 分工 |
|---|---|
| voice-clone(本) | 克隆专属音色再合成,需云端 key |
| tts-voiceover | 公共现成音色(edge-tts),无需 key |
| ai-music | AI 生成音乐/BGM |
| audio-mix | 合成后与 BGM 混音 |
适用场景
- 用本人音色批量配口播、课程旁白
- 固定 IP 音色的带货、广告语音生产
- 需要音色一致性的系列内容配音
使用前准备
- 需在
.env配置所选 provider 的 key(如DASHSCOPE_API_KEY、MINIMAX_API_KEY+MINIMAX_GROUP_ID、FISH_API_KEY);key 仅存本地。 - 云端合成按量计费;样本质量决定克隆效果:清晰、无背景噪、语气自然、时长足够。
- 遵守合规红线:只克隆有权使用的声音。
voice-clone 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。