voice-clone · 声音克隆配音

voice-clone

上传本人语音样本克隆专属音色,再用该音色合成口播、旁白或带货语音。走云端 provider(阿里 CosyVoice、MiniMax、Fish Audio 等),本地无需 GPU。

流程分两步:先登记音色(enroll 得到 voice_id),再用该音色合成任意文案。需用户自备 provider 的 API key。合规红线:只能克隆本人或已获明确授权的声音。

调用示例:在聊天框中说"用我自己的声音配这段口播文案"。

产品详解

定位

voice-clone 是"我的声音"的配音工具:先克隆专属音色,再用它合成任意文案。它解决个性化音色需求;用公共现成音色时改用 tts-voiceover。

核心能力

工作流程

  1. 选 provider,在 .env 配置对应 API key,先 check 离线校验
  2. 登记音色:上传语音样本,得到 voice_id
  3. 合成:指定 voice_id + 文案 + 语速,输出到 outputs/主题名/
  4. (可选)接 audio-mix 混 BGM、接 auto-subtitle 生成字幕

输入与输出

输入 必填 说明
语音样本 克隆时必填 本人清晰无噪的语音(10s–1min,依 provider 要求)
文案 合成时必填 要用克隆音色说出来的文字
provider 是 dashscope / minimax / fish-audio / openai-compatible / gemini

输出:合成的语音音频(mp3/wav),位于 outputs/主题名/。

与相邻 skill 的区别

skill 分工
voice-clone(本) 克隆专属音色再合成,需云端 key
tts-voiceover 公共现成音色(edge-tts),无需 key
ai-music AI 生成音乐/BGM
audio-mix 合成后与 BGM 混音

适用场景

使用前准备


voice-clone 隶属于 Aiglade Skill 库。在 Aiglade 聊天框中用自然语言描述需求即可调用。

← 回到 Skill 大全