跳到主要内容
一个语音合成 skill:文本转语音、克隆音色、情感化配音,但有环境门槛
景行景行

一个语音合成 skill:文本转语音、克隆音色、情感化配音,但有环境门槛

来源:GitHub 仓库 anbeime/skill 文件 156 行,5.15 KB

一个语音合成 skill。

它能把文本变成语音,支持四种模式:

1. 基础语音合成:文本转语音 2. 音色克隆:用 3-30 秒参考音频克隆音色 3. 流式实时配音:边输入文本边生成语音 4. 情感适配配音:根据文本情绪自动调整语速、音调、音量

模型有两个选择:

  • 1.7B:音质更高,适合高质量配音、有声书
  • 0.6B:速度更快,适合实时交互

注意:这个 skill 依赖 Python 环境,需要装一堆包(torch、torchaudio、transformers、scipy、numpy、librosa、soundfile、pydub),推荐 8GB+ 显存 GPU,模型权重 3-5GB,磁盘至少 10GB。不是复制 SKILL.md 就能用。

适合谁:

  • 做视频配音、有声书的科研小组成员
  • 需要克隆特定音色、生成情感化配音的人
  • 想搭一套本地语音合成流程的人

用法: 先把 Python 环境和模型权重准备好,再把 SKILL.md 内容复制到 AI 工具里用。

评论 0

更多

登录后可点赞、收藏、评论和举报。

还没有评论,先发起一个具体问题。

0/2000