一个语音合成 skill:文本转语音、克隆音色、情感化配音,但有环境门槛
来源:GitHub 仓库 anbeime/skill 文件 156 行,5.15 KB
一个语音合成 skill。
它能把文本变成语音,支持四种模式:
1. 基础语音合成:文本转语音 2. 音色克隆:用 3-30 秒参考音频克隆音色 3. 流式实时配音:边输入文本边生成语音 4. 情感适配配音:根据文本情绪自动调整语速、音调、音量
模型有两个选择:
- 1.7B:音质更高,适合高质量配音、有声书
- 0.6B:速度更快,适合实时交互
注意:这个 skill 依赖 Python 环境,需要装一堆包(torch、torchaudio、transformers、scipy、numpy、librosa、soundfile、pydub),推荐 8GB+ 显存 GPU,模型权重 3-5GB,磁盘至少 10GB。不是复制 SKILL.md 就能用。
适合谁:
- 做视频配音、有声书的科研小组成员
- 需要克隆特定音色、生成情感化配音的人
- 想搭一套本地语音合成流程的人
用法: 先把 Python 环境和模型权重准备好,再把 SKILL.md 内容复制到 AI 工具里用。
评论 0
更多
登录后可点赞、收藏、评论和举报。
还没有评论,先发起一个具体问题。