[分享创造] 管家级教程:在 Windows 上配置 WSL2、CUDA 及 VLLM,开源音频克隆项目
·
ok ,那么今天给大家分享一下之前看到过的一个 音频克隆项目 使用体验音色效果没有那么高的效果,不过开源嘛,搞来玩一玩试看看。 源地址: https://github.com/index-tts/index-tts 关于 IndexTTS IndexTTS 是一个基于 GPT 风格的文本转语音 (TTS) 模型,主要基于 XTTS 和 Tortoise 算法。 它能够通过拼音纠正汉字发音,并通过标点符号控制任意位置的停顿。 我们增强了系统的多个模块,包括改进说话人条件特征表示,并集成 BigVGAN2 以优化音频质量。我们的系统基于数万小时的数据进行训练,达到了最佳性能,超越了目前流行的 TTS 系统,例如 XTTS 、CosyVoice2 、Fish-Speech 和 F5-TTS 。 源项目基于 torch , 本文实践项目是改用 VLLM 进行的项目 https://github.com/Ksuriuri/index-tts-vllm vllm 暂不支持 windows 运行,所以需要通过 wsl 虚拟机虚拟 linux 系统 目前 wsl 主力版本为 wsl2 所以我们采用 wsl2 需要的设备与流程: 足够的存储空间 显卡支持 CUDA…