小男娘专武之变声器+皮套配置指北
环境配置
- Windows 10
- RTX 4070 Laptop
- 32GB RAM
变声器:RVC
笔者使用 RVC 变声器做实时变声。因为没有过多配置需求,这里采用 WebUI 开箱即用包。
GitHub 项目链接:Retrieval-based-Voice-Conversion-WebUI
版本:2.3.260718
下载列表:https://www.yuque.com/flowercry/hxf0ds
下载直链:GPT-SoVITS-v2pro-20250604.7z
使用多线程下载器下载即可,Modelscope 站无限速。
下载解压后运行 go-webui.bat 打开 WebUI 推理界面;运行 go-realtime_gui.bat 打开实时变声界面。
注意当运行 go-webui.bat 时(版本 20260718),会显示报错
1 | 首次启动程序可能需要耐心等待20秒 |
解决方法是修改 webui.py,将第 112 行的 server_name="0.0.0.0", 改为 server_name=os.environ.get("RVC_WEBUI_HOST", "127.0.0.1"), 即
1 | - server_name="0.0.0.0", |
先随便找个音频上传测试一下,用自带音色如 kikiV1.pth ,测试能否正常推理。
默认配置是
1 | 变调 |
将保护清辅音和呼吸声改为 0 效果更好。
运行 go-realtime_gui.bat 打开实时变声界面。模型使用 assets/weights/kikiV1.pth,音高提取算法使用 rmvpe。
默认配置是
- 设备类型 MME
- 使用设备采样率
- 响应阈值 -60
- 音调设置 12
- 性别因子/声线粗细 0.0
- 检索特征占比 0.00
- 响度因子 0.50
- 采样长度 0.13
- 淡入淡出长度 0.08
- 额外推理时长 2.00
- 输入降噪/输出降噪 OFF
音调设置因为是男转女所以采用 +12。
个人配置
性别因子 -0.9
检索特征占比 0.2
点击开始音频转换即可实时变声。
私货:支持小鮟鱇!
下载见 https://angler.blue/#lib-voice。
2026/8/26 补充
做到现在,如果只想自己听音频那就足够了。但是如果想将变声器的音频输出到例如 kook、腾讯会议、QQ 电话等交流或直播工具中,那就需要一步将变声器的「音频输出」接到 IM 的「音频输入」中。这就需要虚拟音频线缆工具。
笔者使用 VB-CABLE Virtual Audio Device。这个工具可以将音频输出虚拟连接到音频输入中,这样就能实现将变声器输出的音频接到 IM 的输入了,从而让其他人听到变声器输出的音频。
直链下载:VBCABLE_Driver_Pack45.zip
解压后右键 VBCABLE_Setup_x64.exe 以管理员运行。安装后重启电脑。
打开变声器,将变声器的输出选择 CABLE Input(就是 Input,对应着虚拟线缆的输入端);将 IM 工具的输入(麦克风等)选择 CABLE Output(对应虚拟线缆的输出端)。Cable In 16ch 在音频设置中禁用掉即可,这里不用管。其他音频配置照常即可。
这样就能做到将变声器的音频输出接到直播工具中了。
皮套:EasyVtuber
因为没钱买真 3D 或者 Live2D 模型,所以使用 EasyVtuber 做虚拟形象,只需要一张白底/透明底二次元图即可。
GitHub 链接:EasyVtuber
整合包链接:https://pan.quark.cn/s/cda200521df7
这里使用的版本为 EasyVtuber_v0.8.1。下载解压后运行 01A.启动器.bat 即可。图片尽量使用白色或透明背景的二次元风格图片。
输入:笔者使用苹果移动设备,下载 iFacialMocap 应用(免费版即可,有广告关掉就行)进行面部捕捉。
输出:选用 Spout2,OBS Studio 插件 下载安装到 OBS 中,合成模式选 预乘透明度。
N 卡可以启用 TensorRT 加速。不知道有什么用但还是先开开。
打开 OBS 虚拟摄像机即可进行输出。
总结
同时打开 RVC + EasyVtuber 就大概可以开播了。实际应用的话和群友联机玩游戏会比较方便。
性能占用的话同时开这两个占用也不算大,具体没测试,但基本不影响正常游戏直播等等。
就到这里吧。