小男娘专武之变声器+皮套配置指北

环境配置

  • Windows 10
  • RTX 4070 Laptop
  • 32GB RAM

变声器:RVC

笔者使用 RVC 变声器做实时变声。因为没有过多配置需求,这里采用 WebUI 开箱即用包。

GitHub 项目链接:Retrieval-based-Voice-Conversion-WebUI
版本:2.3.260718
下载列表:https://www.yuque.com/flowercry/hxf0ds
下载直链:GPT-SoVITS-v2pro-20250604.7z

使用多线程下载器下载即可,Modelscope 站无限速。


下载解压后运行 go-webui.bat 打开 WebUI 推理界面;运行 go-realtime_gui.bat 打开实时变声界面。

注意当运行 go-webui.bat 时(版本 20260718),会显示报错

1
2
3
4
5
6
7
8
9
10
11
12
13
首次启动程序可能需要耐心等待20秒
D:\RVC20260718Nvidia\runtime\Lib\site-packages\gradio\routes.py:23: UserWarning: pkg_resources is deprecated as an API. See https://setuptools.pypa.io/en/latest/pkg_resources.html. The pkg_resources package is slated for removal as early as 2025-11-30. Refrain from using this package or pin to Setuptools<81.
import pkg_resources
当前设备:cuda:0 | 推理精度:torch.float16
Traceback (most recent call last):
File "D:\RVC20260718Nvidia\webui.py", line 2211, in <module>
launch_webui_with_port_fallback(app, config)
File "D:\RVC20260718Nvidia\webui.py", line 111, in launch_webui_with_port_fallback
queued_app.launch(
File "D:\RVC20260718Nvidia\runtime\Lib\site-packages\gradio\blocks.py", line 1391, in launch
raise ValueError(
ValueError: When localhost is not accessible, a shareable link must be created. Please set share=True.
Press any key to continue . . .

解决方法是修改 webui.py,将第 112 行的 server_name="0.0.0.0", 改为 server_name=os.environ.get("RVC_WEBUI_HOST", "127.0.0.1"),

1
2
- server_name="0.0.0.0",
+ server_name=os.environ.get("RVC_WEBUI_HOST", "127.0.0.1"),

先随便找个音频上传测试一下,用自带音色如 kikiV1.pth ,测试能否正常推理。

默认配置是

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
变调
0

音高提取算法
rmvpe

后处理重采样至最终采样率,0为不进行重采样
0

输入源音量包络替换输出音量包络融合比例,越靠近1越使用输出包络
0.25

保护清辅音和呼吸声,防止电音撕裂等artifact,拉满0.5不开启,调低加大保护力度但可能降低索引效果
0.25

检索特征占比
0.75

将保护清辅音和呼吸声改为 0 效果更好。


运行 go-realtime_gui.bat 打开实时变声界面。模型使用 assets/weights/kikiV1.pth,音高提取算法使用 rmvpe

默认配置是

  • 设备类型 MME
  • 使用设备采样率
  • 响应阈值 -60
  • 音调设置 12
  • 性别因子/声线粗细 0.0
  • 检索特征占比 0.00
  • 响度因子 0.50
  • 采样长度 0.13
  • 淡入淡出长度 0.08
  • 额外推理时长 2.00
  • 输入降噪/输出降噪 OFF

音调设置因为是男转女所以采用 +12。

个人配置
性别因子 -0.9
检索特征占比 0.2

点击开始音频转换即可实时变声。


私货:支持小鮟鱇
下载见 https://angler.blue/#lib-voice


2026/8/26 补充

做到现在,如果只想自己听音频那就足够了。但是如果想将变声器的音频输出到例如 kook、腾讯会议、QQ 电话等交流或直播工具中,那就需要一步将变声器的「音频输出」接到 IM 的「音频输入」中。这就需要虚拟音频线缆工具。

笔者使用 VB-CABLE Virtual Audio Device。这个工具可以将音频输出虚拟连接到音频输入中,这样就能实现将变声器输出的音频接到 IM 的输入了,从而让其他人听到变声器输出的音频。

直链下载:VBCABLE_Driver_Pack45.zip

解压后右键 VBCABLE_Setup_x64.exe 以管理员运行。安装后重启电脑。

打开变声器,将变声器的输出选择 CABLE Input(就是 Input,对应着虚拟线缆的输入端);将 IM 工具的输入(麦克风等)选择 CABLE Output(对应虚拟线缆的输出端)。Cable In 16ch 在音频设置中禁用掉即可,这里不用管。其他音频配置照常即可。

这样就能做到将变声器的音频输出接到直播工具中了。

皮套:EasyVtuber

因为没钱买真 3D 或者 Live2D 模型,所以使用 EasyVtuber 做虚拟形象,只需要一张白底/透明底二次元图即可。

GitHub 链接:EasyVtuber
整合包链接:https://pan.quark.cn/s/cda200521df7

这里使用的版本为 EasyVtuber_v0.8.1。下载解压后运行 01A.启动器.bat 即可。图片尽量使用白色或透明背景的二次元风格图片。

输入:笔者使用苹果移动设备,下载 iFacialMocap 应用(免费版即可,有广告关掉就行)进行面部捕捉。
输出:选用 Spout2,OBS Studio 插件 下载安装到 OBS 中,合成模式选 预乘透明度
N 卡可以启用 TensorRT 加速。不知道有什么用但还是先开开。

打开 OBS 虚拟摄像机即可进行输出。

总结

同时打开 RVC + EasyVtuber 就大概可以开播了。实际应用的话和群友联机玩游戏会比较方便。

性能占用的话同时开这两个占用也不算大,具体没测试,但基本不影响正常游戏直播等等。

就到这里吧。