← 返回文章列表

这样本地部署数字人开源模型,效率能够提升80%

这样本地部署数字人开源模型,效率能够提升80% 你想一键拥有私有部署的阿里开源的声音克隆模型CosyVoice吗? 图片展示的是CosyVoice 300M语音生成界面。界面上方显示模型大小为305M

互联网

这样本地部署数字人开源模型,效率能够提升80%

你想一键拥有私有部署的阿里开源的声音克隆模型CosyVoice吗?

图片展示的是CosyVoice - 300M语音生成界面。界面上方显示模型大小为305M,创建时间为2025 - 01 - 01 03:03。下方有语音生成和语音识别的GitHub链接。中间部分有“随机语音生成”选项,可选择抑制语义生成(模拟特定声音)或自然语音生成(自然语义输出)。还有选择特定音色的选项,如中文男、英文女等。底部有“生成音频”按钮,以及“合成音频”选项。该图片与文档中介绍一键拥有私有部署的阿里开源声音克隆模型CosyVoice的内容相关,展示了其操作界面。

你想一键拥有私有部署的文生图模型StalbeDiffusion吗?

图片展示的是Stable Diffusion模型的界面。界面上方有“Stable Diffusion模型(ckpt)”的下拉菜单,下方有“生成”按钮。界面中部有“文生图”“附助功能”“图片信息”等选项卡,当前选中“文生图”。下方有“生成参数”“LoRA”等设置区域,如“采样器(Sampler)”“采样迭代数(Steps)”“超网络(Hypernetwork)”等参数可调整。界面底部有“脚本”下拉菜单,以及多个图标按钮。该图与上下文介绍的Stable Diffusion模型相关,展示了其操作界面。

你想一键部署腾讯对口型的开源数字人模型MuseTalk吗?

图片展示了腾讯开源数字人模型MuseTalk的实时跟形合成效果。左侧为音频波形图,下方是合成视频的参考图像。右侧是合成视频画面,显示一位身着白色上衣、红色蝴蝶结的数字人,背景为户外场景。画面下方有播放进度条、暂停按钮等操作按钮,还设有GIFGAN版本选择框及“程序增强”“GIFGAN面部高清修复”选项。该图与上下文介绍的MuseTalk模型相呼应,直观呈现了模型的合成效果。

你想一键部署换脸模型FaceFusion吗?

图片展示了FastRuler 2.4.1界面,左侧为参数设置区域,有多个滑动条和开关按钮,如“FaceAligner”“FaceAligner”“FaceAligner”等。中间和右侧分别显示了两张不同角度的女性照片,右侧照片为原图,左侧照片为调整后的效果。底部有“Run”和“Stop”按钮。该图片与上下文介绍的数字人模型部署相关,直观呈现了模型的界面操作及效果展示。

真的只需要一键!我折腾过很长时间的这种模型的部署,踩过很多坑,比如用Google Colab的千兆宽带快速制作镜像,然后将这个Linux系统打包下载;比如直接在云服务器商做成Docker镜像等等!这种模型的部署的大坑主要有两点:

1**.国内的网速太慢了**,大部分模型权重文件需要从HuggingFace上下载,这个网站国内是没法访问的!能访问速度也很感人!光这一关就花掉很多时间。

2.各种开源的模型还不成熟就匆匆开源了,等你部署的时候,会发现各种python包的版本不匹配,各种配置文件乱七八糟,你自己从零去调试,又浪费了很多时间。等你部署完,新的模型又出来了 ,你花了大时间研究的模型已经成了明日黄花!

这种感觉真的太痛苦了,当时义愤填膺的我,忍不住给模型的作者发过邮件吐槽!比如腾讯的MuseV开源模型!

图片是一封邮件截图,发件人为benbinwu@tencent.com,主题是“musev开源项目部署失败!”。邮件内容提到作者按照腾讯团队在github上的项目文档部署musev,连续五天失败,浪费了大量时间。作者下载了官方推荐的docker镜像,但需自己下载源码和模型文件,脚本中模型文件路径错误,需手动改。还提到国内访问huggingface下载链接断链,因模型文件太大。此邮件反映了作者在部署开源模型时遇到的困难,与上下文提到的作者给模型作者发邮件吐槽腾讯开源模型质量相呼应。

事后也收到了腾讯团队他们的回信,现在回想起来,觉得自己有点过于情绪化了!

图片为一封邮件截图,是腾讯音乐娱乐科技有限公司天琴实验室对MuseV开源模型作者的回复。邮件中详细解释了开源仓MuseV不支持一键部署、使用需按指引下载配置环境变量、代码和镜像隔离需手动下载等问题,还提到docker镜像和代码仓、模型隔离问题及huggingface网络问题的解决思路。该邮件与上下文紧密相关,是对作者邮件中提到问题的补充说明。

所以,如果大家想体验数字人的开源模型,千万不要自己部署了,太浪费时间了,可以用一下下面这个方法。

国内国外有很多GPU服务商,他们都有自己的社区,提供免费的Docker镜像下载,直接下载他们现成的镜像就可以了。

直说最有用的方法,魔搭社区当然是最好的,但是本地部署还是不太好用。国内做的最好的就是AutoDL,它的社区是CodeWithGPU ,里面可以找到非常多的模型。

图片展示了CodeWithGPU平台的客户端界面。界面左侧有热门分类标签,如StableDiffusion、Langchain等。右侧中部突出显示了“RVC-Boss/GPT-SoVITS/GPT-SoVITS-Official”模型,其运行时长、GitHub星数、下载量等信息一目了然。右侧下方是“chatchat-space/Langchain Chatchat/Langchain-Chatchat”模型的相关介绍。右侧顶部有“客户端”标识,有红色箭头指向。该图片与文档中下载镜像的内容相关,直观呈现了下载模型的平台界面。

我们需要做的就是下载它的客户端到Linux主机上,运行服务,然后访问localhost:2022

# 下载客户端并添加可执行权限
wget -O cg-client https://codewithgpu.ks3-cn-beijing.ksyuncs.com/cg-client
chmod +x cg-client

# 启动客户端,需要使用到sudo权限否则有docker使用上的异常
sudo ./cg-client

图片展示了在Linux主机上使用AutoDL客户端访问数字人开源模型的命令及结果。首先打开PowerShell后执行wsl命令,切换目录到HOME,下载cg - client镜像,下载速度较快。接着增加可执行权限并启动cg - client服务,显示cg - client正在运行,可通过http://localhost:2022/container?token=...访问该链接。该图片与文档中介绍本地部署数字人开源模型的步骤相关,直观呈现了操作过程及结果。

在本地访问这个链接(可以使用vscode将2022端口转发到本地),然后安装下图的方法下载镜像!

图片展示的是CG客户端v1.4的容器管理界面。界面上方有“容器”“公网网值”“性能监控”三个选项卡,当前选中“容器”。界面中列出了多个容器信息,如python 3.12.7、1panel/maxllavc v1.10.2 - lts等,每个容器有名称、版本、镜像ID、创建时间、状态、操作等信息。部分容器状态为“运行中”,如1panel/maxllavc v1.10.2 - lts、ollama/ollama v0.5.13等。该图与上下文介绍的下载镜像、安装方法等内容相关,直观呈现了容器管理情况。

下载速度还算不错,基本1个小时内都能下载完成。重要的是这些镜像可以直接使用,不需要自己部署了,如果怕浪费时间,可以直接在线租赁GPU先体验一番。

图片展示了RVC-Boss仓库中GPT-SoVITS/GPT-SoVITS-Official镜像的相关信息。左侧为镜像详情,显示了镜像版本、描述、星标数等信息,还列出了使用说明、基本环境等。右侧是镜像配置界面,有镜像版本、PyTorch版本、CUDA版本、镜像大小等设置项,下方有“AutoCL创建实例”按钮。该图片与上下文紧密相关,直观呈现了镜像的下载和配置操作,帮助用户了解如何使用该镜像进行相关操作。

我目前个人使用的声音克隆、声音合成、文生图、对口型的数字人模型,基本都是从这里获取的。

模型下载完成后,不需要继续使用它的客户端对容器进行管理,可以直接用1Panel面板,把创建的容器删除,将镜像修改标签后,重新创建容器。

图片展示的是1Panel面板中容器的镜像管理界面。左侧导航栏选中“容器”选项。右侧上方有容器、编排、镜像等标签,当前选中“镜像”。下方列表显示了多个镜像信息,包括ID、状态、标签、大小、时间及操作选项,如标签、推送、导出、删除等。该图片与上下文紧密相关,直观呈现了文档中提到的模型下载完成后,可直接用1Panel面板管理容器镜像的操作场景。

如果想对镜像做备份,可以直接将镜像推送到阿里云或者腾讯云上的容器管理服务就可以了。