首页 > 开源 > AIGCPanel v2.5.0 支持豆包语音音色,数字人直播音色模板管理

AIGCPanel v2.5.0 支持豆包语音音色,数字人直播音色模板管理

OSChina资讯 2026-09-28 15:26 7 阅读 查看原文

这次更新让云端语音模型填个 API Key 就能用,也把数字人与直播的音色收进各自独立的音色库。

AIGCPanel 是一款一站式 AI 数字人桌面应用,Windows / macOS / Linux 都能跑,内置数字人合成、语音合成与克隆、工具箱和智能直播。没有本地显卡、又想做语音合成的用户,过去只能干看着模型列表发愁。v2.5.0 把云端语音厂商接了进来,也顺手把「音色」从散落各处的配置,收拢成一套可以管理的体系。

模型可以装一次,声音可以被反复调用。

语音音色管理

云端语音模型,填 API Key 即用

AI 模型页多了「其他模型」入口,里面是火山引擎(豆包语音)和阿里云百炼(DashScope)两条云端语音线。选厂商、起个名字、粘贴 API Key,就这些。

保存前软件会拿一句"你好,这是一段语音试听。"先合成一遍,接口通了才允许保存,省得事后在任务里翻错误日志。校验通过后,这个模型就能在声音合成、直播音色等场景直接选用。

技术上,主进程维护了一张语音 provider 注册表:每个厂商只要把自家 HTTP 接口适配成统一的 soundTts 调用就能接入。豆包语音用 X-Api-Key 鉴权,返回的是多段 JSON 拼接的单向流,得按分片解析再合并成音频;阿里云走 DashScope 的 qwen-tts,返回音频链接或 base64 数据。新增一家厂商,只写一个 provider 文件。

音色可以保存、试听、复用,不再只是某个模型的一次性配置。

AI 模型管理

数字人与直播,各有各的音色库

数字人侧叫「语音音色」,直播侧叫「直播音色」。两边都能添加声音合成或声音克隆音色,保存前直接试听。

两套音色分表存储、互不干扰。声音克隆的参考音频要重新录或重新传,再配上对应文字,不再复用数字人那边的音色库。这样一来,"这个克隆声音到底是被谁带偏的"就不会再发生了。添加弹窗右侧还放了使用说明:克隆显示录音要求,合成显示操作引导。

底层是一套 VoiceService 工厂加两个存储标识(SoundVoice / LiveVoice)。每条音色记录里存着类型、模型标识、参数和参考音频路径,试听和直播实时合成走同一条 synthesize() 调用链,效果一致。

直播换音色现在也不用动直播服务:客户端对外只暴露一个带 Voice: 前缀的 provider 名,其余路由自己处理。以后新增音色,直播端一行代码都不用改。直播配置里优先用你选中的音色,没选就回退到旧的声音驱动配置,老配置不会失效。

直播音色管理

直播控制台能直接管模型了

直播控制台顶部新增「模型控制」区域,可以启动/停止直播模型、看运行状态,旁边一个「模型日志」按钮点开就是实时日志。

要是还没导入直播模型,这里会提示你,点击直接跳到 AI 模型界面导入。以前想确认"直播模型起没起来",得在几个页面之间来回切;现在一个区域看全。

实现上没另起炉灶:从模型列表里筛出带直播能力的记录,状态徽标和日志查看复用已有的组件。

智能直播监控台

历史功能巡礼

顺带回顾几个还在用的老功能,新用户可以先认个脸。

「可视化工作流」(v2.0.0)拖拽节点把大模型、脚本、工具箱串成流水线,支持断点续跑,复杂流程不用写代码。「绿幕视频替换背景、歌曲翻唱」(v2.4.0)一个做抠像换背景,一个把歌曲人声换成指定音色,这两块发布后被问得最多。「API 服务与接口」(v2.3.0)让同一条流水线除了点界面,也能通过 HTTP 接口调用,方便集成进自己的系统。

工作流编辑器

其他更新

  • 弹窗内容自然撑高,小窗口下不再溢出屏幕
  • 左侧导航选中项改为品牌蓝浅色底块,暗色模式同步调亮
  • 禁用状态按钮改为浅灰底配中灰字,不再"看不清"
  • 修复通用模型任务在进程异常退出时被误判为成功(改为校验是否真正产出结果)
  • 修复部分错误提示在英文界面仍显示中文
  • 修复新版 Windows 上因执行 wmic 导致的报错

版本历史

近期版本回顾

  • v2.4.0 — 绿幕视频替换背景、歌曲翻唱上线,任务调度更稳更快
  • v2.3.0 — API 服务与接口正式上线,全工具多语言支持全覆盖
  • v2.2.0 — 文生图生视频上线,AI 创作全面升级
  • v2.0.0 — 工作流引擎、20+ 小工具、CLI 全面上线

你更常用本地模型还是云端语音?升级后欢迎来聊聊你的用法。

把音色存下来,把声音用起来。