首页 > 资讯 > Modulate 融资 2500 万美元,用声音模型打击深度伪造

Modulate 融资 2500 万美元,用声音模型打击深度伪造

赢政天下 2026-09-28 22:24 5 阅读 查看原文
Modulate 融资 2500 万美元,用声音模型打击深度伪造

当一段十几秒的语音样本就能克隆出以假乱真的声音时,「听到的」已经不再是可信的证据。据 TechCrunch 报道,语音 AI 公司 Modulate 宣布完成 2500 万美元新一轮融资,用于扩展其声音模型与声音分析套件。这家公司最被外界熟知的定位,是把声学建模能力用于两个方向:一是理解人声中的情绪与语义,二是判断一段声音究竟是真人还是机器合成。

从游戏语音审核起家的声学公司

Modulate 早期的成名产品是面向在线游戏的语音审核系统 ToxMod。在多人在线游戏里,语音频道长期是骚扰、仇恨言论和恶意行为的温床,而传统做法要么依赖玩家举报,要么依赖人工回听录音,效率低且严重滞后。ToxMod 的思路是用模型实时分析语音流,识别语调、攻击性措辞和互动模式,在事件发生的当下就向运营方发出预警,而不是等到事后处理。

这套能力看似垂直,实际上构成了公司后续转向反诈业务的技术底座。要判断一句话是否带有攻击性,模型必须先理解「谁在说、以什么方式说、说话时的状态如何」——这正是声纹建模与声音属性分析的范畴。当生成式语音技术成熟之后,同一套底层能力很自然地延伸到另一个问题上:说话的人,真的是本人吗?

声音模型如何识别深度伪造

据公司介绍,其模型并不只依赖单一维度的判断,而是综合声音的多个层面进行分析。人声在物理上由声带振动、声道共振和呼吸节奏共同塑造,其中包含大量说话人本人也未必意识到的细微特征:气声的比例、音节之间的过渡方式、特定音素的发音习惯,乃至情绪波动时基频的漂移轨迹。

语音克隆模型通常在有限样本上学习,生成结果在宏观上极为逼真,却在微观层面留下痕迹——例如呼吸位置不合逻辑、长音段的频谱过于平滑、韵律在句尾出现不自然的收敛。Modulate 的做法是把这些信号聚合成分数,并输出可解释的判断依据,而不是简单给出一个是或否的标签。对于需要做出处置决定的平台与机构来说,可解释性往往比准确率数字更重要。

「生成与检测本质上是一场持续的军备竞赛,任何宣称一劳永逸的方案都值得怀疑。」——这是深度伪造检测领域被反复提及的共识,也是这类公司必须持续融资、持续迭代模型的根本原因。

语音诈骗正在成为主流犯罪形态

Modulate 把反深度伪造与反诈骗、反欺诈并列为核心应用场景,背后是过去两年急剧恶化的现实。利用 AI 克隆声音冒充亲属、公司高管或客服人员的案件在全球范围内快速增加,单笔损失动辄数十万甚至数百万美元。攻击者的成本却在下降:一段公开发布的演讲、一则短视频、甚至一通骚扰电话留下的录音,都可能成为克隆素材。

更棘手的是场景迁移。企业内部的财务流程长期依赖「电话指令 + 邮件确认」的弱验证链条,而高管声音恰恰是最容易从公开渠道获取的素材之一。当攻击者同时掌握声音与视频会议画面时,传统的身份核验手段几乎同时失效。这使得声音验真从安全部门的边缘议题,上升为金融机构、电信运营商和大型企业的合规需求。

监管层面的压力也在同步累积。多个司法辖区已开始要求对 AI 生成内容进行标识,并对未经授权的语音克隆设定明确责任;在反骚扰电话和通信欺诈的监管框架下,运营商被期待具备更强的实时识别能力。对 Modulate 这类公司而言,监管收紧既是挑战,也是需求来源——合规往往意味着采购。

商业模式与竞争格局

从公开信息看,Modulate 的收入结构大致分为两块:一是面向平台的内容安全与语音审核服务,按处理量或席位计费;二是面向企业、金融机构与通信服务商的声音分析与反欺诈能力,通常以 API 或私有化部署的形式交付。这种「双轮」结构的好处在于,内容安全业务提供稳定的现金流与海量语音数据反馈,反诈业务则具备更高的单价和更强的客户黏性。

竞争同样激烈。深度伪造检测赛道上既有专注于音频取证的研究型公司,也有把声音识别并入更大多模态风控体系的云服务商,还有从生物特征认证方向切入的身份验证厂商。Modulate 的差异化在于其对「人声表达」的长期积累——它不只是判断真假,还试图理解声音中的意图与状态。这种能力在客服质检、心理健康筛查、在线教育等场景同样具备延展性。

编者按:检测方的结构性劣势

需要冷静看待的是,检测方在这场博弈中天然处于劣势。生成模型只需在某一维度上取得突破,就能让既有的检测特征失效;而检测模型必须同时覆盖所有已知的伪造路径,还要面对真实语音中本就存在的噪声、口音、录音设备差异和信道压缩。误判的代价同样不对称:把真人误判为 AI,可能造成账号封禁与信任伤害;把 AI 误判为真人,则可能带来直接的经济损失。

因此,这一赛道的长期价值或许并不在于「抓住每一个假声音」,而在于提供分层风险信号,让下游系统据此调整验证强度。2500 万美元的新资金,大概率会被投入到模型迭代、跨语种覆盖与合规资质建设上——这些恰恰是慢变量,也是决定一家声音分析公司能否从工具供应商升级为基础设施的关键。语音作为最自然的交互入口,其可信性问题不会随着某一次技术突破而消失。

本文编译自 TechCrunch