首页 > 资讯 > SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变

SpaceXAI 发布 Grok Voice Transcribe 2.0 语音转文本模型:错误率降低约一半,价格保持不变

IT之家 2026-09-19 19:12 10 阅读 查看原文

IT之家 9 月 19 日消息,当地时间 9 月 18 日,SpaceXAI 发布了 Grok Voice Transcribe 2.0 语音转文本模型,在保持价格不变的前提下,错误率降低约一半。

官方表示,Grok Voice Transcribe 2.0 基于 Grok Voice 底层的音频基础模型构建。目前,Grok Voice 已全面赋能实际业务:每天承接数万通客服电话,转录数百万小时的视频旁白,并驱动实体硬件中的各类语音智能体 —— 其中包括特斯拉车辆中搭载的 Grok 助手。

在 Artificial Analysis 榜单中,Grok Voice Transcribe 2.0 在全部 32 款流式模型中准确率高居榜首

除公开基准外,SpaceXAI 基于线上实际业务中采样的四个内部数据集,对模型的词错误率进行了系统评测。这四个测试集分别涵盖:客服电话音频、与 Grok 的日常对话(英语)、电话号码、邮箱、地址等口述信息,以及多语种简短语音指令。在四个数据集的评测中,Grok Voice Transcribe 2.0 的表现均全面超越 1.0 版本。

Grok Voice Transcribe 2.0 的定价与 1.0 版本保持完全一致。批量转录为每小时音频 0.10 美元(IT之家注:现汇率约合 0.67 元人民币),实时流式转录为每小时 0.20 美元(现汇率约合 1.3 元人民币);同时,说话人分离、精确时间戳以及自定义关键词功能均已全部包含在内,无需支付额外费用。