Meta(META.US)杀入实时语音转写赛道:基准测试力压OpenAI、谷歌(GOOGL.US),API价格低至每小时0.18美元

近日,Meta旗下超级智能实验室(Superintelligence Labs)正式推出实时语音识别模型Muse Voice Transcribe。

智通财经APP获悉,近日,Meta(META.US)旗下超级智能实验室(Superintelligence Labs)正式推出实时语音识别模型Muse Voice Transcribe。该模型在部分基准测试中超越OpenAI、谷歌(GOOGL.US)等竞争对手的同类产品,并以每小时0.18美元的API价格进入市场。不过,Meta方面确认,该模型不会开放权重。

据了解,在Artificial Analysis的AA-WER Streaming英语语音转写准确率基准上,Muse Voice Transcribe的词错率为3.1%,优于Cartesia Ink-2的3.4%、ElevenLabs Scribe v2 Real-time的3.6%、OpenAI GPT Live Transcribe的3.9%以及谷歌Gemini 3.5 Transcribe Live的4.0%。

在说话人区分能力上,各模型整体表现仍难令用户满意,但Muse Voice Transcribe在多个标准基准中的平均错误率为17.5%,同样处于领先位置。

image.png

据Meta介绍,该模型可区分超过20位说话人,并支持超过70种语言,其中25种经过“广泛验证”,还能处理多语者在对话中切换语言以及超过一小时的长时间对话。

Muse Voice Transcribe目前已通过Meta Model API、Meta AI for Mac和Muse Code提供。API定价为每1000音频分钟3美元,折合每小时0.18美元。与Meta此前Muse Glimmer系列开放权重的做法不同,Meta发言人向The New Stack确认,该模型不会公开权重。

技术层面,Muse Voice Transcribe属于Muse Spark家族的自回归多模态模型。音频以80毫秒为单位输入,每秒约12.5个块,每块被压缩为单个软token。模型在每个块上做出选择:要么输出文本token,要么输出特殊的“下一音频”占位符,等待更多音频上下文。当音频结束时,“空音频”令牌会触发模型输出剩余文本。

这种机制使模型能自行控制延迟,Meta称之为“自适应延迟”。简单词汇几乎可以即时转写,复杂词汇则获得更多音频上下文。该权衡在强化学习阶段被训练,词错率奖励与延迟奖励采用相乘而非相加的方式优化。说话人识别也使用类似机制。

今夏,实时语音转写已成为AI领域竞争最激烈的细分市场之一。近期OpenAI、谷歌、xAI、阿里巴巴(BABA.US)等公司均在数周内密集发布流式语音模型,专业厂商也已深耕多时。而Muse Voice Transcribe目前0.3个百分点的基准领先优势,在这种竞争强度下很难长期保持。

不过,对Meta而言,智能眼镜、Mac应用等核心产品都需要实时语音能力作为底层支撑。这一内生需求可能促使Meta在该赛道持续投入,而非仅追求外部API市场份额。

智通声明:本内容为作者独立观点,不代表智通财经立场。未经允许不得转载,文中内容仅供参考,不作为实际操作建议,交易风险自担。更多最新最全港美股资讯,请点击下载智通财经App
分享
微信
分享
QQ
分享
微博
收藏