Meta 以每小时 0.18 美元的价格推出 Muse Voice Transcribe,支持 20 多人实时说话人分离:这对企业来说是否物超所值?
Meta 推出了 Muse Voice Transcribe,这是一款新的实时语音转文本模型,集成了转录、端点检测和针对 20 人以上场景的说话人分离功能。该模型由 Meta 超级智能实验室开发,能够边说话边处理,支持长音频、多语言代码切换及语言偏好设置。尽管其支持 20 多位说话人的能力并非世界纪录,但凭借高容量说话人分离、低延迟转录以及极具竞争力的定价策略,Muse 在市场中表现强劲。该模型在超过 70 种语言上进行了训练,其中 25 种语言在初始发布时已得到验证。说话人分离(即识别谁在说话)对于下游 AI 系统的准确性至关重要,并已直接融入 Muse 的架构之中。Muse 的公开 API 定价为每小时 0.18 美元,极具竞争力,尤其是考虑到说话人分离功能已包含在内。Meta 的基准测试显示,Muse 在词错误率方面领先,且其说话人分离错误率低于部分竞争对手。虽然 Muse 不提供单词级时间戳或置信度分数,但它为企业管理员提供了强大的性价比方案。此次发布促使竞争对手将关注点从单纯的语音识别性能,转向说话人感知准确性和总成本。