MetaはMuse Voice Transcribeを1時間... ノート
VentureBeat 日本語

MetaはMuse Voice Transcribeを1時間あたり0.18ドルで提供、20人以上の話者に対応するリアルタイム話者分離機能付き:企業にとってはお買い得か?

Metaは、20人以上の参加者に対応する文字起こし、エンドポイント検出、話者ダイアライゼーションを統合した新しいリアルタイム音声テキスト変換モデル「Muse Voice Transcribe」をローンチしました。Meta Superintelligence Labsによって開発されたMuseは、音声が発生すると同時に処理し、長時間の音声、多言語のコードスイッチング、言語バイアスをサポートします。20人以上の話者に対応する能力は世界記録ではありませんが、高容量のダイアライゼーションと低遅延の文字起こし、そして積極的な価格設定を組み合わせることで、強力に競合します。このモデルは70以上の言語でトレーニングされ、そのうち25言語が初期リリースで検証されました。誰が話したかを特定するダイアライゼーションは、正確な下流AIシステムにとって不可欠であり、Museのアーキテクチャに直接組み込まれています。Museは、ダイアライゼーションが含まれていることを考慮すると、特に競争力のある、1時間あたり0.18ドルのパブリックAPI価格で提供されます。Metaのベンチマークによると、Museは単語エラー率でリードし、一部の競合他社よりも低いダイアライゼーションエラー率を示しています。単語レベルのタイムスタンプや信頼度スコアは提供していませんが、Museはエンタープライズ開発者にとって強力な価格性能比を提示します。このローンチは、競合他社に、生の音声認識だけでなく、話者を意識した精度と総コストに焦点を当てるよう圧力をかけます。
CdXz5zHNQW_q5QrxQkRrB.png