VentureBeat 日本語
フォロー
Microsoft AIのMAI-Transcribe-2は、価格と速度においてOpenAI、Google、ElevenLabsを下回る
Microsoftは、OpenAIやGoogleといった競合他社の既存製品よりも高速で、より正確で、大幅に安価な新しい音声認識モデル「MAI-Transcribe-2」をローンチしました。1時間あたりわずか10セントという価格設定のこの先進的なモデルは、前モデルから大幅なコスト削減を実現しています。同社の戦略は、以前OpenAIからライセンス供与を受けていたモデルを置き換えるために設計された、自社開発の高品質AIモデルの開発を含んでいます。MAI-Transcribe-2は60言語をサポートし、バックグラウンドノイズや話し声の重なりを含む、実際のビジネス音声の複雑さに対応できるように構築されています。話者分離、単語レベルのタイムスタンプ、キーワードバイアスといった主要機能は追加料金なしで含まれています。また、設定可能な出力スタイルを提供し、単一の会話内での言語間のコードスイッチングにも対応します。Microsoftは、精度と速度におけるパフォーマンスを強調する、FLEURSやArtificial Analysisといったベンチマークでトップランクを獲得していると主張しています。5ヶ月で3つのモデルをリリースするという迅速なリリースサイクルは、この分野におけるMicrosoftの開発加速を示しています。このような社内AI能力構築への推進は、独立性と利益率の向上への願望によって推進されています。Microsoftは、より低コストで音声を文字起こしすることで、Teams、Word、Excelといった自社製品にこれらの機能をより手頃な価格で統合できるようになります。この動きにより、MicrosoftはAI市場でより効果的に競争し、外部パートナーへの依存を減らすことができます。同社は、不可欠な機能を前例のない価格設定でバンドルすることにより、専門の文字起こしベンダーに直接挑戦しています。Alibabaが強力な競合相手として挙げられていますが、Microsoftは企業向けに魅力的な代替案を提供することを目指しています。