Meta, Muse Voice Transcribe를 시... 노트

Meta, Muse Voice Transcribe를 시간당 $0.18에 제공, 20명 이상의 화자에 대한 실시간 화자 분리 기능 포함: 기업에게는 횡재인가?

Meta는 20명 이상의 참가자를 위한 실시간 음성-텍스트 모델인 Muse Voice Transcribe를 출시했습니다. 이 모델은 전사, 엔드포인트 감지, 화자 분할 기능을 통합합니다. Meta Superintelligence Labs에서 개발한 Muse는 음성이 발생하는 즉시 처리하며, 긴 오디오, 다국어 코드 스위칭, 언어 편향을 지원합니다. 20명 이상의 화자 처리 능력은 세계 최고는 아니지만, 고용량 화자 분할과 저지연 전사, 공격적인 가격 책정을 결합하여 강력하게 경쟁합니다. 이 모델은 70개 이상의 언어로 훈련되었으며, 초기 출시를 위해 25개 언어가 검증되었습니다. 누가 말했는지 식별하는 화자 분할은 정확한 다운스트림 AI 시스템에 중요하며 Muse의 아키텍처에 직접 통합되었습니다. Muse는 시간당 0.18달러의 공개 API 가격으로 출시되어 경쟁력이 있으며, 특히 화자 분할이 포함된 점을 고려하면 더욱 그렇습니다. Meta의 벤치마크에 따르면 Muse는 단어 오류율에서 선두를 차지하고 일부 경쟁사보다 낮은 화자 분할 오류율을 보여줍니다. 단어 수준의 타임스탬프나 신뢰도 점수를 제공하지는 않지만, Muse는 엔터프라이즈 개발자에게 강력한 가격 대비 성능을 제공합니다. 이번 출시는 경쟁사들이 단순한 음성 인식뿐만 아니라 화자 인식 정확도와 총 비용에 집중하도록 압박할 것입니다.
CdXz5zHNQW_q5QrxQkRrB.png