VentureBeat на русском
Подписаться
Meta оценивает Muse Voice Transcribe в $0,18 в час, с возможностью распознавания речи в реальном времени для более чем 20 говорящих: выгодное предложение для предприятий?
Meta запустила Muse Voice Transcribe, новую модель преобразования речи в текст в реальном времени, объединяющую транскрипцию, определение конца речи и диаризацию говорящих для более чем 20 участников. Разработанная Meta Superintelligence Labs, Muse обрабатывает речь по мере ее поступления и поддерживает длинное аудио, многоязычное переключение кодов и языковое смещение. Хотя возможность работы с более чем 20 говорящими не является мировым рекордом, она уверенно конкурирует, сочетая высокопроизводительную диаризацию с низколатентной транскрипцией и агрессивным ценообразованием. Модель была обучена на более чем 70 языках, 25 из которых были проверены для первоначального выпуска. Диаризация, которая определяет, кто говорил, имеет решающее значение для точных последующих систем ИИ и непосредственно встроена в архитектуру Muse. Muse доступен через публичный API по цене 0,18 доллара США в час, что делает его конкурентоспособным, особенно учитывая, что диаризация включена. Тесты Meta показывают, что Muse лидирует по частоте ошибок в словах и демонстрирует более низкую частоту ошибок диаризации, чем некоторые конкуренты. Несмотря на отсутствие временных меток на уровне слов или оценок уверенности, Muse предлагает разработчикам корпоративного уровня выгодное соотношение цены и производительности. Этот запуск вынуждает конкурентов сосредоточиться на точности с учетом говорящего и общей стоимости, а не только на сыром распознавании речи.