UX Collective | Medium на русском
Подписаться
8 голосовых AIUX паттернов
"Радио Рекс, первая игрушка с голосовым управлением, появившаяся в 1922 году, представила простой принцип, где звуковые паттерны вызывали реакции. Эта фундаментальная концепция сохранялась десятилетиями в устройствах с голосовым управлением, а доминирующие интерфейсы, такие как Siri, Alexa и Google Assistant, фокусировались на извлечении намерений. Последние достижения в области больших языковых моделей и речевых моделей произвели революцию в голосовом ИИ, открыв новые варианты использования и модели взаимодействия.В этой статье представлены восемь новых паттернов пользовательского интерфейса голосового ИИ, анализирующих воспринимаемую роль ИИ-агента, ключевые проектные решения и ограничения для каждого. Первый паттерн — видео/голосовой вызов с аватаром, где анимированный или гиперреалистичный аватар обеспечивает взаимодействие лицом к лицу, способствуя ощущению связи и эмоциональной поддержке. Соображения по дизайну включают личность ИИ и проблему навигации по "зловещей долине" с реалистичными аватарами.Второй паттерн, "Пошаговый", использует строгое чередование ходов с визуальными подсказками для говорения и слушания. Это идеально подходит для структурированного обучения или оценки, где желателен контролируемый, педагогический обмен, а отсутствие лица помогает сосредоточиться на взаимодействии. Важно отметить, что нет места для прерываний, что ограничивает его применение сценариями с четким чередованием ходов.ИИ-телефонные звонки имитируют реальные телефонные взаимодействия для поддержки клиентов, квалификации лидов или записи на прием. Агент действует как голосовой агент обслуживания, полагаясь на дизайн разговорной дуги и личность, передаваемую исключительно словами. Существенным ограничением является невозможность прокрутки назад, что требует подтверждения важной информации.Голосовой чат добавляет голосовой режим к текстовому чату, позволяя пользователям говорить вместо набора текста. Агент действует как универсальный голосовой помощник, отображаясь в полноэкранном голосовом режиме или встроенным в чат. Этот паттерн поддерживает мультимодальный опыт, но может ограничивать сложные выходные данные, такие как код или таблицы, которые трудно передать голосом."Голос в текст" — это чисто утилитарный инструмент, который транскрибирует устный ввод в текст без разговорного агента. Его эффективность полностью зависит от точности вывода и способности адаптироваться к контексту. Исправление голосом часто медленнее, чем набор текста, что приводит к таким решениям, как пользовательские клавиатуры для редактирования."Скриптовое видео + голос" сочетает предварительно записанное видео с голосовым вводом. Виртуальный репетитор, воспринимаемый как человек-учитель, предоставляет обратную связь на основе ввода пользователя, выбирая предварительно записанные ответы. Это создает иммерсивную среду обучения, но процесс съемки каждой ветви делает его дорогостоящим и медленным для масштабирования или обновления контента."