8음성 AIUX 패턴
1922년 최초의 음성 활성화 장난감인 Radio Rex는 소리 패턴이 반응을 유발하는 간단한 원리를 도입했습니다. 이 기본적인 개념은 수십 년 동안 음성 지원 장치에서 지속되었으며, Siri, Alexa, Google Assistant와 같은 지배적인 인터페이스는 의도 추출에 중점을 두었습니다. 대규모 언어 모델과 음성 모델의 최근 발전은 음성 AI에 혁명을 일으켜 새로운 사용 사례와 상호 작용 패턴을 가능하게 했습니다.이 글은 8가지 신흥 음성 AI UI 패턴을 개괄하고, 각 패턴에 대한 AI 에이전트의 인식된 역할, 주요 디자인 결정 및 한계를 분석합니다. 첫 번째 패턴은 Avatar video/voice call로, 애니메이션 또는 초현실적인 아바타가 얼굴을 맞대고 상호 작용을 제공하여 연결감과 정서적 지원을 조성합니다. 디자인 고려 사항에는 AI 성격과 사실적인 아바타로 불쾌한 골짜기를 탐색하는 과제가 포함됩니다.두 번째 패턴인 Turn-by-turn은 말하기와 듣기에 대한 시각적 신호를 사용하여 엄격한 차례 바꾸기를 사용합니다. 이는 통제된 교육적 교환이 바람직하고 얼굴이 없다는 것이 상호 작용에 집중하는 데 도움이 되는 구조화된 튜터링 또는 평가에 이상적입니다. 결정적으로, 방해의 여지가 없어 명확한 차례 시나리오로의 적용이 제한됩니다.AI 전화 통화는 고객 지원, 리드 자격 또는 약속 예약을 위해 실제 전화 상호 작용을 모방합니다. 에이전트는 음성 전용 서비스 에이전트 역할을 하며, 대화 흐름 설계와 단어를 통해서만 전달되는 성격에 의존합니다. 중요한 한계는 스크롤할 수 없다는 것으로, 중요한 정보의 확인을 필요로 합니다.Voice-augmented chat는 텍스트 채팅에 음성 모달리티를 계층화하여 사용자가 입력하는 대신 말할 수 있도록 합니다. 에이전트는 전체 화면 음성 모드 또는 채팅 내 인라인으로 나타나는 범용 음성 비서 역할을 합니다. 이 패턴은 멀티모달 경험을 지원하지만 음성으로 전달하기 어려운 코드 또는 테이블과 같은 복잡한 출력을 제한할 수 있습니다.Voice to text는 대화형 에이전트 없이 음성 입력을 텍스트로 전사하는 순전히 실용적인 도구입니다. 효과는 전적으로 출력 정확도와 맥락에 적응하는 능력에 달려 있습니다. 음성으로 수정하는 것은 종종 타이핑보다 느리므로 편집을 위한 사용자 지정 키보드와 같은 솔루션으로 이어집니다.Scripted video + voice는 사전 녹화된 비디오와 음성 입력을 결합합니다. 인간 교사로 인식되는 가상 튜터는 사전 촬영된 응답을 선택하여 사용자 입력에 따라 피드백을 제공합니다. 이는 몰입형 학습 환경을 조성하지만, 모든 분기를 촬영하는 과정은 콘텐츠를 확장하거나 업데이트하는 데 비용이 많이 들고 느립니다.