8个音色AIUX模式
Radio Rex 是 1922 年推出的首款语音激活玩具,引入了一项简单原则:声音模式触发相应响应。这一基础概念在数十年的语音设备中得以延续,主导的界面如 Siri、Alexa 和 Google Assistant 均聚焦于意图提取。近期大型语言模型与语音模型的进步彻底革新了语音人工智能,催生了新的应用场景与交互模式。本文概述了八种新兴的语音 AI 用户界面模式,针对每种模式分析 AI 代理的感知角色、关键设计决策及局限性。第一种模式为头像视频/语音通话,其中动画或超写实头像提供面对面交互,培养连接感与情感支持。设计考量包括 AI 人格设定,以及在使用写实头像时如何规避恐怖谷效应的挑战。第二种模式为逐句引导(Turn-by-turn),采用严格的轮流机制,并配有说话与倾听的视觉提示。该模式适用于结构化教学或评估场景,其中需要受控的教学式交流,且无面部形象有助于将注意力集中于交互本身。关键在于不允许打断,因此其应用仅限于轮次清晰的场景。AI 电话通话模拟真实电话交互,用于客户支持、潜在客户资格筛选或预约安排。代理充当纯语音服务代理,依赖对话弧线设计及仅通过语言传达的人格。显著局限在于无法回滚浏览,因此必须确认重要信息。语音增强聊天将语音模态叠加于文本聊天之上,允许用户说话而非打字。代理充当通用语音助手,以全屏语音模式或内嵌于聊天中的形式呈现。该模式支持多模态体验,但可能限制复杂输出(如代码或表格),因其难以通过语音传达。语音转文本是纯粹的工具性应用,将口语输入转录为文本,不涉及对话代理。其效果完全取决于输出准确性及适应上下文的能力。通过语音纠错往往比打字更慢,因此出现了如自定义键盘等编辑解决方案。脚本化视频 + 语音结合预录视频与语音输入。虚拟导师被感知为人类教师,根据用户输入选择预录制的响应提供反馈。这创造了沉浸式学习环境,但为拍摄每一条分支而进行的录制过程使其成本高昂且难以扩展或更新内容。