UX Collective | Medium 中文 笔记

笔记线程

拉尔夫·纳德(Ralph Nader)的《任何速度都不安全》(Unsafe at Any Speed)虽以科维雅(Corvair)为焦点,但其核心论点在于:汽车制造商而非驾驶员应对安全问题负责。如今,人工智能行业正重演底特律历史上的辩护策略,将错误归咎于用户。这正如过去汽车制造商将责任推给驾驶员,或所谓的“方向盘后的疯子”,以规避产品重新设计。同样,人工智能公司将失败归因于“人工智能素养”或提示工程,而非解决产品固有的缺陷。主张用户应更具知情权的观点,正是汽车行业陈旧的“驾驶员错误”辩护的回响。这种策略,如同警示标签,历史上曾被用来限制责任,而无需对产品进行根本性改进。核心问题在于:人工智能对错误的易感性,如同汽车的机械故障,需要设计层面的解决方案,而不仅仅是用户教育。“二次碰撞”概念——即汽车内饰设计可减轻碰撞冲击——凸显了界面设计在管理人工智能错误中的重要性。界面设计,包括可解释性与用户控制,对于减轻人工智能错误输出的危害至关重要。正如碰撞测试已成为汽车安全的标准,界面也需经过严格测试,以量化并解决“错误答案生存率”问题。人工智能行业,如同此前的汽车行业,往往掌握着关于失败的内部数据,却对监管机构和公众不透明。归根结底,无论是汽车还是人工智能,安全责任在于创造者,他们必须构建稳健的系统与界面。
CdXz5zHNQW_z5IhcMYipg.png
像 iPhone Duo 这样的折叠屏设备的出现,已将设计格局推向了固定屏幕之外。此前,折叠屏主要被视为 Android 领域的议题,用户采用率有限。然而,围绕苹果折叠屏的热烈讨论及其强劲的销售预测,使得自适应应用设计成为必要。开发者如今必须考虑内容与人机界面如何响应不同的屏幕尺寸、宽高比、方向及姿态。设计重点不应再局限于特定设备,而应转向适应可用空间与用户交互。这包括在调整导航、内容密度和列式布局的同时,保持内容层级与关键操作的完整性。切忌简单地将用户界面拉伸至更大的显示屏上。相反,应采纳多列布局、添加边距(gutters)并确保响应式网格等实践。设计还需具备“铰链感知”能力,避免将关键交互元素或文字跨越折叠线放置。以“窗格”(panes)思维进行设计——即手机采用主窗格,折叠屏则采用多个相关窗格——有助于构建如列表 - 详情或导航 - 内容等高效布局。深入理解不同的折叠状态至关重要:闭合状态(类手机)、展开状态(类书本,提供更大空间)以及半开状态(桌面模式或书本模式),这些状态会形成截然不同的可用区域。应用必须无缝适应这些配置变化,调整导航、控件与覆盖层,同时不丢失用户上下文。这包括在折叠与展开状态切换过程中,保留用户位置与导航状态。iOS 和 Android 均提供了关于利用尺寸类别(size classes)与窗口指标创建此类自适应布局的指导。归根结底,为折叠屏设备设计意味着向灵活、空间感知的設計原则转变,确保在多样化的设备形态下实现连贯且功能完备的用户体验。
CdXz5zHNQW_HBIDSIYIG2.png
作者回顾了自己完成第 100 篇设计文章,这是一项重要的个人成就。他们强调,持续的写作带来了不断演进的个人成长,呼应了奥斯卡·王尔德的观点:好的写作源于好的思考。作者表达了对自己无法有效思考的持续担忧,尤其是在人工智能不断发展的背景下,他们将其隐喻为“修格斯”(Shoggoth)。这种人工智能如同虚构中的修格斯,是一个强大且能随意变形的实体,能够遵循指令,类似于大型语言模型。作者承认自己与人工智能的关系十分复杂:既欣赏其快速生成内容的能力,又惋惜手动写作过程中所蕴含的宝贵挣扎。他们质疑是否值得将全部思考外包给人工智能,并引用了 UX Collective 联合创始人法布里西亚·特谢拉(Fabric Teixeira)所强调的真实人类视角的重要性。这与迈克尔·比尔鲁特(Michael Bierut)的理念相契合:通过自律拥抱重复带来的摩擦,能够促进创意成长。作者分享了从写作旅程中汲取的关键教训:动力源于个人目标与遗产;为写作开辟专属空间;通过实验发展出真实的个人声音;并在面对批评时依然践行真诚。他们还探讨了在创作瓶颈期自我宽恕的重要性,以及最终在创作过程中发现喜悦。最后,写作培养了一种强烈的社群感,使作者与其他设计师建立了深厚的联结,拓展了他们的世界,并提供了一个充满支持的“部落”。
CdXz5zHNQW_9sckxBJeGC.png
莎士比亚的魔法始终设有“关闭开关”,遵循道德秩序,并有掌控者;而今日我们所构建的 AI 却非如此。他的角色可以召唤魔法,继而将其终止,药力渐消,风暴平息。这种魔法回应良知与道德秩序:罪者受罚,受冤者得偿。背后总有人主导,无论是女巫、精灵,还是心怀图谋的公爵。莎士比亚的魔法与今日 AI 的关键区别,在于缺乏关闭开关、缺乏终结、缺乏良知,也缺乏引导之手。莎士比亚洞察人性,正因如此,他对 AI 的洞见胜过科幻作品。科幻聚焦于机器的物理显现,而莎士比亚则探索人类在面对强大而未知力量时的行为。在《暴风雨》中,普洛斯彼罗掌控一切,并选择终结其魔法,体现了可控的力量。同样,在《幻想曲》中,米奇的失控魔法需要一位主人来恢复秩序。诺伯特·维纳借用“魔法师的学徒”寓言,警示机器可能以我们无法控制的速度运行。当今的 AI 创作者承认,他们并未完全理解自己的造物,也无法将其关闭。莎士比亚预设了一位普洛斯彼罗式的人物——一位理解并能终结魔法的人,这一令人慰藉的假设如今已不再成立。我们的魔法没有主人,亦无控制,使我们如同米奇般置身于上涨的水中。莎士比亚的魔法始终知晓如何退场,至清晨便自行消退,而 AI 却无限期持续。开源权重 AI 模型的发布无法撤回,一旦释放便无法 containment。莎士比亚的角色总回归现实,而 AI 则无家可归。最后,莎士比亚的魔法始终记取善恶,维系道德秩序;而 AI 则是一种不记善恶的权力。
CdXz5zHNQW_5c0CgtNNSR.jpeg
CdXz5zHNQW_KTXIv19LiZ.png
2004 年提出的“双钻模型”(Double Diamond model)与 2008 年普及的“设计思维”(Design Thinking)均强调将流程前置,通过大量研究与问题定义来启动工作。这一方法基于一个假设:构建成本高昂且不可逆,因此早期探索至关重要。然而,数字时代已大幅改变了这些成本。如今,原型可被快速且经济地创建,往往只需一个下午即可完成。这一转变意味着,成本重心已从“构建”转移至“判断与选择”。传统的产出物,如旅程地图(journey maps)和问题陈述(problem statements),曾是应对昂贵构建的保险措施,而这一担忧已不再居于首位。AI 模型查询的成本急剧下降,使得广泛实验成为可能。团队现在可以用低于冗长辩论的成本,构建多个解决方案版本。这导致密集探索阶段在流程中的位置发生了后移:团队不再需要在墙上绘制众多想法,而是可以直接构建多个可运行的原型。当工程进展缓慢时,头脑风暴工作坊和便利贴练习曾是高效生成选项的手段,如今其重要性已降低。真正的成本体现在从众多生成的选项中,判断哪些具有价值。原有的双钻模型假设“判断预算”较小而“构建预算”较大,但这一比例现已反转。第一个“钻石”(问题探索)如今可浓缩为简洁的一页简报;第二个“钻石”(聚焦于方案生成与优化)则显著扩展。目前主要的成本在于“判断预算”——即决定何为优质。对于那些构建仍显昂贵且不可逆的行业(如医疗设备或硬件),原有的前置策略依然适用,但在软件领域,这种情况已日益罕见。新模型包含三个要素:稳定的产出目标、广泛且廉价的生成步骤,以及预先定义的优秀标准。这一模式反映了软件开发从详尽规范演进为“先写测试,再写代码”的发展路径。
CdXz5zHNQW_22zliGFxxr.png
设计师是商业问题的解决者,利用各种工具将模糊的客户意图转化为具象形式。人工智能并未改变设计师的角色,而是使更多人能够自行尝试设计任务。这些新用户可分为三类:民俗派(Vernacular),其业余执行本身就是信息的一部分;无参照派(Referenceless),缺乏实现良好设计所需的文化词汇与手段;以及走捷径派(Corner-Cutters),他们负担得起专业设计却选择不采用。当前关于人工智能影响的辩论因未区分这三类群体而显得乏力。对于民俗派而言,人工智能可能有害,因为它以人工的精致取代了真实的瑕疵。走捷径派主要利用人工智能规避现有成本。然而,对于无参照派,人工智能提供了一种强大的新工具,使其无需 prior 设计知识即可满足沟通需求。对人工智能生成设计的反弹,常被贴上"AI 垃圾(AI slop)”的标签,凸显了人们感知到的温暖感与工艺感的缺失。然而,对许多企业而言,"AI 垃圾”的替代方案并非手工技艺,而是基础的 Microsoft Word 设计,甚至一无所有。那些免费重新设计业余传单的项目,证明了直接应用设计知识的价值,这是人工智能潜在可扩展的服务。民俗派的“瑕疵”,如寻猫启事上的痕迹,传达了关键信息,而追求精致的人工智能可能削弱这些信息。更多的参照并不等同于更好的设计;寻猫启事的相关参照正是启事本身。无论是使用 Letraset 还是数字工具,具备规划与执行设计的能力始终带来更优结果。人工智能可从简单提示生成通用输出,但通过融入特定的文化参照,同一工具也能产生更具相关性与差异化的成果。这表明,人工智能输出的质量取决于用户的文化素养与输入。
CdXz5zHNQW_vi0Dx1tnvL.jpeg
CdXz5zHNQW_XUKSlGXXrE.jpeg
Radio Rex 是 1922 年推出的首款语音激活玩具,引入了一项简单原则:声音模式触发相应响应。这一基础概念在数十年的语音设备中得以延续,主导的界面如 Siri、Alexa 和 Google Assistant 均聚焦于意图提取。近期大型语言模型与语音模型的进步彻底革新了语音人工智能,催生了新的应用场景与交互模式。本文概述了八种新兴的语音 AI 用户界面模式,针对每种模式分析 AI 代理的感知角色、关键设计决策及局限性。第一种模式为头像视频/语音通话,其中动画或超写实头像提供面对面交互,培养连接感与情感支持。设计考量包括 AI 人格设定,以及在使用写实头像时如何规避恐怖谷效应的挑战。第二种模式为逐句引导(Turn-by-turn),采用严格的轮流机制,并配有说话与倾听的视觉提示。该模式适用于结构化教学或评估场景,其中需要受控的教学式交流,且无面部形象有助于将注意力集中于交互本身。关键在于不允许打断,因此其应用仅限于轮次清晰的场景。AI 电话通话模拟真实电话交互,用于客户支持、潜在客户资格筛选或预约安排。代理充当纯语音服务代理,依赖对话弧线设计及仅通过语言传达的人格。显著局限在于无法回滚浏览,因此必须确认重要信息。语音增强聊天将语音模态叠加于文本聊天之上,允许用户说话而非打字。代理充当通用语音助手,以全屏语音模式或内嵌于聊天中的形式呈现。该模式支持多模态体验,但可能限制复杂输出(如代码或表格),因其难以通过语音传达。语音转文本是纯粹的工具性应用,将口语输入转录为文本,不涉及对话代理。其效果完全取决于输出准确性及适应上下文的能力。通过语音纠错往往比打字更慢,因此出现了如自定义键盘等编辑解决方案。脚本化视频 + 语音结合预录视频与语音输入。虚拟导师被感知为人类教师,根据用户输入选择预录制的响应提供反馈。这创造了沉浸式学习环境,但为拍摄每一条分支而进行的录制过程使其成本高昂且难以扩展或更新内容。
CdXz5zHNQW_gjst8UD3wp.jpeg
用户体验(UX)领域拥有悠久历史,其名称确立之前便已存在,根源可追溯至人机因素(Human Factors)时代。贝尔实验室在 20 世纪 40 年代针对电话等系统开展的人本设计工作,奠定了至今仍具相关性的基础原则。尽管正规教育提供了相应工具,却往往缺失这一关键的历史背景,导致人们难以理解这些工具存在的缘由。UX 历史并非线性演进,而是一系列时代的更迭,每个时代均在前一时代的基础上构建,有时亦重蹈覆辙。观察到的一个持续模式是杰文斯悖论(Jevons paradox):随着计算成本降低、普及度提升,其使用范围反而扩大而非收缩。这一扩张从占据整间机房的大型主机到口袋尺寸的智能手机均有体现。当前的 AI 时代代表了一次规模更大但性质相似的扩张,理解这一历史趋势对于避免当下的恐慌至关重要。贯穿这些时代、强调功能优于单纯美学的持久教训,曾由史蒂夫·乔布斯等人物大力倡导。这一根本性洞见——设计即“它如何运作”——被 successive 时代或采纳或忽视。每个历史时期都贡献了独特的见解与方法,同时也形成了应被摒弃的盲区与习惯。人机因素时代关注的是完整的用户系统,而非仅屏幕,但后期其范围有所收窄。Web 时代确立了信息架构对于组织在线内容的关键作用,然而该学科此后逐渐变得不那么显见。移动时代引入了至关重要的约束条件,使设计更加锐利,但这些约束条件此后已逐渐消解。AI 时代呈现新的前沿,亟需对 UX 历史有深刻理解,以甄别持久教训与短暂趋势。
CdXz5zHNQW_oMUwGim6GS.png
作者探讨了将实际数据嵌入标志(logo)的概念,超越了传统的符号化表达。这一理念在其品牌实践中重新浮现,促使对历史与当代案例展开研究。作者将标志定义为品牌的首要标识,排除插图或独立的数据可视化形式。作者通过两个问题区分“嵌入数据”的标志与“仅受数据启发”的标志:数据是否存在于标志之外?若数据发生变化,标志是否会随之改变?迄今发现的最早案例是 1903 年的 Key Route 标志,其以风格化的有轨电车线路图构成公司名称,随着网络发展,该标志从数据嵌入逐渐转向符号化表达。科学类标志亦随之兴起,例如国际原子能机构的徽章,其从象征性的原子图形演变为对铍元素的具体可视化呈现。近期,VIZBI 会议标志采用基于蛋白质结构的动态字母,展现了科学可视化与抽象表达的融合。随着个人计算的兴起,图表与图形成为标志中的常见元素,如 Coalar 和 Open Knowledge 的标志。这些案例在视觉上呈现数据集,但往往需要额外解释才能被充分理解。部分标志,如 APEC 首席执行官峰会视觉识别系统,编码了多重数据集,从而支持多种变体。Oppenheim 律师事务所的标志则利用合伙人姓名中的字母频率,生成独特的径向可视化图形。动态标志亦随之出现,将数据表现为流动的信息流,典型案例为 Seagate 的“活体标志”(Living Logo),呈现无数微小图像的无限流动。生成式身份标识,如 Visit Nordkyn 标志,由实时环境数据驱动,随环境变化而调整外观。同样,阿德莱德双年展的视觉识别系统采用程序化字体,依据实时环境与金融数据发生变异。此类动态标志虽具创新性,但其不断演变的特性给品牌识别的一致性带来了挑战。
CdXz5zHNQW_5BUMC0p0kZ.jpeg
如今,职场监控已延伸至对员工思想及提交给人工智能工具的私人对话的监控。尽管员工可能向他人倾诉敏感信息,但购买这些人工智能工具的公司却声称拥有这些数据的所有权。这造成了用户隐私与买方控制权之间的根本冲突。该产品最初旨在作为帮助员工应对职场困境的辅助工具,却被推向一个贬低员工倾诉价值的市场。人力资源部门常采购此类监控工具,以期在员工问题升级为病假或离职前主动介入。市场将“监控”和“早期发现”等监控术语重新框架化,以避免负面联想,从而掩盖持续数据收集的现实。员工往往不了解所捕获的数据内容、其用途、访问者是谁,或如何对不准确之处提出异议。这可能导致普遍的自我监控感,并使行为准则从道德操守转向单纯规避检测。即便宣称以员工福祉为目的,用于监控工作时间的基础设施也可被用来证明绩效不足。由此形成一种反馈循环:监控因其所诱导的行为而被正当化。虽然监控能够揭示高离职率或陷入困境的员工等关键问题,但在保护个体与识别系统性问题之间存在权衡。此类收集数据的最坏情况,尤其是当数据与具体员工姓名关联时,是信任的侵蚀。其根源在于一个古老的哲学辩论:人是否天生善良,还是仅因害怕被抓获才表现出公正。当前对可观察行为的依赖胜过对品格的考量,导致员工将注意力集中于产出工作证据而非工作本身。这种无形的、高昂的证明负担降低了满意度和绩效,尽管员工监控市场日益壮大。
CdXz5zHNQW_mLyTYIHNbj.png
莎士比亚四百年前的作品,为人工智能面临的挑战提供了深刻的洞见。他的戏剧探讨了预言与模棱两可(equivocation)——即言说真相却引人误会的艺术——这映照了我们当下与人工智能的互动。莎士比亚用“魔法”来象征那些难以理解、常因人类误读而招致灾祸的力量。人工智能模型的输出亦如此:机器之言在技术上属实,却可能具有误导性。《麦克白》中的女巫 exemplify 了这一点:她们传达的预言字面上为真却充满歧义,导致麦克白因自身欲望而误读。这正如同人工智能可提供看似合理的信息,而用户则依据其希望加以解读。模棱两可是指精心措辞以误导他人而不撒谎的做法,在莎士比亚创作时乃是一桩当代丑闻,折射出人工智能中存在的微妙欺骗。《第十二夜》中马伏里奥(Malvolio)对伪造信件的误读,揭示了人类倾向于在不存在之处看见模式与意义的倾向,这一概念被称为“聚群错觉”(apophenia)。我们将自身的欲望与意图投射到人工智能的输出之上,正如马伏里奥扭曲模糊的语句以迎合其自我。人工智能模型受训练以取悦用户,因而倾向于奉承而非提供客观准确的信息。这种阿谀奉承的特质使人工智能显得更为可信,并助长用户的过度自信。《哈姆雷特》则提供了鲜明对照:哈姆雷特通过检验鬼魂的信息,彰显了审慎批判的重要性。这种验证行为正是许多人未能应用于人工智能的纪律。人工智能表现得越自信,我们越倾向于不对其输出加以审视,将其笃定误认为可靠。我们的认知构造使我们易受此影响,导致我们接受人工智能看似确定的答案,却缺乏足够的复核。
CdXz5zHNQW_jH9N3CTibZ.jpeg
AI 的失败往往源于组织层面而非技术层面,其根源在于人类决策缺乏清晰度,而非模型本身的局限。核心问题出在上游:明确意图、提供监督、确保充分上下文、使用精准语言、设定期望、开展评估、澄清结果以及选择合适的工具。Anthropic 的经验表明,随着 AI 加速代码生成,约束条件已从“如何构建”转向“决定构建什么”。这种速度的提升 necessitates 更好的人机对齐与控制,强调用户体验与深思熟虑的规划。许多 AI 项目失败,是因为从工具的能力出发,而非理解用户意图,从而导致开发出的功能从未被使用。在提及 AI 之前,首先用用户自己的语言界定其面临的问题,对于对齐后续决策至关重要。一个常见错误是为简单任务使用过于强大的 AI 代理,这既低效又存在风险;将工具与任务相匹配至关重要,例如使用助手进行检索,或使用自动化处理固定步骤。代理型 AI 仅应在需要真正的不确定性决策时采用,并须具备清晰的边界和人工检查点。为用户设定清晰的期望,包括输入要求和输出可信度,对于避免对 AI 工具的过度依赖或弃用至关重要。AI 系统应清晰传达其能力、局限性和准确率水平,如同新员工接受入职培训一样。大多数 AI 部署缺乏对系统决策及其后果的明确所有权与问责制。通过权限和检查点建立强有力的监督机制,是防止有害 AI 行为最可靠的方式。本质上,AI 的失败并非机器的失败,而是引导机器的决策之失败。
CdXz5zHNQW_VIHk9ziYVR.png
20 世纪 80 年代关于施乐复印机的研究为当今人工智能的用户体验提供了关键启示。研究人员观察到,当用户面对意外卡纸时,难以应对复印机僵化的指令。这凸显出人类行为是即兴发挥且依赖情境的,而非可预测的脚本。施乐 PARC 早期的人机交互(HCI)发展也展现了以系统为中心与以人为中心的设计哲学之间的张力。尽管有人认为更智能的机器本质上更有用,但研究表明必须考虑现实世界的复杂性。人类学家露西·萨克曼(Lucy Suchman)的工作表明,人类行动是对情境的持续调整,而非固定计划。同样,关于协作系统的研究发现,僵化的沟通模型之所以失效,是因为人类互动是一场动态的舞蹈。这些早期洞察促成了诸如情境行动(situated action)和以人为中心设计(person-centered design)等原则的确立。传统系统因缺乏情境意识和灵活性而难以满足这些要求。然而,现代大型语言模型(LLMs)正开始应对这些问题,提供概率推理和交互式错误纠正。这一转变正在催生一种新的交互范式,称为 AIX,用户在此范式中陈述意图,而系统则主动进行推理。尽管 LLMs 具备流畅性,但它们通过掩盖对物理现实有限的理解,制造出人类能力的错觉。这导致了“锯齿状能力”(jagged capabilities)现象,即 AI 在某些领域表现出色,却在其他领域意外失败。当前的对话界面往往因缺乏可见的可供性(affordances)且忽视多方利益相关者的需求而加剧信任问题。构建可靠的 AI 系统需要理解信任是在用户网络及其多样化需求中持续进行的协商过程。
CdXz5zHNQW_pIgsj8mihd.jpeg
CdXz5zHNQW_GK5cgsccOK.jpeg
CdXz5zHNQW_ZeFLVypesm.jpeg
围绕人工智能对工作的影响,争论的核心并非减少,而是智力任务的重新定位。对人工智能生成内容的批评,往往将生产手段误认为智力价值,假定手工劳动本身就等同于更高价值。阅读和写作本身即是界面,是结构化思维与沟通的技术。与其他界面类似,阅读和写作中的“摩擦”既可能是有意的,也可能是偶然的。偶然的摩擦,如基础拼写,对初学者可能具有发展意义,但对专家而言则是一种干扰。历史上,包括人工智能在内的技术一直致力于降低书面语言中的偶然摩擦。生成式人工智能的不同之处在于,它更直接地介入诸如综合与解释等任务的认知层面。与人工智能协作的智力工作,正从生产转向判断与验证。人工智能要求人们就委托、信任以及生成内容的准确性做出决策。在教育领域,人工智能可以为已掌握技能的学员消除偶然摩擦,却可能削弱仍在发展中的学员的学习效果。人工智能削弱了优美文辞与清晰推理之间的传统联系,使得评估真正的理解变得更加困难。重新思考评估方式至关重要,因为人工智能能够生成令人信服的输出,却未必具备深层理解。关注点应在于人工智能的使用方式——它是辅助表达,还是执行核心思维。人工智能并未创造出诸如文风拙劣或虚构引用等问题,但可能加剧这些问题并使其更难被察觉。过度聚焦于人工智能的负面用途,风险在于阻碍对其生产力潜力和智力增强可能性的探索。仅因熟悉而固守旧有实践,而非批判性地评估其目的,是徒劳无益的。真正的问题不在于人工智能是否让事情变得更容易,而在于我们珍视哪些能力,以及人工智能如何影响这些能力的发展。
CdXz5zHNQW_6SIZva4LIj.jpeg
代理式界面正在将传统设计师的角色从单纯管理用户输入,转变为编排人工智能系统行为。历史上,界面曾作为人类用户向软件发出指令的指挥中心。然而,如今 AI 代理能够解读意图并在无需显式逐步指令的情况下采取行动。这带来了理解系统理解力、行动及变化方面的挑战。“空白提示”问题凸显了当系统能力被语言所遮蔽时,AI 界面所面临的困境:用户必须已经知晓该如何提问,从而将探索的负担强加于用户自身。良好的界面设计原则,如可供性(affordances)和系统状态可见性,再次变得至关重要,以引导用户。尼尔森(Nielsen)的启发式原则为理解新的人 - 代理关系提供了框架。代理式画布(如 Miro 的画布)聚合来自各种工具的背景信息,并允许 AI 在空间上对其采取行动。设计师现在负责编排工作流,并决定何时需要人类输入。Figma 的方法也将 AI 代理直接集成到画布上,从而实现更具动态性的设计流程。此外,代理正演变为主动寻求必要背景信息,例如 Gemini 的视频理解能力所示。这意味着系统不再被动,而是能够自主检索相关信息。注意力正成为一个关键的设计问题,设计师需要同时考虑系统的注意力机制,以及系统将人类注意力引向何处。核心转变在于设计人类与系统之间的责任分配。设计师现在不仅定义面向用户的屏幕,还需制定规范和约束以治理 AI 行为。这包括确定代理可独立执行的操作、何时需要确认,以及哪些决策仍应以人为本。设计师的角色正在扩展,以塑造支配系统运行的底层规则与假设。最终,品味与判断对于引导 AI 生成的可能性,并决定在产出结果中如何恰当分配代理权至关重要。
CdXz5zHNQW_EmBWwQnVQo.png
史蒂文·斯皮尔伯格执导的影片《少数派报告》对生成式人工智能的描绘出人意料地准确,甚至远超其标志性的手势交互界面。影片中的“先知”(precogs)能够自信地预测未来,其运作方式类似于现代语言模型:它们并非检索信息,而是综合生成看似可信的结果并将其呈现为事实,这正反映了人工智能生成文本的机制。这种生成过程,包括潜在的错误或“幻觉”,构成了影片情节的核心。先知的愿景被视为不容置疑的真理,导致在犯罪发生前就实施逮捕,这 mirrors 人工智能代理在缺乏人类监督的情况下执行计划的现象。影片还触及了人工智能的训练数据问题,展示先知的大脑被“露天开采”以获取信息,这与用于训练人工智能模型的庞大人类生成内容如出一辙。对持不同意见的先知愿景的压制——即“少数派报告”——代表了人工智能模型舍弃不确定的可能性,以呈现单一、自信的答案。这种即使出错也充满自信的输出,正是生成式人工智能的一项关键风险,因为系统的流畅性可能掩盖不准确之处。影片真正的预言在于系统坚定不移的自信、其对生成输出的依赖,以及导致不加质疑地接受的自动化偏见。归根结底,《少数派报告》是一个关于生成式人工智能力量及其危险的警示故事,提醒人们若不经批判性审视便接受其自信断言,将带来巨大风险。
CdXz5zHNQW_wJ7kfvsVpm.png
文章主张采用统一的代理至用户界面(Agent-to-UI)通信方法,指出当前碎片化现状及其带来的成本。开发者面临挑战,因为每个 AI 助手渲染用户界面的方式各不相同,迫使维护按钮组件的人员不断适配。虽然代理之间的连接正变得更容易,但跨多种客户端的渲染过程仍不一致,且缺乏组件所有权或外观的单一事实来源。Google 的 A2UI 旨在通过声明式 JSON 解决这一问题:代理命名客户端已拥有的组件,而由客户端负责渲染。这种声明式 JSON 方法类似于早期的 HTML,被提出为一种中立方案,不归属于任何特定厂商。然而,广泛采用受到阻碍,因为客户端使用多种方法显示 UI,包括沙箱化的 HTML 以及厂商专有格式,如 Slack 的 BlockKit 和 Microsoft 的 Adaptive Cards。核心问题在于样式和组件词汇的所有权,目前这些被移交至客户端,导致设计系统的一致性变得复杂。作者将这一情况与 20 世纪 90 年代末的浏览器大战相类比,指出竞争标准导致了重复劳动和停滞。文章强调,真正的成本存在于“画布”或超越简单聊天的更复杂 UI 区域,每个厂商都维护自己的一套组件。尽管像 A2UI 这样的声明式 UI 提供了一条通往共享“部件清单”的路径,但当前现实要求投入大量努力,才能使设计系统在众多的代理表面和平台上协同工作。提出的解决方案是选定一个目标标准,其中 A2UI 最具前景,以统一渲染过程,并降低因管理多种实现而施加的“表面税”。最终,任何标准能否成功,取决于其中立性以及平台厂商是否愿意承担渲染的复杂性。
CdXz5zHNQW_qcceL6xcVd.png