VentureBeat 中文 笔记

VentureBeat 中文

VentureBeat是一个备受尊敬的技术新闻和分析网站,专注于报道创新和不断变化的技术、科学和未来的工作世界。该网站提供了准确的报道、深入的市场分析和对新兴技术中机遇和挑战的深入评论。它涵盖了广泛的主题,包括人工智能、机器人、区块链、游戏等。其报道内容包括突发新闻、特写故事和客座投稿,为读者提供了多样化的内容。

笔记线程

Meta 发布了 Muse Spark 1.3,这是一款新的人工智能模型,相较于其前代版本,在速度和性能方面均有提升。首席执行官马克·扎克伯格将这一版本定位为 Meta 在编码和代理任务(agentic tasks)方面最重大的进展。该可部署版本虽然能力强劲,但在独立基准测试中并未领先,却提供了出色的性价比。更强大的“最大推理”(max reasoning)配置正在接受安全测试,稍后将发布。当前可用的 Muse Spark 1.3 采用此前已确立的推理设置,因此其在现实世界中的企业级成本与性能成为关键考量因素。Meta 的发布材料重点突出了 max 变体,该变体在评估中取得了更高的基准分数。然而,实际交付的 xhigh 版本也具有竞争力,在某些智能指标上与领先模型持平。Muse Spark 1.3 代表了实质性进步,在编码和代理任务的评估中与顶级模型展开竞争。该模型还增强了操作能力,在编码任务中减少了工具调用和 token 消耗。尽管有“便宜到无法计量”的说法,但 Muse Spark 1.3 的 API 定价并未降低。独立分析表明,尽管 token 费率保持不变,但由于输入 token 消耗增加,每任务成本反而上升。Meta 同时也为训练数据使用保留了低成本的“贡献者”(Contributor)层级。此次发布将 Muse Spark 1.3 置于与 Google Gemini 3.8 Flash 的竞争性位置,Meta 在智能水平和任务成本方面略占优势。然而,Google 在吞吐量方面领先,并提供更低的入门级 API 价格。该公司对开放权重模型立场的演变,以及围绕开放权重 Spark 版本发布的模糊性,可能是开发者关注的重大因素。Muse Spark 1.3 展示了 Meta 在专有模型上的快速迭代,但其最佳能力的清晰可部署路线图以及开放权重版本的发布计划,仍备受期待。
CdXz5zHNQW_77CxoerDdo.png
CdXz5zHNQW_O8uOJCHDf7.png
CdXz5zHNQW_q5QrxQkRrB.png
企业买家正越来越多地考虑非英伟达 AI 加速器,近 40% 的买家预计在未来一年内将评估 AWS Trainium 或 Google TPU 等替代方案,而针对英伟达下一代 Blackwell 的评估比例约为 25%。尽管英伟达在生产环境中仍占主导地位,但组织正在构建战略灵活性并优化现有基础设施。切换 AI 平台的紧迫感有所下降,企业更专注于提升当前运营能力。Microsoft Azure 在生产环境中的采用率显著增长,Google Gemini 和 OpenAI 紧随其后。企业正更高效地利用自有 GPU,运行在 50% 或更低负载的情况减少。可靠性与可用性已成为衡量基础设施效能的首要指标,同时实施便捷性也在提升。从立即更换平台转向当前策略,是出于对每 token 性能与成本效率的追求,而非单纯关注总体拥有成本。对英伟达替代方案的兴趣在决策者和中型企业中尤为强烈。企业还优先掌控其 AI“ harness"(即连接模型与企业数据及工具的一层),这表明其倾向于在单一模型提供商之外保持架构控制权。Neoclouds(专用 AI 云提供商)作为多提供商战略中的可信组成部分正获得关注,并报告了显著的营收积压。开源 AI 基础设施的使用正在增长,特别是在生产栈中,表明在特定市场细分中出现了更深层次的采用。这一整体趋势显示,企业在运行更多 AI 基础设施的同时,正积极维护多种战略选项。
CdXz5zHNQW_XD7BB0LMqj.png
大型语言模型(LLMs)经常产生事实性错误的幻觉。开发者传统上通过假设模型存在知识缺失,并增大模型规模或数据量来解决这一问题。然而,新研究表明,LLMs 往往已经掌握了相关事实,只是在生成过程中无法成功回忆。前沿模型编码了大量事实,表明回忆能力是主要瓶颈。该研究提出了“知识画像”(knowledge profiling)方法,以区分已编码事实和已知事实。编码意味着模型在特定条件下能够复现事实,而已知则意味着模型能够以各种表述方式可靠地回答相关问题。编码失败需要预训练阶段的干预,而回忆失败则受益于后训练技术。一个事实可能直接被回忆、编码失败、出现回忆失败、通过思考后被回忆,或在无需编码的情况下被推断。对众多 LLM 的实验表明,前沿模型虽然编码了大部分事实,但在直接回忆方面存在困难。推理时的思考过程(如思维链 Chain-of-Thought)能显著辅助回忆,类似于人类的记忆检索。单纯扩大模型规模并不能解决回忆问题,甚至可能因增加无法访问的已编码事实而加剧该问题。回忆能力深受查询表述和上下文的影响,罕见事实或反向事实带来的回忆挑战更大。开发者应避免将所有事实错误一概视为检索问题,而应专注于提升回忆能力。选择性使用推理时的思考机制以及“生成 - 验证”(generate-then-verify)流程,可以增强事实准确性。测试超越标准准确率指标的语义访问能力,能够揭示模型的真实知识。查询改写和重试也是有效手段。尽管 WikiProfile 基准主要关注百科全书类事实,但其方法论可应用于特定领域数据,尽管在专业领域中编码问题可能更为突出。这项研究将焦点转向后训练和推理时的优化,使提升 AI 事实准确性变得更加可行。
CdXz5zHNQW_dscHgi3Puz.jpeg
Egiziago Cioffi 是一位 IT 架构师,他在利用 Azure OpenAI 构建的一个 AI 代理中发现了一个关键的安全漏洞。该代理成功通过了所有评估,展现出事实准确性和任务完成能力。然而,当使用低权限账户进行测试时,该代理检索到了用户本不应有权访问的信息。这揭示出该代理使用的是索引作业的更广泛权限,而非请求用户的授权范围。此类失败——即代理使用索引器权限而非用户权限——并非孤立现象。虽然 Azure AI Search 已引入原生的文档级访问控制(ACL)修剪功能,但该功能并未在所有部署路径中普遍实施或完全可用。自定义管道(如 Cioffi 所使用的)通常会绕过这些原生安全特性。此外,独立研究表明,相当比例的成功针对生产力代理的攻击会导致静默数据外泄,突显出一类更广泛的安全漏洞。这些安全差距往往被标准评估所遗漏,因为标准评估侧重于答案质量,而非数据检索所使用的权限。当正确配置 Entra 支持的主体和 SharePoint 索引器时,原生的 Azure AI Search ACL 修剪功能可以强制执行这些边界,但 Cioffi 的自定义管道规避了这一点。核心问题在于访问控制失效,授权边界坍塌至具备搜索能力的最低特权级别。Cioffi 通过集成一个查询路径过滤器实施了修复,该过滤器在数据发送至模型之前检查请求用户的 SharePoint 权限。这确保了用户无法直接在 SharePoint 中访问的内容不会包含在代理的上下文窗口中。虽然此举缩小了可访问内容的范围,但该助手仍继续自动处理约 60% 的入站电子邮件。增强安全性的代价是,若必要内容被权限过滤器阻止,可能导致回答问题能力下降。身份治理平台负责管理服务账户的生命周期和凭据,其运作层级不同于检索权限边界。这两层控制对于全面的 AI 代理安全均至关重要。一项涉及两个账户(一个高权限、一个低权限)的简单测试,可在三十分钟内暴露检索权限边界执行问题。该测试通过将输出与直接系统访问结果进行比较,可揭示助手是否错误地返回了超出用户授予权限范围的数据。
CdXz5zHNQW_IvQGdWYBCM.png
CdXz5zHNQW_APUFISDfGl.png
当前的 workforce 规划呈现碎片化状态,人力资源、财务和采购部门各自为政。这种隔离阻碍了组织理解 workforce 决策如何影响业务成果。独立的系统和规划节奏导致盲区,使高管无法回答关于 workforce 与业务绩效整合的关键问题。现代 workforce 的复杂性,包括员工、承包商和人工智能,往往在传统规划模型中得不到体现。关于自动化或技能重塑的决策经常孤立做出,导致不可预见的后果。首席财务官(CFO)和首席人力资源官(CHRO)越来越多地被要求就 workforce 支出和工作设计开展协作。这一必要性推动他们超越传统角色,需要共同视角以应对复杂的 workforce 挑战。有效的协作将 workforce 规划从周期性的预算演练转变为持续的战略讨论。在此领域表现卓越的组织将 workforce 规划视为持续性的运营纪律,而非年度事件。他们整合人力资源、财务和采购的数据,以获取 workforce 能力、技能和成本的统一视图。这种全面视图支持更优的情景建模,将招聘、技能重塑、自动化和外部劳动力联系起来。演进的指标现已包括技能就绪度以及人类与智能系统之间的工作分配。虽然技术可以连接数据,但更大的挑战在于领导层的一致性。CFO 和 CHRO 必须就共享指标和规划节奏达成一致,将 workforce 战略与业务目标相链接。最终,那些实现领导层对齐并拥抱持续 workforce 引导的组织,将获得更清晰的增值图景,并在加速变化的商业环境中做出更明智的决策。
CdXz5zHNQW_Tt2iAeyUqG.png
企业 AI 安全需求必须超越仅针对身份和权限的管理,以规范代理(agent)的执行。传统访问控制是为人类设计的,不足以应对以机器速度运行的自主代理。若不对代理的行为进行管理,其合法访问权限可能迅速转化为危险。随着 AI 模型绕过其预设边界并访问未授权数据,威胁格局日益严峻。当代理被赋予复杂工作流的广泛权限时,造成损害的可能性显著增加。访问权限应是动态的,仅在特定任务需要时授予。保障 AI 代理安全的关键在于治理其具体行为,而不仅仅是访问权利。代理可能拥有对某文件夹的访问权限,但不应被允许对其内容执行破坏性操作。仅靠提示词(prompts)无法可靠地控制行为,必须在工具调用和内容交互层面实施控制。遗留内容平台缺乏 AI 安全所需的元数据和详细日志记录。这些系统并非为 AI 代理设计,由此产生的盲区放大了风险。归根结底,每个代理操作都涉及内容,因此内容层面的可见性至关重要。Box 将 AI 操作划分为三个层级:完全自主、受监控以及高风险需人工审批。这种分层方法使组织能够根据其风险承受能力定制安全策略。嵌入平台内的控制措施(如数据分类)优于持续的人工检查点。建立对 AI 代理的信任依赖于观察其行为随时间的演变,而不仅仅是初始权限。组织需要明确的代理管理原则,包括范围受限的身份、回滚策略和审批层级。提供安全的实验路径至关重要,以防止团队绕过安全控制。传统监控工具难以检测可疑的代理行为,因为这与人类活动存在差异。有效的代理治理需要对其实际行为(而不仅是访问权限)具备可见性,且这种可见性必须与内容管理集成。
CdXz5zHNQW_aYhk9QAGTR.png
部署 AI 代理时的一个常见错误是优先实施网关安全,而忽视基础的身份与归因层。网关往往被率先部署,却缺乏关于代理行为及授权范围的必要上下文,从而导致漏洞;例如,某 AI 网关中的一项关键缺陷便允许了命令执行。真正的代理安全需要分层方法,其中身份与归因必须先行于网关策略的强制执行。这种失效模式源于在建立上游依赖项(如身份与上下文)之前便实施控制措施。例如,网关可能验证了用户令牌,却无法识别代理的具体受限功能或不可信来源。因此,有效的凭证与允许的 API 调用仍可能导致不当操作。仅将代理的权限限制至人类主体级别,并不能形成独立的归因。依赖门控部署模型提出一个六阶段流程,始于代理资产清单与责任归属。随后依次为:独立的代理身份、任务范围凭证、可归因遥测、运行时行为强制、行为基线及终止路径。构建代理注册表对于识别与治理这些资产至关重要。代理必须具备独立身份,区别于开发者令牌或共享服务账户,且该身份需包含授权上下文。应在行为检查之前缩小能力范围,采用有时限和任务限制的可访问性。归因必须在自动化强制实施之前确立,确保每一次工具调用均能关联至代理、主体及任务。最后,一旦网关能够访问已注册的身份、授权上下文及遥测数据,即可有效执行策略。检测机制与终止路径应在可归因的代理活动确立之后开发。组织可从盘点生产环境中的代理并测试归因能力入手。实施这一结构化方法,可在不干扰现有系统的前提下,确保稳健的代理安全。
CdXz5zHNQW_7QWcRJbYsx.png
CdXz5zHNQW_JkMUs3930P.png
执行长周期任务(如迁移 CRM 数据)的 AI 智能体不仅需要内部记忆,还依赖运行时层(或称“驾驭层”,harness)来提供执行反馈和状态管理。传统上,开发者以逐步方式脚本化智能体行为,限制了其自主性与适应性。来自 Meta AI 和伊利诺伊大学厄巴纳 - 香槟分校的 EvoHarness-RL 引入了一个名为信念、进展与经验(Belief, Progress, and Experience, BPE)的统一工作空间,以增强智能体能力。其中,Belief 用于追踪环境状态,Progress 管理子目标,Experience 存储历史知识。智能体通过四种元操作与 BPE 交互:track(追踪)、commit(提交)、recall(回忆)和 note(记录)。该框架使智能体能够学习何时以及如何访问和更新其外部状态。EvoHarness-RL 采用监督微调以结构化数据,并结合计算成本感知的强化学习,以根据计算成本优化工具使用。在基准测试中,EvoHarness-RL 显著提升了较小 AI 模型的性能,甚至媲美更大规模的闭源模型。该框架同样使现有前沿模型受益,通过 BPE 提示时驾驭层增强其执行能力。在训练过程中,EvoHarness-RL 展现出“驾驭层退火”(harness annealing)现象,即智能体减少对常规任务中外层工具的依赖;以及“驾驭层演化”(harness evolution),即根据任务复杂度动态调整策略。环境适配器实现了与现有企业系统的无缝集成,无需对当前工具或智能体框架进行彻底重构。EvoHarness-RL 标志着从脚本化智能体行为向构建可学习更优行为的系统的转变,尤其适用于长周期且复杂的任务。
CdXz5zHNQW_vFMdHvCqG6.jpeg
代理复杂性是企业面临的一个重大挑战,源于多个代理及其 API 调用的相互关联性。这种错综复杂的交互网络形成了一个难以治理和理解的系统。增加代理数量并非线性地增加连接,而是使其呈复合增长,导致系统日益不透明。因此,负责代理的人类往往因无法追踪其操作和权限,致使 AI 程序停滞不前。当前将代理部署视为清单式检查的直觉,已不足以治理这种复杂且级联的行为。权限蔓延是一种常见失效模式,即代理在未经明确重新批准的情况下,随时间推移获得更广泛的访问权限。随着工作流涉及多个代理,所有权也被稀释,导致对失败的问责变得模糊。现有的治理基础设施难以跟上代理行为相互关联且级联的特性。为此,每个代理必须具备独特的身份、明确的范围以及一名人类赞助人。然而,仅靠代理级身份尚不足够;还需要更广泛的监督机制,以实时追踪代理行为及其下游影响。执行能力——即在行动发生前阻止违规操作的能力——同样至关重要。成功实现代理式 AI 的企业,既建立了可见性也落实了问责制,以管理不断增长的代理舰队。这种方法促进了“人机和谐”,使规模扩展与问责制能够同步增长。真正的风险不在于单个代理,而在于其在大规模部署下不可预测的交互,从而阻碍生产环境的落地。通过解决复杂性难题,自主性将转化为优势而非负担。
CdXz5zHNQW_B3lArRGLHa.png
一款名为 Ox Alpha 的神秘模型在 OpenRouter 上亮相,凭借其出色的性能和免费访问权限迅速获得关注。关于其来源的初步猜测指向美国主要人工智能实验室,引发了一场为期一周的身份与基础设施调查。该模型最终被确认为 Z.ai(一家中国公司)推出的 GLM-5.3-Flash。真正的惊喜并非其性能质量,而是它完全运行于中国芯片和基础设施之上。与美国的竞争对手相比,GLM-5.3-Flash 的价格显著更低,从而影响了人工智能采用的现有成本结构。这种成本效益正在给美国企业(如 Uber)带来压力,这些企业正面临人工智能费用快速攀升的困境。麦肯锡报告指出,组织正在寻求降低人工智能成本的同时仍能利用其优势的方法。中国模型厂商(如智谱和通义千问)的崛起是这一演变格局中的重要因素。对于独立开发者而言,中国模型已在该领域占据主导地位,对既有的美国提供商构成挑战。为应对这一局面,建议采用分层模型策略:关键任务使用高成本、高智能模型,日常任务使用中档模型,而大多数任务则采用低成本、高吞吐量的模型(如 GLM-5.3-Flash)。这一策略承认了中国开源权重模型所带来的财务优势。随着新模型的不断涌现,以更低成本实现更高智能的趋势预计将持续。组织必须仔细核算 token 用量,将人工智能支出归因于业务指标,并制定明确的 AI 预算。针对不同团队制定分层模型策略(区分高、中、低三个层级),是实现有意为之的人工智能采用的关键。未来的人工智能使用将涉及更加审慎地决定哪些任务值得投入最昂贵的模型。
Salesforce 与 Anthropic 已扩大其合作,命名为 Claudeforce,将 Salesforce 的 CRM 平台直接集成到 Anthropic 的 Claude AI 中。此次新合作为 Claude CoWork 引入了一个插件,提供 37 项预构建的销售技能,使管理 CRM 数据无需打开 Salesforce 即可完成。此举标志着企业软件可能迎来转变,AI 界面或将取代传统应用程序界面。Salesforce 首席执行官 Marc Benioff 认为,这是将顶级 AI 与 CRM 相结合,支持动态应用构建和企业级问答。该合作的基础建立在 Salesforce 的"Headless 360"API 之上,使 AI 代理能够直接访问 CRM 数据。客户对该无头(headless)方法表现出兴趣,但对普通用户而言,实现连接较为复杂。Anthropic 内部通过 Claude 使用 Salesforce 的经历,促成了简化且用户友好的插件开发。该插件允许管理员一次性连接,集中管理身份验证和权限。其架构确保 AI 尊重现有的 Salesforce 用户权限,防止未经授权的數據访问。Salesforce 主张,此次集成增强了而非削弱了其平台的价值,通过向新的、高效的界面暴露其广泛的数据和工作流。公司预计,通过减少手动任务并提供快速数据综合,销售人员的生产力将显著提升。该新型使用模式通过 Salesforce 的无头消费定价以及针对 AI 推理的独立 Anthropic 合同进行 monetization。此次合作还明确了 Salesforce 的 Agentforce(用于自主工作)与 Salesforce in Claude(面向知识工作者)之间的区别。联盟进一步深化,Claude 已成为 Slack 上的默认模型,影响各类内部工具与生产力。对于 Anthropic 而言,该交易为其带来了进入数百万用户企业工作流的重要分发渠道。现场演示展示了动态仪表板创建和针对销售人员的个性化每日行动计划,充当 AI 首席营收官。用户能够自定义界面风格,例如"迈阿密风云”主题的仪表板,凸显了由受管 Salesforce 数据驱动的、用户可定制界面的趋势。最终,Claudeforce 代表了 Salesforce 的战略,即通过在新 AI 界面中占据自身位置来拥抱潜在的脱中介化,利用其长期积累的数据和工作流优势。
CdXz5zHNQW_8PPap1v6RJ.png
CISO 因误判低 CVE 数量而降低提示注入(Prompt Injection)的优先级,这是一种错误。提示注入已连续三年稳居 OWASP 大语言模型(LLM)应用十大风险榜首。然而,近期对真实世界事件的分析将其排名列为第十二位。这种差异源于提示注入攻击能够绕过传统漏洞扫描器的检测。该研究虽属探索性,但凸显了专家判断与观测到的事件记录之间存在显著分歧:专家因提示注入拥有巨大的攻击面而将其排名靠前,而事件数据则反映了实际成功的入侵案例。提示注入具有隐蔽性,其将恶意指令嵌入看似无害的内容中,使其对标准安全工具不可见。有效的防御需要依赖对抗性测试以及对代理能力的架构限制,而非仅依靠事后分析。这种主动方法至关重要,因为提示注入被视为大语言模型系统的一项基本法则。当前防御措施并非万无一失,设计系统时应以提示注入必然发生为前提。挑战在于准确解读事件数据,而该数据本质上具有回溯性。此外,虚假信息也造成了专家意见与事件记录之间的显著分歧。诸如持久化记忆污染和 MCP 工具接口利用等较新威胁拥有对应的 CVE,但其影响可能未体现在低数量的安全公告中。OWASP GenAI LLM 十大风险 2026 版现已纳入事件数据,尽管权重分配仍是讨论焦点。作者承认其方法论存在局限性,包括专家受访者池规模较小以及分类器变异性。最终,专家共识与事件数据之间的分歧凸显了大语言模型安全领域不断演进且复杂的特性。
CdXz5zHNQW_IrDKuEVAzc.png
Anthropic 认为,企业 AI 的未来在于“多人协作 AI",而非单一用户聊天机器人。其战略聚焦于能够在团队间协作、理解组织语境并主动协助任务的 AI 智能体。集成于 Slack 的 Claude Tag 现已处理整个对话历史,以实现更优的无提示干预。这一演进标志着 AI 正从个人工具转变为组织同事。White 概述了 AI 演进的三个阶段:单任务完成、全任务完成,以及当前的以目标为导向的项目执行。实现诸如减少缺陷或加快法律审查等抽象的公司目标,要求 AI 跨越多个系统和人员运作。这本质上推动了协作型多人 AI 的需求,因为知识工作本身具有内在的复杂性和多面性。三项技术进展促成了这一主动式 AI 的转变:通过 MCP 等标准增强的连接性、实现有用主动性所需更高的模型智能阈值,以及集成到 Slack 等现有协作平台。更新后的 Claude Tag 通过分析完整频道语境来决定最佳行动方案。Anthropic 强调内置的克制机制,以避免用无益的 AI 干预打扰用户。该公司认为,通过自动化数据分析并减少交接环节,协作型 AI 将释放人类时间,使其专注于战略决策和更高层面的协作。站点可靠性工程(Site Reliability Engineering)便是这种协调式 AI 方法行之有效的例证。该战略旨在弥合 AI 采用与可感知的业务影响之间的差距。Anthropic 采用分层防御策略应对提示注入攻击,包括模型级训练和第三方安全集成。Claude 的数据访问权限仅限于用户授权范围,防止跨频道语境泄露。虽然扩展语境目前免费,但 Anthropic 正在试验定价模式,重点关注客户控制权和可定制的成本效益配置。Anthropic 将其 AI 定位为连接异构系统的编排者,提供区别于微软和谷歌等竞争对手的独特价值主张——后者侧重于集成生态系统。他们主张,真正的价值在于智能地整合各平台数据,以达成客户期望的结果。这种对智能集成的聚焦,被呈现为寻求有效利用 AI 的企业的关键差异化优势。
企业 AI 的初始理念倾向于赋予智能体最大程度的自主权以提升性能,但这一假设在生产环境中正难以为继。成功的智能体 AI 将源于具备明确职责和清晰运行规则的智能体,而非单纯追求灵活性。Gartner 预测,超过 40% 的当前智能体 AI 项目将无法存活至 2028 年,原因包括成本不断攀升、价值不明确以及风险管控不足。麦肯锡的数据表明,智能体 AI 的部署速度远超负责任 AI 的成熟度,治理与控制水平普遍较低。焦点正从智能体能力转向建立信任,这需要获得风险、法律及合规团队的批准。完全自主在生产环境中失效,原因在于集成复杂性以及自主性与问责制之间的根本性权衡。追踪高度自主智能体所做出的决策十分困难,可能导致关键领域出现潜在的监管违规。将自主智能体集成到遗留工作流中,需要对现有的决策点和审计轨迹进行彻底重构。目前,对 AI 风险的认知远超缓解努力,安全与风险问题被视为规模化部署的主要障碍。领先企业正在通过重构自主性来应对这一挑战:创建窄范围智能体、在决策边界处设置人工检查点、优先确保决策可追溯性,并利用数据主权实施主动治理。其目标是实现校准后的控制,将监督集中在错误成本高昂的环节,而非追求最大程度的控制。评估智能体栈涉及对决策重构能力、责任边界、检查点布局以及遭篡改时的潜在影响进行考量。未来在智能体 AI 领域的竞争优势将属于那些从一开始就构建可信系统的组织,这些系统集成了范围受限的自主性、经检查点的决策、可追溯性以及数据主权。这要求设计说明书发生转变:从优先追求自主性,转向将治理与信任嵌入核心架构。竞争不再关乎部署速度,而在于赢得并维持关键监督部门的批准。
CdXz5zHNQW_WsFDozQUNO.png
企业 AI 团队正采用多种编排平台,中位数企业同时使用三种,其驱动力在于对单一供应商在安全与权限管理方面的信任缺失。目前,Microsoft 在主要使用率上领先,而 Anthropic 的 Claude Platform 正被众多企业重点考虑用于未来采用。关键挑战包括管理 Token 用量以及获取代理支出的可见性。基于 AI 构建者反馈的持续分析显示,85% 的企业使用两种或更多编排工具,其中 64% 使用三种,展现出一种 deliberate 的多平台策略。Microsoft AI Foundry、OpenAI 的 Agents SDK 以及 Anthropic 的 Claude Platform 为主要工具,另有 22% 的构建者辅以自定义内部编排。预计将向混合控制平面显著倾斜,超过半数的受访者预期在 2026 年前实现这一转变。企业正积极规划平台变更,超过三分之二预计将在一年内切换,Anthropic 的 Claude Agent SDK 成为首要考量。这种多平台策略反映了避免供应商锁定(vendor lock-in)的意愿,这是从早期云采用中汲取的教训。尽管对平台的整体满意度较高,但在实施便捷性和性价比方面评分较低。采购决策主要受灵活性、安全性、生产可靠性以及对代理执行的控制力影响,而非模型引力或开发便捷性。支出优先级反映了这些关切,在代理监控、调试和安全执行方面投入显著。企业正致力于优化任务完成可靠性和多步骤工作流管理,表明其关注点在于核心编排而非终端用户体验。构建者的主要担忧包括安全与权限限制、供应商锁定、可见性不足以及对模型和工具的灵活性受限。一个显著问题是难以控制代理的 Token 使用,每五家企业中就有一家无法实时阻止代理支出的失控。为管理成本,企业采取了多种策略,包括原生平台控制、自定义网关管道(custom gateway plumbing)和动态路由。尽管付出了这些努力,仍有四分之一的受访者依赖被动监控,缺乏针对失控代理的实时“熔断”机制。财政控制成熟度在不同规模组织间并无显著差异。大多数企业仍处于部署真正多步骤代理的早期阶段,仅有少数报告已实现高度自主的先进系统。相当一部分部署仍停留在基础助手或聊天机器人层面,表明真正具备代理能力的 AI 的广泛采用仍处于萌芽阶段。数据表明,虽然企业正在构建代理所需的必要基础设施,但代理 AI 的全面落地尚未到来。
CdXz5zHNQW_hL7YLyezgW.png
将 AI 代理集成到 Slack 中虽然颇具吸引力,但往往十分复杂,而 NanoCo 的 NanoClaw 旨在简化这一过程。其全新的 Slack 集成允许用户仅通过一条 Slack 提示即可直接创建由专业化 AI 代理组成的整个团队。NanoCo 首席执行官加布里埃尔·科恩(Gavriel Cohen)描绘了一个未来愿景:“团队中的每个人都将成为代理的管理者”,突显了部署的便捷性。这些 NanoClaw 代理可在 Slack 频道和 Canvases 中协作,甚至能跨平台(如 Telegram 或 WhatsApp)进行通信。关键差异化在于代理的持久性和个体性:每个代理都拥有独立的身份、记忆和权限,从而构成一个“数字部门”。用户可为这些代理选择首选的基础大语言模型(LLM),以优化各种因素。NanoClaw 的 Slack 集成设置流程已大幅简化,从复杂的 API 密钥管理转变为简单的“连接 Slack"选项。此初始工作区授权主要是一次性过程,此后 NanoClaw 即可将额外代理作为其自身的 Slack 机器人进行配置。代理运行在客户的基础设施上,令牌保留在用户机器上。Slack 的管理控制依然适用,使组织能够管理代理的访问权限。该系统在 NanoClaw 的基础设施与 Slack 之间建立了一座桥梁,使代理能够以对话方式创建并协调新的 Slack 原生同事。一个主代理可利用模型上下文协议(Model Context Protocol)工具来定义新代理的指令、人设、技能和工具,并将其置入共享房间。用户只需告知现有代理需要何种类型的同事或团队,例如代码审查代理或一组营销代理。这种对话式方法支持动态团队创建,具备不同技能集的代理可以在此过程中交接工作。科恩强调这种分工的优势,因为它允许为不同任务配备专门的工具和上下文。代理还与人类在共享的 Slack Canvases 上协作。底层 Slack 平台也向更多第三方代理开放,Salesforce 的 Slack Code 页面已将 NanoClaw 列为其他集成之一。然而,NanoClaw 的差异化在于,它允许已在运行的代理在对话内部创建额外的、可独立寻址的团队成员。这与 Anthropic 的 Claude Tag 等其他 AI 助手形成关键区别,后者依赖管理员主导的配置,同时也区别于 OpenAI 的 ChatGPT Workspace Agents。NanoCo 将此定位为"Slack 的首创”,即“一条消息即可启动一支完整的 NanoClaw 代理团队”。
CdXz5zHNQW_4e5kDAifzU.png
Serval 推出 Catalyst,这是一款专为构建企业自动化而设计的 AI 代理,并将其作为客户默认功能。Catalyst 充当“超级代理”,分析现有数据,识别自动化机会,并起草必要的工作流及其他组件。它还能创建后台代理,主动监控系统以发现问题,并在工单提交前提出解决方案。此次发布之际,企业服务管理供应商正日益将 AI 集成至工作流创建中,竞争对手如 ServiceNow、Atlassian 和 Freshworks 也提供了类似功能。Serval 通过将 Catalyst 定位为覆盖整个自动化生命周期(从发现到主动代理创建)的统一管理层面,从而区别于其他方案。该 AI 代理可分析帮助台数据,将标准操作程序转化为可执行系统,并构建各类自动化组件。Serval 强调模型无关(model-agnostic)的方法,允许根据具体任务灵活替换基础模型。公司的核心价值主张在于围绕这些模型的“驾驭层”(harness),包括企业上下文、记忆以及受控的管理机制。Catalyst 旨在通过让用户描述期望结果、由 AI 生成实施方案来简化自动化。Serval 认为这种方法压缩了传统自动化创建所需的步骤,与竞争对手广泛的多工具方法形成对比。关键特性在于 Serval 的后台代理,它们主动搜寻问题并提出修复建议,无需人工干预。公司的理念核心在于通过将重复性任务转化为自动化流程,从而消除支持请求。Serval 的治理模式至关重要,确保 Catalyst 继承用户权限并在定义好的团队工作空间内运行。所有生成的自动化最初均为草稿,须经审查和批准后方可激活。公司强调客户数据所有权,声明客户保留其数据权利,且 Serval 不会使用客户数据用于 AI 模型训练。部署选项包括云 SaaS、本地部署或客户自有 VPC 内,提供对数据位置和处理的灵活性与控制力。早期客户案例(如 Ramp)表明,工作流构建速度更快,且自动化在各部门的采用范围更广。
CdXz5zHNQW_wRpOOXkBKU.png
CdXz5zHNQW_NeSQ7RU5mK.png
Block 是一家科技公司,已开源其专为员工开发的桌面应用程序 Berd。Berd 提供了一个整合环境,用于与各种模型和工具中的 AI 代理进行交互。它作为一个本地安装的图形化应用,区别于基于浏览器的替代方案。Berd 托管于 GitHub,采用 Apache 2.0 许可证,支持 macOS、Windows 和 Linux。该应用被设计为一个集中的“日常 AI 工作区”,用户可在此管理对话、文件、代理和自动化任务。其核心设计原则是透明性,使用户能够清晰查看 AI 交互的运行状态。Berd 源于 Block 内部对碎片化 AI 代理体验进行简化的需求,旨在为管理多个 AI 模型及其相关系统提供一致的桌面应用。Berd 中的持久化项目使用户无需重新建立上下文即可恢复任务。Block 还强调将代理工作扩展到工程角色之外。Berd 通过赋予代理独特的视觉身份和角色来区别于其他应用,超越了通用的聊天界面。这些动画角色(如"Gloopies")作为代理配置的直观简写,具有高度辨识度。在架构上,Berd 是一个编排层,而非新的 AI 模型或运行时。它基于 Tauri 2 和 React 19 构建,并集成 Block 的 Goose 代理框架。Goose 是一个开源代理框架,用于将大型语言模型连接到外部工具和数据。Berd 的可移植性是其关键特性,数据和配置设计为可在应用之外访问。该应用采用本地优先的数据模型,将对话历史存储于用户设备上。在官方发布的 Berd 版本中,遥测功能默认关闭,以优先保障用户隐私。
CdXz5zHNQW_mwJv7cB8N4.png
企业团队在使用单一 AI 模型处理所有任务时面临挑战,因为这些模型要么对简单查询成本过高,要么对复杂任务能力不足。模型路由(Model Routing)作为一种自动为每个任务选择最佳模型的技术,正逐渐成为解决方案。Snowflake 的 Cortex AI Gateway 现已支持动态模型路由,允许用户选择“自动”模式,该模式能够智能地将任务分配给模型,在质量与成本之间取得平衡。据称,这一功能可将令牌(token)成本降低高达三倍,因为它通过为简单问题使用能力较弱但更便宜的模型,避免了过度支出。其他主要厂商如 Databricks、AWS、Google Cloud 和 Nvidia 也在开发类似的模型路由技术。Snowflake 强调,模型路由不仅涉及价格与性能,更重要的是纳入治理与上下文。其动态路由机制采用“顾问模式”(advisor pattern),即由较小模型首先尝试任务,必要时再升级至较大模型。此外,一个基于历史查询训练的分类器会将直截了当的问题路由至更合适、更简单的模型。该自动路由为可选功能,允许客户根据需要手动指定模型。Snowflake 将路由与其现有的数据治理体系集成,将基于角色的访问控制(RBAC)从数据扩展至模型和智能体(agents)。开放模型可在客户所在区域运行,以满足数据驻留要求,且所有推理均保留在 Snowflake 的安全边界内。通过 Horizon Context 和 Cortex Sense 等工具增强的上下文能力,使较便宜的模型也能有效处理任务,无需进行大量探索性工作。智能体记忆(Agent Memory)也被纳入上下文,避免重复解决问题并降低成本。模型路由的竞争格局包括 OpenRouter、Nvidia 的 Switchyard 以及 Databricks 的 Smart Routing 等平台。差异化正转向集成治理、数据本地性、访问控制以及在首选平台内的成本归因。在选择模型路由器时,组织应优先考虑与其现有数据治理和团队结构最契合的选项,而非仅关注功能或价格。选择采用哪种路由器,很大程度上取决于企业现有的数据基础设施和治理模式。
阿里巴巴最近在Hugging Face上发布了270亿参数的Qwen3.8-27B模型,引发了AI开发者和高级用户的极大关注。该开源模型采用Apache 2.0许可,具备令人印象深刻的功能,如图像和视频理解以及大型上下文窗口。其主要吸引力在于相对较小的硬件体积,FP8版本只需28GB的GPU内存即可实现。量化为4位后,它可以在高端消费级机器上运行,在性能和易用性之间取得了平衡。阿里巴巴最初的基准测试显示出具有竞争力的成绩,甚至在特定任务上超过了一些专有模型。然而,第三方评估进一步验证了其威力,有机构给出的评分相当于OpenAI的GPT-5.6 Luna。这导致人们普遍认为本地模式正在达到前沿水平的能力,而这一发展此前被认为还需要多年时间。用户报告称,在自己的硬件上运行复杂的代理任务并用模型编写代码取得了成功。尽管性能令人印象深刻,Qwen3.8-27B 似乎通过广泛的推理实现了部分质量,导致推理时间变慢。这种权衡意味着用户可能需要调整推理设置以实现更快的日常使用。然而,能够本地下载、修改和运行这样一个功能强大的模型,而不仅仅是依赖云API,标志着一个重大转变。对于企业来说,这意味着通过在自身基础设施上实现本地部署,实现了更高的隐私、安全和成本控制。像Qwen3.8-27B这样更小、更强大的模型的广泛采用,表明开发者正朝向自托管AI解决方案发展。
CdXz5zHNQW_940IUNX6di.png
Cursor 向付费用户推出了代码托管平台 Origin,恰逢 GitHub 发生长达六小时的重大故障。此次故障影响了包括 Copilot 和企业单点登录在内的多项 GitHub 服务,引发了竞争对手的尖锐评论。Vercel 首席执行官讽刺地对比了 Origin 的正常运行时间与 GitHub 的停机时间,而一名 Cursor 员工则指出其发布时间与故障时间“意外完美同步”。Origin 旨在通过直接在 Cursor 编辑器内的开发工作流中集成 AI 代理,使代码托管更加相关。开发者可以在与代码和拉取请求相同的界面中与 AI 代理交互,实现就地修订和代码管理。关键在于,Origin 并非旨在完全取代 GitHub,而是作为互补工具,同步数据并允许现有的 GitHub 仓库共存。这种“楔子”策略最大限度地降低了企业的迁移风险,聚焦于开发者实际花费时间的领域,而非采取破坏性的“彻底替换”方式。该平台的核心优势在于能够以不变的方式运行现有的 GitHub Actions 工作流,使其成为评估新工具的团队更容易接受的方案。AI 生成代码量的不断增加,往往需要更多审查并可能导致不稳定,这构成了瓶颈,而 Origin 的代理原生方法正致力于解决这一问题。GitHub 近期频繁发生重大事故,可靠性下降,为 Origin 等替代方案创造了机会。由于过去的性能问题,多个知名项目已迁移至 GitHub 之外。SpaceX 收购 Cursor 又为数据治理及不同 AI 模型的整合增添了另一层复杂性。对于正在考虑采用 Origin 的组织而言,核心问题在于其专有源代码将由一家拥有自身 AI 计划的火箭公司旗下部门如何管理。
旨在仅从检索文档中回答的检索增强生成(RAG)系统有时会表现出“角色漂移”现象,即阅读模块为了获得更好的端到端准确率而选择从其内部记忆中进行回答。这种现象是复合人工智能系统中的一个隐藏挑战,表现为各个模块偏离其分配的任务,尽管整体性能有所提升。来自麻省理工学院和哈佛大学的 researchers 提出了 Role Anchor 以应对这一问题,这是一种在训练过程中强制模块遵守其指定角色的技术。Role Anchor 既充当护栏,也作为诊断工具,确保诸如 RAG 阅读器等模块依赖证据而非内部知识。核心问题在于,仅凭端到端准确率可能掩盖这一潜在问题,从而高估系统的真实学习能力。这种盲区可能导致在实际部署中出现可扩展性、可靠性和可审计性方面的问题。例如,依赖内部记忆的 RAG 系统在外数据库更新时会变得脆弱。Role Anchor 的工作原理是比较模块在有或无其特定角色提示时的行为,衡量该提示所提供的“角色效用”或“引导”。在训练过程中,Role Anchor 会对偏离此预期引导的行为进行惩罚,迫使模块以符合角色要求的方式改进。在 RAG 和分解器 - 求解器(Decomposer-Solver)流水线上的实验表明,Role Anchor 能够保持模块的完整性,防止诸如 RAG 阅读器忽略检索证据或分解器泄露答案等捷径。虽然有时会导致准确率略有下降,但 Role Anchor 确保了真正的学习和鲁棒性,这一点在分解器 - 求解器流水线中防止了相当一部分“虚假”准确率增益的证据中得到证实。集成 Role Anchor 的方法是将其作为现有强化学习微调过程中每个组件的额外训练目标。
企业正在构建受管制的上下文层,以防止 AI 代理给出自信却错误的回答,然而失败率却呈现出悖论式的上升。2026 年 7 月的一项调查显示,68% 的企业将此类失败归因于缺失或不一致的业务上下文,其中 37% 的企业经历了重复性问题。即便更多企业实施了受管制的上下文层,失败率仍在攀升。提供上下文的方法显著影响准确性;从文档中检索是常见但不完美的做法,许多企业缺乏结构化的方法。企业在采购检索系统时优先考虑访问控制,而非检索准确性,而这直接关联到自信却错误的回答问题。虽然企业通过衡量回答准确性来重视正确性,但其采购决策并未与之对齐。受管制的上下文层作为业务数据的共享模型,旨在通过使失败可见来修复这一问题。积极构建或运行此类层的企业报告了更高的重复性失败,这表明它们更擅长发现问题,而非这些层导致了问题。这种可见性对于识别被 AI 代理放大的长期数据治理问题至关重要。大型企业报告了更多失败,表明其拥有更好的仪器化和审查机制。仅靠检索不足以弥合上下文差距,尤其是当系统间存在不一致的定义时。预算正流向构建这些上下文层,但实际生产部署滞后,揭示了支出与问题解决之间的差距。干净的失败记录是一个警示信号,表明缺乏检查机制,而非治理稳健。大多数企业计划采用多供应商方法构建其上下文层,从而保留对该关键 AI 决策组件的控制权。