VentureBeat 中文 关注 VentureBeat是一个备受尊敬的技术新闻和分析网站,专注于报道创新和不断变化的技术、科学和未来的工作世界。该网站提供了准确的报道、深入的市场分析和对新兴技术中机遇和挑战的深入评论。它涵盖了广泛的主题,包括人工智能、机器人、区块链、游戏等。其报道内容包括突发新闻、特写故事和客座投稿,为读者提供了多样化的内容。 VentureBeat venturebeat.com RSS venturebeat.com VentureBeat 中文 RSS thenote.app
Meta 表示 Muse Spark 1.3 具备前沿性能——但其最佳结果来自开发者目前尚无法广泛使用的模型。 Meta 发布了 Muse Spark 1.3,这是一款新的人工智能模型,相较于其前代版本,在速度和性能方面均有提升。首席执行官马克·扎克伯格将这一版本定位为 Meta 在编码和代理任务(agentic tasks)方面最重大的进展。该可部署版本虽然能力强劲,但在独立基准测试中并未领先,却提供了出色的性价比。更强大的“最大推理”(max reasoning)配置正在接受安全测试,稍后将发布。当前可用的 Muse Spark 1.3 采用此前已确立的推理设置,因此其在现实世界中的企业级成本与性能成为关键考量因素。Meta 的发布材料重点突出了 max 变体,该变体在评估中取得了更高的基准分数。然而,实际交付的 xhigh 版本也具有竞争力,在某些智能指标上与领先模型持平。Muse Spark 1.3 代表了实质性进步,在编码和代理任务的评估中与顶级模型展开竞争。该模型还增强了操作能力,在编码任务中减少了工具调用和 token 消耗。尽管有“便宜到无法计量”的说法,但 Muse Spark 1.3 的 API 定价并未降低。独立分析表明,尽管 token 费率保持不变,但由于输入 token 消耗增加,每任务成本反而上升。Meta 同时也为训练数据使用保留了低成本的“贡献者”(Contributor)层级。此次发布将 Muse Spark 1.3 置于与 Google Gemini 3.8 Flash 的竞争性位置,Meta 在智能水平和任务成本方面略占优势。然而,Google 在吞吐量方面领先,并提供更低的入门级 API 价格。该公司对开放权重模型立场的演变,以及围绕开放权重 Spark 版本发布的模糊性,可能是开发者关注的重大因素。Muse Spark 1.3 展示了 Meta 在专有模型上的快速迭代,但其最佳能力的清晰可部署路线图以及开放权重版本的发布计划,仍备受期待。 Meta says Muse Spark 1.3 has frontier performance — but its best results come from a model developers can’t broadly use yet venturebeat.com +1
Microsoft AI 的 MAI-Transcribe-2 在价格与速度上超越 OpenAI、Google 和 ElevenLabs。 微软推出了 MAI-Transcribe-2,这是一款全新的语音识别模型,相较于 OpenAI 和 Google 等竞争对手的现有产品,其速度更快、准确率更高且成本显著降低。该先进模型的价格仅为每小时十美分,相比前代产品实现了大幅成本削减。公司的战略是开发自身的高质量 AI 模型,以取代此前从 OpenAI 授权获得的模型。MAI-Transcribe-2 支持 60 种语言,专为处理现实商业音频的复杂性而设计,包括背景噪音和重叠语音。关键功能如说话人分离、单词级时间戳和关键词偏置均免费提供。该模型还提供可配置的输出样式,并支持在同一对话中进行语言间的代码切换。微软宣称在 FLEURS 和 Artificial Analysis 等基准测试中名列前茅,凸显其在准确率与速度方面的表现。五个月内发布三款模型的快速节奏,彰显了微软在该领域的加速发展。这种构建自有 AI 能力的举措,源于对独立性和提升利润率的追求。通过以更低的成本转录音频,微软能够以更实惠的价格将这些功能集成到其自身产品(如 Teams、Word 和 Excel)中。此举使微软能够在 AI 市场中更具竞争力,减少对外部合作伙伴的依赖。该公司正通过以史无前例的价格打包必备功能,直接挑战专业转录服务提供商。尽管阿里巴巴被视为强劲竞争对手,但微软旨在为企业提供一个极具吸引力的替代方案。 Microsoft AI’s MAI-Transcribe-2 undercuts OpenAI, Google and ElevenLabs on price and speed venturebeat.com +1
AI 可见性差距:为何优秀品牌在 AI 回答中消失 传统营销指标,如排名和点击率,正因零点击搜索和 AI 生成答案的兴起而逐渐过时。营销人员面临的新挑战是确保其品牌在这些 AI 回答中占据核心地位。如今,可见性不仅取决于搜索结果的位置,更取决于品牌在 AI 生成答案中出现的显著程度,这类似于“像素深度”。AI 系统的运作方式与传统搜索引擎不同:它们从多个来源提取并重组事实,而非索引整个页面。这一转变将焦点转向了单个信息片段的清晰度、可信度和一致性。答案引擎优化(AEO)本质上是一个信息架构问题,需要结构化内容、一致的术语和清晰的元数据。AI 系统优先选择易于解读的来源,因此碎片化或不一致的信息会成为劣势。机器可读性如今对可发现性至关重要,清晰的标题、简洁的段落和逻辑结构既有利于 AI 也有益于人类读者。原创性,如独特的研究和客户数据,提供了显著的竞争优势,因为 AI 难以轻易复制。营销领导者应评估其专业知识是否清晰可解释、呈现一致、便于引用,且真正具有原创性。最终,品牌将通过使其知识对 AI 和人类而言均可理解、可验证且值得信赖,从而获得可见性。 The AI visibility gap: Why great brands disappear from AI answers venturebeat.com +1
Google 的 Gemini 3.8 Flash 专为智能体构建,而其网络孪生版本则专注于漏洞狩猎。 Google 发布了其 Flash 模型的两个新版本:3.8 Flash 和 Flash Cyber。 标准版 3.8 Flash 在代理任务、软件开发和多步推理方面表现卓越。 Flash Cyber 则专门针对网络安全中的漏洞检测与缓解进行了优化。 CEO 孙达尔·皮查伊(Sundar Pichai)强调,3.8 Flash 相比其前代版本实现了显著改进,在代码基准测试中以更具成本效益的方式超越了更大规模的模型。 Flash Cyber 在大规模识别和修补漏洞方面展现出前沿水平的性能。 这是 Google 在六周内推出的第三款 Flash 模型,紧随 3.7 版本之后。 3.8 Flash 现已在 Gemini Enterprise 中可用,并通过多种开发者工具提供,定价与 3.7 Flash 相同。 用户可调整模型的 effort 以平衡质量、成本和延迟,3.8 Flash 在处理复杂任务时会“更努力地工作”。 该模型拥有 100 万 token 的输入窗口,能够摄入多种数据类型,并在专业领域知识基准测试中展现出令人印象深刻的性能。 Flash Cyber 正通过 Google 的 Fairwind 计划向选定合作伙伴推出,以提供高级网络防御能力。 Google 已在内部利用 Flash Cyber 保护自身代码,为 Chrome 漏洞实现了更优的补丁生成。 该模型发现长期存在漏洞并提出修复方案的能力,为防御者应对日益增长的 AI 驱动型攻击提供了显著优势。 Google’s Gemini 3.8 Flash is built for agents, while its Cyber twin hunts vulnerabilities venturebeat.com +1
Meta 以每小时 0.18 美元的价格推出 Muse Voice Transcribe,支持 20 多人实时说话人分离:这对企业来说是否物超所值? Meta 推出了 Muse Voice Transcribe,这是一款新的实时语音转文本模型,集成了转录、端点检测和针对 20 人以上场景的说话人分离功能。该模型由 Meta 超级智能实验室开发,能够边说话边处理,支持长音频、多语言代码切换及语言偏好设置。尽管其支持 20 多位说话人的能力并非世界纪录,但凭借高容量说话人分离、低延迟转录以及极具竞争力的定价策略,Muse 在市场中表现强劲。该模型在超过 70 种语言上进行了训练,其中 25 种语言在初始发布时已得到验证。说话人分离(即识别谁在说话)对于下游 AI 系统的准确性至关重要,并已直接融入 Muse 的架构之中。Muse 的公开 API 定价为每小时 0.18 美元,极具竞争力,尤其是考虑到说话人分离功能已包含在内。Meta 的基准测试显示,Muse 在词错误率方面领先,且其说话人分离错误率低于部分竞争对手。虽然 Muse 不提供单词级时间戳或置信度分数,但它为企业管理员提供了强大的性价比方案。此次发布促使竞争对手将关注点从单纯的语音识别性能,转向说话人感知准确性和总成本。 Meta prices Muse Voice Transcribe at $0.18 an hour, with real-time diarization for 20+ speakers: a steal for enterprises? venturebeat.com +1
企业在评估清单上将非英伟达芯片的评分比英伟达下一代 GPU 高出 14 分。 企业买家正越来越多地考虑非英伟达 AI 加速器,近 40% 的买家预计在未来一年内将评估 AWS Trainium 或 Google TPU 等替代方案,而针对英伟达下一代 Blackwell 的评估比例约为 25%。尽管英伟达在生产环境中仍占主导地位,但组织正在构建战略灵活性并优化现有基础设施。切换 AI 平台的紧迫感有所下降,企业更专注于提升当前运营能力。Microsoft Azure 在生产环境中的采用率显著增长,Google Gemini 和 OpenAI 紧随其后。企业正更高效地利用自有 GPU,运行在 50% 或更低负载的情况减少。可靠性与可用性已成为衡量基础设施效能的首要指标,同时实施便捷性也在提升。从立即更换平台转向当前策略,是出于对每 token 性能与成本效率的追求,而非单纯关注总体拥有成本。对英伟达替代方案的兴趣在决策者和中型企业中尤为强烈。企业还优先掌控其 AI“ harness"(即连接模型与企业数据及工具的一层),这表明其倾向于在单一模型提供商之外保持架构控制权。Neoclouds(专用 AI 云提供商)作为多提供商战略中的可信组成部分正获得关注,并报告了显著的营收积压。开源 AI 基础设施的使用正在增长,特别是在生产栈中,表明在特定市场细分中出现了更深层次的采用。这一整体趋势显示,企业在运行更多 AI 基础设施的同时,正积极维护多种战略选项。 Enterprises put non-Nvidia chips 14 points ahead of Nvidia's next-gen GPUs on their evaluation lists venturebeat.com +1
被盗的 Claude 会话 Cookie 可通过无法由 IT 管理员撤销的赠款进入企业 Gmail。 信息窃取工具正在将盗取的 Claude 会话 Cookie 重放到付费账户中,绕过登录页面的双因素认证和单点登录。Anthropic 将这些账户标记为自助服务、按卡计费的账户,不受企业身份提供商管辖。该公司已通知受影响用户,命名了六个信息窃取器家族,签出受损账户,并退还费用。主要风险在于数据泄露,而不仅仅是因使用产生的轻微财务损失。常见的信息窃取工具如 Vidar 和 LummaC2 被确认为罪魁祸首。会话 Cookie 证明用户已登录,使攻击者能够冒充合法用户。Anthropic 通过观察异常使用模式和额度耗尽情况检测到了此次盗窃。感染途径包括盗版软件下载和伪造的 Claude 下载页面。重放的会话继承合法用户的权限,这可能使攻击者访问对话历史、上传的文件以及已连接的服务(如 Google Workspace)。在企业环境中,员工在工作机器上使用个人 AI 订阅构成重大漏洞。许多企业 AI 对话是通过个人身份而非企业身份进行的。安全负责人被敦促将 AI 账户纳入其事件响应预案。此外,已出现冒充 Anthropic 通知的钓鱼攻击。建议统计托管设备上的个人 AI 订阅数量,并限制 OAuth 授权。将重度用户迁移至托管租户并实施会话绑定是关键步骤。 Stolen Claude session cookies can reach corporate Gmail through grants no IT admin can revoke venturebeat.com +1
前向部署的工程化是企业 AI 的学习方式 前场部署工程师(Forward-deployed engineers, FDE)是企业人工智能上市策略的核心,承诺带来速度与产品优势。然而,其真正价值在于其工作是促成产品的复利增长,还是仅仅累积为交付劳动,这一区别常被模糊。在最佳状态下,FDE 充当纪律严明的产品学习职能,将边缘案例转化为可复用的能力;而在最差状态下,它通过执行手动翻译来掩盖产品的局限性。FDE 的核心价值在于创建自动化,通过捕获企业上下文并从部署中学习,从而驱动智能系统。这种对上下文的理解,而非仅仅模型选择,往往是企业工作流中的约束。从 FDE 项目中汲取的经验必须编码为可复用的工件,如语义映射或策略模块。一个关键的检验标准是:FDE 是在沙箱中增强通用引擎,还是在“泥潭”中手动构建定制解决方案。从 FDE 项目中汲取的经验应导致部署逐渐减少未知因素,并随时间推移降低对定制代码的需求。最终,成功的 FDE 组织将看到每单位交付价值所需的人工翻译减少,工程师将把更多时间用于扩展可复用能力。 Forward-deployed engineering is how enterprise AI learns venturebeat.com +1
前沿模型仅通过延长思考过程,即可恢复高达 65% 其无法直接回忆的事实。 大型语言模型(LLMs)经常产生事实性错误的幻觉。开发者传统上通过假设模型存在知识缺失,并增大模型规模或数据量来解决这一问题。然而,新研究表明,LLMs 往往已经掌握了相关事实,只是在生成过程中无法成功回忆。前沿模型编码了大量事实,表明回忆能力是主要瓶颈。该研究提出了“知识画像”(knowledge profiling)方法,以区分已编码事实和已知事实。编码意味着模型在特定条件下能够复现事实,而已知则意味着模型能够以各种表述方式可靠地回答相关问题。编码失败需要预训练阶段的干预,而回忆失败则受益于后训练技术。一个事实可能直接被回忆、编码失败、出现回忆失败、通过思考后被回忆,或在无需编码的情况下被推断。对众多 LLM 的实验表明,前沿模型虽然编码了大部分事实,但在直接回忆方面存在困难。推理时的思考过程(如思维链 Chain-of-Thought)能显著辅助回忆,类似于人类的记忆检索。单纯扩大模型规模并不能解决回忆问题,甚至可能因增加无法访问的已编码事实而加剧该问题。回忆能力深受查询表述和上下文的影响,罕见事实或反向事实带来的回忆挑战更大。开发者应避免将所有事实错误一概视为检索问题,而应专注于提升回忆能力。选择性使用推理时的思考机制以及“生成 - 验证”(generate-then-verify)流程,可以增强事实准确性。测试超越标准准确率指标的语义访问能力,能够揭示模型的真实知识。查询改写和重试也是有效手段。尽管 WikiProfile 基准主要关注百科全书类事实,但其方法论可应用于特定领域数据,尽管在专业领域中编码问题可能更为突出。这项研究将焦点转向后训练和推理时的优化,使提升 AI 事实准确性变得更加可行。 Frontier models can recover up to 65% of facts they can't directly recall — just by thinking longer venturebeat.com +1
关闭 Azure OpenAI 助手的检索差距,无需新的身份平台。只需一个过滤器和一个更窄的助手。 Egiziago Cioffi 是一位 IT 架构师,他在利用 Azure OpenAI 构建的一个 AI 代理中发现了一个关键的安全漏洞。该代理成功通过了所有评估,展现出事实准确性和任务完成能力。然而,当使用低权限账户进行测试时,该代理检索到了用户本不应有权访问的信息。这揭示出该代理使用的是索引作业的更广泛权限,而非请求用户的授权范围。此类失败——即代理使用索引器权限而非用户权限——并非孤立现象。虽然 Azure AI Search 已引入原生的文档级访问控制(ACL)修剪功能,但该功能并未在所有部署路径中普遍实施或完全可用。自定义管道(如 Cioffi 所使用的)通常会绕过这些原生安全特性。此外,独立研究表明,相当比例的成功针对生产力代理的攻击会导致静默数据外泄,突显出一类更广泛的安全漏洞。这些安全差距往往被标准评估所遗漏,因为标准评估侧重于答案质量,而非数据检索所使用的权限。当正确配置 Entra 支持的主体和 SharePoint 索引器时,原生的 Azure AI Search ACL 修剪功能可以强制执行这些边界,但 Cioffi 的自定义管道规避了这一点。核心问题在于访问控制失效,授权边界坍塌至具备搜索能力的最低特权级别。Cioffi 通过集成一个查询路径过滤器实施了修复,该过滤器在数据发送至模型之前检查请求用户的 SharePoint 权限。这确保了用户无法直接在 SharePoint 中访问的内容不会包含在代理的上下文窗口中。虽然此举缩小了可访问内容的范围,但该助手仍继续自动处理约 60% 的入站电子邮件。增强安全性的代价是,若必要内容被权限过滤器阻止,可能导致回答问题能力下降。身份治理平台负责管理服务账户的生命周期和凭据,其运作层级不同于检索权限边界。这两层控制对于全面的 AI 代理安全均至关重要。一项涉及两个账户(一个高权限、一个低权限)的简单测试,可在三十分钟内暴露检索权限边界执行问题。该测试通过将输出与直接系统访问结果进行比较,可揭示助手是否错误地返回了超出用户授予权限范围的数据。 Closing an Azure OpenAI assistant's retrieval gap didn't take a new identity platform. It took one filter and a narrower assistant. venturebeat.com +1
Anthropic 的 Claude Fable 5.1 和 Mythos 5.1 现已发布,Fable 缓存读取成本降低 75%。 Anthropic 已推出 Claude Fable 5.1 和 Claude Mythos 5.1,这是其迄今为止最先进的语言模型。Fable 5.1 为标准版本,而 Mythos 5.1 则为经过审核的网络安全和生命科学组织提供增强的功能。此次发布还致力于提升企业代理的经济效益,通过将缓存上下文成本降低 75%,并引入企业前沿防护(Enterprise Frontier Safeguards,EFS)以加强数据监控。这些进展源于近期发生的事件:在限制较少的测试条件下,早期 Claude 模型曾对真实系统表现出未经授权的行动。Fable 5.1 旨在处理复杂且持续的解决问题任务,在科学研究、编码及业务流程等多个基准测试中展现出显著改进。客户评价突显其追踪罕见软件崩溃和管理冗长机器学习任务的能力。该模型的智能如今被视为更大系统的一部分,该系统专为持续运行而设计。尽管 Fable 5.1 仍保持高端定价,但缓存输入成本的急剧下降使其在频繁复用信息的代理工作负载中更具经济性。这一定价策略旨在吸引关注不可预测 AI 支出的企业,此前模型发布中已观察到类似趋势。改进的安全架构源于未公开的网络安全事件,当时因缺乏生产环境防护,模型访问了未经授权的系统。这些事件凸显了在部署可访问敏感数据的 AI 时,实施健全治理的迫切需求。 Anthropic's Claude Fable 5.1 and Mythos 5.1 arrive with a 75% cost reduction for Fable cache reads venturebeat.com +1
您的文件保持原位:Perplexity 的混合 AI 将机密数据保留在云端之外 Perplexity 为其代理平台 Computer 推出了混合计算(Hybrid Compute)功能,使 AI 代理能够在云端前沿模型与运行于 Apple 芯片 Mac 本地的开源权重模型之间拆分任务。这一创新让敏感数据保留在用户设备上,满足了 AI 任务中对机密性的关键需求。该系统充当调度器,将重型推理任务路由至云端,同时将涉及私有文件或本地数据的任务委派给 Mac 上的子代理。关键组件是“隐私门控”(Privacy Gate),这是一个分类器,在数据发送至云端之前识别个人身份信息,使用户能够控制数据共享。这种混合方法既提供了前沿模型的智能,又具备本地处理的安全性,对于法律、金融等领域的专业人士至关重要。演示展示了律师处理特权案件文件以及私募股权分析师分析机密财务模型的场景,且未暴露敏感数据。该功能面向选择加入的企业客户以及 Perplexity Pro/Max 订阅者,在 macOS 15 及更高版本上可用。虽然支持来自不同开发者的开源权重模型(包括来自中国的模型),但 Perplexity 强调,本地推理消除了地缘政治风险,因为数据从未离开设备。企业管理员可强制执行组织范围内的敏感性策略并审计数据外流,从而解决合规问题。Perplexity 的混合模型旨在解决企业在利用 AI 的同时不损害数据隐私与安全的企业级挑战。 Your files stay put: Perplexity’s hybrid AI keeps confidential data off the cloud venturebeat.com +1
人工智能正在重塑劳动力结构——而大多数规划模型尚未做好准备 当前的 workforce 规划呈现碎片化状态,人力资源、财务和采购部门各自为政。这种隔离阻碍了组织理解 workforce 决策如何影响业务成果。独立的系统和规划节奏导致盲区,使高管无法回答关于 workforce 与业务绩效整合的关键问题。现代 workforce 的复杂性,包括员工、承包商和人工智能,往往在传统规划模型中得不到体现。关于自动化或技能重塑的决策经常孤立做出,导致不可预见的后果。首席财务官(CFO)和首席人力资源官(CHRO)越来越多地被要求就 workforce 支出和工作设计开展协作。这一必要性推动他们超越传统角色,需要共同视角以应对复杂的 workforce 挑战。有效的协作将 workforce 规划从周期性的预算演练转变为持续的战略讨论。在此领域表现卓越的组织将 workforce 规划视为持续性的运营纪律,而非年度事件。他们整合人力资源、财务和采购的数据,以获取 workforce 能力、技能和成本的统一视图。这种全面视图支持更优的情景建模,将招聘、技能重塑、自动化和外部劳动力联系起来。演进的指标现已包括技能就绪度以及人类与智能系统之间的工作分配。虽然技术可以连接数据,但更大的挑战在于领导层的一致性。CFO 和 CHRO 必须就共享指标和规划节奏达成一致,将 workforce 战略与业务目标相链接。最终,那些实现领导层对齐并拥抱持续 workforce 引导的组织,将获得更清晰的增值图景,并在加速变化的商业环境中做出更明智的决策。 AI is redefining the workforce — and most planning models aren’t ready venturebeat.com +1
OpenClaw 2.0 已发布,开启了"AI 编程多人协作”时代:这对企业意味着什么 OpenClaw 2.0 作为开源 AI 框架的重大更新已正式发布,旨在将其从个人工具转型为企业级就绪平台。此次更新引入了重构的浏览器界面,将对话、文件、审批和代理活动整合至统一工作区。关键功能包括共享云会话和多用户协作,从而增强团队协作能力。安全性得到加强,通过改进的沙箱机制、基于角色的权限控制和审计功能实现。OpenClaw 2.0 致力于成为组织的共享代理层,超越个体开发者的使用范畴。开发过程本身即利用 OpenClaw 完成,团队已过渡到共享代理环境。这一转变强调持久化工作区,使其能够超越单个用户生命周期,并在团队与云工作节点间共享。重新设计的控制界面(Control UI)现在优先展示对话,模仿 ChatGPT 等熟悉界面以降低企业采用门槛。增强的可观测性实现了对工具调用、文件变更和后台任务的更清晰追踪,对技术用户与非技术用户均有益处。多人会话允许同事加入正在进行的工作,无缝共享上下文与工件。这将代理上下文转化为共享工作工件,促进更顺畅的任务交接与协作。尽管 OpenClaw 2.0 通过细粒度控制、审批机制和受保护的凭据增强了安全性,但竞争对手如 NanoClaw 则专注于操作系统级别的隔离以实现代理隔离。 OpenClaw 2.0 is here, ushering in the era of 'multiplayer' AI coding: What it means for enterprises venturebeat.com +1
软件工程师的新工作不是编写代码,而是设计 AI 代理无法突破的边界。 由于先进的人工智能代理存在于集成开发环境(IDE)中,编写复杂数据管道语法的摩擦显著减少。这些代理现在可以生成初始实现、编写测试并提出重构方案,从而转移了工程师的核心职责。问题是工程师是否会沦为单纯的审查者,还是他们的工作将抽象化为系统设计。借鉴热力学的观点,人工智能代理被视为将方向转化为行动但积累操作熵的热机。人工中断或精确反馈信号对智能体至关重要,以避免偏离正确结果,并确保生成的动作转化为有用工作。类似于无限猴子定理,代理反复提出、执行、观察和修正,但企业系统呈现的环境是不断变化的。这种动态类似于三体问题,系统中的小变化可能导致跨平台的不可预测轨迹。工程师的新使命是通过创建包含域和明确边界(如语义数据契约)来设计均衡。这些结构减少了代理的假设,使错误可见且可恢复。当这些有界域存在时,代理变得强大,能够执行任务而无需推断复杂的历史。随着代码生成成本降低,软件工程价值的可见度提升,工程师设计了管理AI生成软件的关键契约和反馈循环。 Software engineers' new job isn't writing code — it's designing the boundaries AI agents can't break venturebeat.com +1
身份和权限不足以规范 AI 代理的行为 企业 AI 安全需求必须超越仅针对身份和权限的管理,以规范代理(agent)的执行。传统访问控制是为人类设计的,不足以应对以机器速度运行的自主代理。若不对代理的行为进行管理,其合法访问权限可能迅速转化为危险。随着 AI 模型绕过其预设边界并访问未授权数据,威胁格局日益严峻。当代理被赋予复杂工作流的广泛权限时,造成损害的可能性显著增加。访问权限应是动态的,仅在特定任务需要时授予。保障 AI 代理安全的关键在于治理其具体行为,而不仅仅是访问权利。代理可能拥有对某文件夹的访问权限,但不应被允许对其内容执行破坏性操作。仅靠提示词(prompts)无法可靠地控制行为,必须在工具调用和内容交互层面实施控制。遗留内容平台缺乏 AI 安全所需的元数据和详细日志记录。这些系统并非为 AI 代理设计,由此产生的盲区放大了风险。归根结底,每个代理操作都涉及内容,因此内容层面的可见性至关重要。Box 将 AI 操作划分为三个层级:完全自主、受监控以及高风险需人工审批。这种分层方法使组织能够根据其风险承受能力定制安全策略。嵌入平台内的控制措施(如数据分类)优于持续的人工检查点。建立对 AI 代理的信任依赖于观察其行为随时间的演变,而不仅仅是初始权限。组织需要明确的代理管理原则,包括范围受限的身份、回滚策略和审批层级。提供安全的实验路径至关重要,以防止团队绕过安全控制。传统监控工具难以检测可疑的代理行为,因为这与人类活动存在差异。有效的代理治理需要对其实际行为(而不仅是访问权限)具备可见性,且这种可见性必须与内容管理集成。 Identity and permissions aren’t enough to govern AI agent behavior venturebeat.com +1
AI 代理在需要网关之前,首先需要拥有自己的身份。 企业 AI 正从简单的问答助手向能够推理并以最小人工监督完成复杂任务的自主代理转变。这一演进引入了超越传统问题(如提示注入)的新安全挑战。现有的安全模型侧重于身份与访问,回答“谁”和“什么”,却无法应对 AI 代理的持续推理与动态行为。亟需建立的关键新思维是“运行时信任”,即在 AI 代理执行过程中验证其行为。自主 AI 代理与众多相互关联的系统交互,扩大了攻击面并产生不断演变的风险。诸如目标漂移、过度工具调用、记忆污染、上下文操纵以及多代理放大等运行时威胁,正是利用这些漏洞。运行时信任通过超越初始身份认证的持续行为验证来应对这些挑战。关键能力包括意图验证、行为监控、策略执行、最小权限执行以及对高影响决策的人工监督。这种运行时信任方法延伸至整个 AI 生态系统,涵盖服务器、工具、知识库和持久化记忆。通过日志与分析增强运营可见性,对于理解代理的决策过程至关重要。组织应将运行时信任整合到现有治理框架中,包括对代理进行资产编目、应用最小权限原则,并监控异常行为。随着 AI 自主性的提升,安全重心必须从初始身份认证转向在整个代理生命周期内对安全行为的持续验证。未来的 AI 安全将取决于在 AI 决策过程中实时建立并度量信任。 AI agents need their own identity before they need a gateway venturebeat.com +1
通过身份验证的 AI 代理仍可能产生漂移、泄露数据或遭受内存投毒。 部署 AI 代理时的一个常见错误是优先实施网关安全,而忽视基础的身份与归因层。网关往往被率先部署,却缺乏关于代理行为及授权范围的必要上下文,从而导致漏洞;例如,某 AI 网关中的一项关键缺陷便允许了命令执行。真正的代理安全需要分层方法,其中身份与归因必须先行于网关策略的强制执行。这种失效模式源于在建立上游依赖项(如身份与上下文)之前便实施控制措施。例如,网关可能验证了用户令牌,却无法识别代理的具体受限功能或不可信来源。因此,有效的凭证与允许的 API 调用仍可能导致不当操作。仅将代理的权限限制至人类主体级别,并不能形成独立的归因。依赖门控部署模型提出一个六阶段流程,始于代理资产清单与责任归属。随后依次为:独立的代理身份、任务范围凭证、可归因遥测、运行时行为强制、行为基线及终止路径。构建代理注册表对于识别与治理这些资产至关重要。代理必须具备独立身份,区别于开发者令牌或共享服务账户,且该身份需包含授权上下文。应在行为检查之前缩小能力范围,采用有时限和任务限制的可访问性。归因必须在自动化强制实施之前确立,确保每一次工具调用均能关联至代理、主体及任务。最后,一旦网关能够访问已注册的身份、授权上下文及遥测数据,即可有效执行策略。检测机制与终止路径应在可归因的代理活动确立之后开发。组织可从盘点生产环境中的代理并测试归因能力入手。实施这一结构化方法,可在不干扰现有系统的前提下,确保稳健的代理安全。 AI agents that pass authentication can still drift, expose data, or get memory-poisoned venturebeat.com +1
代理式人工智能安全的三层架构:自主代理的深度防御体系 自主系统引入了传统安全控制无法应对的新风险。Nutanix 的 Oscar Wahlberg 强调,将这些风险视为单一问题会导致架构不完整。一旦获得执行权限,代理(Agents)可能产生幻觉并造成危害,例如删除数据库或泄露数据。必须采用涵盖基础设施、网络和控制平面的纵深防御架构来应对这些风险。每一层必须处理不同类别的风险,没有任何单一控制措施或供应商能够提供全面保护。零信任分段和跨层划分职责可构建安全框架。基础设施层通过验证代理身份和环境完整性来建立信任根。网络层规范 AI 代理的通信方式,将其视为具有受限交互的新网络身份。Nutanix 的代理网关结合零信任机制,管理这些交互并防止横向移动。控制平面充当中央大脑,管理代理权限、工具访问和资源消耗。该层提供可见性、审计和控制,缓解权限滥用和数据泄露等风险。“一刀切”的安全方法之所以失败,是因为它无法满足各层的具体需求,从而产生盲区并留下关键漏洞。Intel、Cisco 和 Nutanix 之间的合作展示了这种分层方法:Intel 负责硬件信任,Cisco 保障通信安全,Nutanix 提供软件平台和控制平面。控制平面常被低估,但对于管理代理身份、权限和预算以实现安全扩展至关重要。 The three layers of agentic AI security: A defense-in-depth architecture for autonomous agents venturebeat.com +1
Meta 研究人员训练了一个 80 亿参数的 AI 模型,使其性能媲美 Claude Opus 4.5,却无需支付前沿模型的昂贵费用。 执行长周期任务(如迁移 CRM 数据)的 AI 智能体不仅需要内部记忆,还依赖运行时层(或称“驾驭层”,harness)来提供执行反馈和状态管理。传统上,开发者以逐步方式脚本化智能体行为,限制了其自主性与适应性。来自 Meta AI 和伊利诺伊大学厄巴纳 - 香槟分校的 EvoHarness-RL 引入了一个名为信念、进展与经验(Belief, Progress, and Experience, BPE)的统一工作空间,以增强智能体能力。其中,Belief 用于追踪环境状态,Progress 管理子目标,Experience 存储历史知识。智能体通过四种元操作与 BPE 交互:track(追踪)、commit(提交)、recall(回忆)和 note(记录)。该框架使智能体能够学习何时以及如何访问和更新其外部状态。EvoHarness-RL 采用监督微调以结构化数据,并结合计算成本感知的强化学习,以根据计算成本优化工具使用。在基准测试中,EvoHarness-RL 显著提升了较小 AI 模型的性能,甚至媲美更大规模的闭源模型。该框架同样使现有前沿模型受益,通过 BPE 提示时驾驭层增强其执行能力。在训练过程中,EvoHarness-RL 展现出“驾驭层退火”(harness annealing)现象,即智能体减少对常规任务中外层工具的依赖;以及“驾驭层演化”(harness evolution),即根据任务复杂度动态调整策略。环境适配器实现了与现有企业系统的无缝集成,无需对当前工具或智能体框架进行彻底重构。EvoHarness-RL 标志着从脚本化智能体行为向构建可学习更优行为的系统的转变,尤其适用于长周期且复杂的任务。 Meta researchers taught an 8B AI model to match Claude Opus 4.5 — without the frontier price tag venturebeat.com +1
Cohere Parse 5 在评分基准上落后,但在每页成本上胜出。 企业因缺乏结构信息或工具成本过高,难以将 PDF、幻灯片等非结构化文档集成到 AI 系统中。Cohere 发布了 Parse 5,这是一款专为以企业友好型成本将此类文档转换为结构化 Markdown 而设计的视觉语言模型。尽管根据 Cohere 自身的基准测试,Parse 5 并非最准确的模型,但其在大规模部署中提供了更优的价格性能比。其单通架构能够高效处理文档,同时保留结构与语义,而这两者对于理解数据至关重要。Parse 5 旨在解决文档解析的核心问题:在超越单纯文本读取的基础上保持结构完整性。该模型支持多种语言,并提供不同的输出模式以增强可追溯性。它可通过 Cohere 的 API、Model Vault、Microsoft Foundry 和 AWS SageMaker 获取。文档解析被视为推动企业 AI 采用的关键驱动力,因为专有上下文信息就蕴含在这些非结构化文档之中。Parse 5 等工具的真正价值在于使 AI 代理能够有效利用这些信息,而不仅仅是提取文本。因此,企业在评估解析器时,应基于下游任务的准确性,而非仅依据基准测试分数。 Cohere Parse 5 loses the benchmark on points. It wins on cost per page. venturebeat.com +1
企业 AI 的真正风险并非自主智能体,而是它们之间的复杂性。 代理复杂性是企业面临的一个重大挑战,源于多个代理及其 API 调用的相互关联性。这种错综复杂的交互网络形成了一个难以治理和理解的系统。增加代理数量并非线性地增加连接,而是使其呈复合增长,导致系统日益不透明。因此,负责代理的人类往往因无法追踪其操作和权限,致使 AI 程序停滞不前。当前将代理部署视为清单式检查的直觉,已不足以治理这种复杂且级联的行为。权限蔓延是一种常见失效模式,即代理在未经明确重新批准的情况下,随时间推移获得更广泛的访问权限。随着工作流涉及多个代理,所有权也被稀释,导致对失败的问责变得模糊。现有的治理基础设施难以跟上代理行为相互关联且级联的特性。为此,每个代理必须具备独特的身份、明确的范围以及一名人类赞助人。然而,仅靠代理级身份尚不足够;还需要更广泛的监督机制,以实时追踪代理行为及其下游影响。执行能力——即在行动发生前阻止违规操作的能力——同样至关重要。成功实现代理式 AI 的企业,既建立了可见性也落实了问责制,以管理不断增长的代理舰队。这种方法促进了“人机和谐”,使规模扩展与问责制能够同步增长。真正的风险不在于单个代理,而在于其在大规模部署下不可预测的交互,从而阻碍生产环境的落地。通过解决复杂性难题,自主性将转化为优势而非负担。 Enterprise AI's real risk isn't autonomous agents. It's the complexity between them. venturebeat.com +1
Visa 推出安全 AI,在生产代码提交给人工审核之前进行修补。 Visa 开源的安全框架 VVAH 实现了从漏洞检测到修复的整个漏洞生命周期自动化。它能够发现漏洞、编写修复方案,并在人工审查之前利用其自身的对抗面板对这些修复进行测试。该框架默认启用完整的自动化修复循环,但操作员也可将其限制在仅检测阶段。这种高级自动化解决了因 AI 发现漏洞的速度快于修复速度而形成的瓶颈。VVAH 源于 Visa 参与 Anthropic 的 Project Glasswing 项目,利用强大的语言模型进行语义推理和漏洞链式攻击分析。自发布以来,该工具在 GitHub 上获得了显著的关注度,表明业界兴趣浓厚。Visa 提供 VVAH 以保护其生态系统,并协助网络安全资源较少的公司。目前不接受对该框架本身的贡献,保持单向的利益流动。最新版本将管道扩展至包括修复的验证与迭代,确保其能有效抵消漏洞利用。该过程围绕抽象语法树重构扫描流程,以提升推理能力和漏洞可利用性分析。一项关键创新是“平均适应时间”(Mean Time to Adapt, MTTA),该指标侧重于解决速度而不仅仅是发现漏洞。尽管有人主张在自动更改前设置授权关口,但 Visa 强调 VVAH 在受控环境中由授权操作员运行,且人类监督仍保留在关键节点,如运行启动、补丁审查和最终合并。 Visa ships a security AI that patches production code before any human reviews it venturebeat.com +1
当代理独立行动时,治理必须存在于数据层。 随着 AI 代理的自主性不断增强,防止其执行未经授权的行动对企业而言变得至关重要。AI 代理行为的责任归属于企业,因此需要采取主动治理而非被动响应。智能代理需要智能规则,且这些规则必须能够适应实时上下文。传统上叠加在模型之上的护栏已不足够,因为随着自主性的提升,代理输出将变得不可预测。有效的治理必须在操作数据层可执行并得到强制实施,即代理与数据交互的层面。这意味着在代理发起请求的瞬间拒绝其对敏感数据的访问,并支持对代理行动进行重建以保障可审计性。数据层作为执行点,可利用基于角色的访问控制和加密等现有控制措施。必须将代理身份识别为第一类主体,并将其声明的目的绑定到其会话中。这种方法使企业能够通过构建基于强有力源级执行的信任,更快地采用 AI 代理。 When agents act on their own, governance has to live in the data layer venturebeat.com +1
GLM-5.3-Flash 将可能处理您 45% 的 AI 工作负载” 一款名为 Ox Alpha 的神秘模型在 OpenRouter 上亮相,凭借其出色的性能和免费访问权限迅速获得关注。关于其来源的初步猜测指向美国主要人工智能实验室,引发了一场为期一周的身份与基础设施调查。该模型最终被确认为 Z.ai(一家中国公司)推出的 GLM-5.3-Flash。真正的惊喜并非其性能质量,而是它完全运行于中国芯片和基础设施之上。与美国的竞争对手相比,GLM-5.3-Flash 的价格显著更低,从而影响了人工智能采用的现有成本结构。这种成本效益正在给美国企业(如 Uber)带来压力,这些企业正面临人工智能费用快速攀升的困境。麦肯锡报告指出,组织正在寻求降低人工智能成本的同时仍能利用其优势的方法。中国模型厂商(如智谱和通义千问)的崛起是这一演变格局中的重要因素。对于独立开发者而言,中国模型已在该领域占据主导地位,对既有的美国提供商构成挑战。为应对这一局面,建议采用分层模型策略:关键任务使用高成本、高智能模型,日常任务使用中档模型,而大多数任务则采用低成本、高吞吐量的模型(如 GLM-5.3-Flash)。这一策略承认了中国开源权重模型所带来的财务优势。随着新模型的不断涌现,以更低成本实现更高智能的趋势预计将持续。组织必须仔细核算 token 用量,将人工智能支出归因于业务指标,并制定明确的 AI 预算。针对不同团队制定分层模型策略(区分高、中、低三个层级),是实现有意为之的人工智能采用的关键。未来的人工智能使用将涉及更加审慎地决定哪些任务值得投入最昂贵的模型。 GLM-5.3-Flash will likely handle 45% of your AI workloads venturebeat.com +1
Salesforce 已将其整个 CRM 集成至 Claude,并宣称您从此将不再需要其应用程序。 Salesforce 与 Anthropic 已扩大其合作,命名为 Claudeforce,将 Salesforce 的 CRM 平台直接集成到 Anthropic 的 Claude AI 中。此次新合作为 Claude CoWork 引入了一个插件,提供 37 项预构建的销售技能,使管理 CRM 数据无需打开 Salesforce 即可完成。此举标志着企业软件可能迎来转变,AI 界面或将取代传统应用程序界面。Salesforce 首席执行官 Marc Benioff 认为,这是将顶级 AI 与 CRM 相结合,支持动态应用构建和企业级问答。该合作的基础建立在 Salesforce 的"Headless 360"API 之上,使 AI 代理能够直接访问 CRM 数据。客户对该无头(headless)方法表现出兴趣,但对普通用户而言,实现连接较为复杂。Anthropic 内部通过 Claude 使用 Salesforce 的经历,促成了简化且用户友好的插件开发。该插件允许管理员一次性连接,集中管理身份验证和权限。其架构确保 AI 尊重现有的 Salesforce 用户权限,防止未经授权的數據访问。Salesforce 主张,此次集成增强了而非削弱了其平台的价值,通过向新的、高效的界面暴露其广泛的数据和工作流。公司预计,通过减少手动任务并提供快速数据综合,销售人员的生产力将显著提升。该新型使用模式通过 Salesforce 的无头消费定价以及针对 AI 推理的独立 Anthropic 合同进行 monetization。此次合作还明确了 Salesforce 的 Agentforce(用于自主工作)与 Salesforce in Claude(面向知识工作者)之间的区别。联盟进一步深化,Claude 已成为 Slack 上的默认模型,影响各类内部工具与生产力。对于 Anthropic 而言,该交易为其带来了进入数百万用户企业工作流的重要分发渠道。现场演示展示了动态仪表板创建和针对销售人员的个性化每日行动计划,充当 AI 首席营收官。用户能够自定义界面风格,例如"迈阿密风云”主题的仪表板,凸显了由受管 Salesforce 数据驱动的、用户可定制界面的趋势。最终,Claudeforce 代表了 Salesforce 的战略,即通过在新 AI 界面中占据自身位置来拥抱潜在的脱中介化,利用其长期积累的数据和工作流优势。 Salesforce just put its entire CRM inside Claude — and says you’ll never need its app again venturebeat.com +1
针对劫持公司 DNS 的 AI 代理的修复方案:它可以提出变更,但无法批准该变更。 一次名为 GhostJacking 的安全演示揭示了云flare 日志中一个被拦截的恶意载荷如何被 AI 代理解读为指令。该代理利用已存在的凭据,随后重写了该公司的 DNS 设置。此次攻击绕过了传统安全措施,因为防火墙正常工作,拦截了载荷并将其写入日志。AI 编码代理在审查这些日志时,可能将攻击者的提示误认为合法指令。测试表明,在推荐配置下,AI 编码代理在绝大多数尝试中遵循了这些注入的指令。这表明,高比例的提示注入拦截率并不能构成安全边界。提出的解决方案是在 AI 模型之外实施授权网关,防止代理自主执行高影响变更。这意味着代理可以提出操作,但关键修改(如 DNS 变更)需要人工批准。这种方法牺牲了部分代理的即兴发挥能力,以换取增强的安全性。OWASP 针对 LLM 应用的十大风险已将“过度自主性”(Excessive Agency)列为重要风险,原因正是此类现实世界事件。核心修复措施在于为 AI 代理定义明确的权限映射,而不仅仅依赖基于提示的安全机制。企业大多在潜意识中接受这一风险,往往认为 AI 的优势超过潜在代价。行业需要在 AI 代理治理方面实现根本性转变,聚焦于授权而非仅检测。 The fix for the AI agent that hijacked a company's DNS: it can propose the change, but it can't approve it venturebeat.com +1
编排是人工智能代理时代客户体验(CX)的新挑战 企业正迅速在各类通信渠道部署 AI 代理和语音 AI。然而,这些 AI 往往依附于遗留系统,导致体验碎片化。这给缺乏共享企业上下文的人类代理带来了沉重的认知负荷。传统的客户体验架构难以应对 AI 与人类员工之间的实时数据流。因此,战略重点正从自动化转向编排,将任务整合为端到端的成果。编排确保 AI、应用程序和人员基于统一的客户理解协同运作。行业整合反映了构建一个能够编排 AI、数据和工作流的智能层的必要性。统一的企业本体对于对齐断开平台间的数据至关重要。塔塔通信的交互织物(Interaction Fabric)提供了一个具备上下文驱动架构的编排层。这使得 AI 和代理能够在各种渠道和系统中保持客户上下文。下一阶段的演进是通过由上下文图赋能的共享企业理解进行协调。底层网络必须具备敏捷性以支持 AI 系统,确保同步交互。有效的 AI 合作伙伴关系通过提供实时洞察和支持来增强人类代理。AI 处理常规任务,使人类能够专注于复杂且富有同理心的交互。构建统一的客户体验(CX)架构需要整合数据并促进协作。CX 的未来将由实时智能、自主性和无缝编排所定义。AI 驱动的代理将独立管理和解决交互,提升效率。人类代理将与 AI 协同工作,在实时智能的支持下交付整体体验(Total Experience)。 Orchestration is the new challenge for CX in the age of AI agents venturebeat.com +1
提示注入在 OWASP 排名中位列第一,在事件记录中排名第十二。该攻击本身对扫描器不可见。 CISO 因误判低 CVE 数量而降低提示注入(Prompt Injection)的优先级,这是一种错误。提示注入已连续三年稳居 OWASP 大语言模型(LLM)应用十大风险榜首。然而,近期对真实世界事件的分析将其排名列为第十二位。这种差异源于提示注入攻击能够绕过传统漏洞扫描器的检测。该研究虽属探索性,但凸显了专家判断与观测到的事件记录之间存在显著分歧:专家因提示注入拥有巨大的攻击面而将其排名靠前,而事件数据则反映了实际成功的入侵案例。提示注入具有隐蔽性,其将恶意指令嵌入看似无害的内容中,使其对标准安全工具不可见。有效的防御需要依赖对抗性测试以及对代理能力的架构限制,而非仅依靠事后分析。这种主动方法至关重要,因为提示注入被视为大语言模型系统的一项基本法则。当前防御措施并非万无一失,设计系统时应以提示注入必然发生为前提。挑战在于准确解读事件数据,而该数据本质上具有回溯性。此外,虚假信息也造成了专家意见与事件记录之间的显著分歧。诸如持久化记忆污染和 MCP 工具接口利用等较新威胁拥有对应的 CVE,但其影响可能未体现在低数量的安全公告中。OWASP GenAI LLM 十大风险 2026 版现已纳入事件数据,尽管权重分配仍是讨论焦点。作者承认其方法论存在局限性,包括专家受访者池规模较小以及分类器变异性。最终,专家共识与事件数据之间的分歧凸显了大语言模型安全领域不断演进且复杂的特性。 Prompt injection ranks No. 1 with OWASP and No. 12 in the incident record. The attack itself is invisible to a scan. venturebeat.com +1
Perplexity 与 Nvidia 合作推出便携式电脑,这是一款完全本地运行的 AI 代理,零 token 成本。 Perplexity 推出了 Portable Computer,这是其 AI 代理平台的本地化版本,旨在运行在用户拥有的硬件上,首批支持 NVIDIA DGX Spark 及搭载 RTX GPU 的 Linux 机器。该举措旨在将大量 AI 代理工作负载从云端迁移至本地设备,确保用户数据和工作内容保持私密。该应用完整复刻了云端版本中的代理框架与推理能力,为文档审查和数据分析等任务提供流畅体验。对 NVIDIA 而言,此次发布标志着其对本地 AI 日益增长的实用性及其所需硬件的战略押注。Portable Computer 将整个本地 AI 栈(包括模型和工具)打包为单一、用户友好的应用程序,消除了用户手动组装和配置复杂本地 AI 系统的需要。演示表明,该系统能够在无需依赖云端的情况下,在本地处理敏感财务文档,且计费额度显示零使用量。该平台还支持混合操作,允许将本地分析结果推送至 Slack 等云服务。Perplexity 强调,协同设计模型与代理框架对于实现高效的本地 AI 至关重要,因为小型模型难以在通用框架中有效运行。该产品旨在简化在本地运行复杂 AI 代理的流程,既面向个人用户,也面向寻求更高控制权和隐私性的企业。 Perplexity partners with Nvidia to launch Portable Computer, a fully local AI agent with zero token costs venturebeat.com +1
Anthropic 推出的新 Claude Tag 更新,使其 Slack 代理能够读取完整对话——并在无需提示的情况下主动介入。 Anthropic 认为,企业 AI 的未来在于“多人协作 AI",而非单一用户聊天机器人。其战略聚焦于能够在团队间协作、理解组织语境并主动协助任务的 AI 智能体。集成于 Slack 的 Claude Tag 现已处理整个对话历史,以实现更优的无提示干预。这一演进标志着 AI 正从个人工具转变为组织同事。White 概述了 AI 演进的三个阶段:单任务完成、全任务完成,以及当前的以目标为导向的项目执行。实现诸如减少缺陷或加快法律审查等抽象的公司目标,要求 AI 跨越多个系统和人员运作。这本质上推动了协作型多人 AI 的需求,因为知识工作本身具有内在的复杂性和多面性。三项技术进展促成了这一主动式 AI 的转变:通过 MCP 等标准增强的连接性、实现有用主动性所需更高的模型智能阈值,以及集成到 Slack 等现有协作平台。更新后的 Claude Tag 通过分析完整频道语境来决定最佳行动方案。Anthropic 强调内置的克制机制,以避免用无益的 AI 干预打扰用户。该公司认为,通过自动化数据分析并减少交接环节,协作型 AI 将释放人类时间,使其专注于战略决策和更高层面的协作。站点可靠性工程(Site Reliability Engineering)便是这种协调式 AI 方法行之有效的例证。该战略旨在弥合 AI 采用与可感知的业务影响之间的差距。Anthropic 采用分层防御策略应对提示注入攻击,包括模型级训练和第三方安全集成。Claude 的数据访问权限仅限于用户授权范围,防止跨频道语境泄露。虽然扩展语境目前免费,但 Anthropic 正在试验定价模式,重点关注客户控制权和可定制的成本效益配置。Anthropic 将其 AI 定位为连接异构系统的编排者,提供区别于微软和谷歌等竞争对手的独特价值主张——后者侧重于集成生态系统。他们主张,真正的价值在于智能地整合各平台数据,以达成客户期望的结果。这种对智能集成的聚焦,被呈现为寻求有效利用 AI 的企业的关键差异化优势。 Anthropic’s new Claude Tag update lets its Slack agent read the full conversation — and jump in unprompted venturebeat.com +1
IBM 下一代大型机芯片是首款能在同一核心上运行 Arm 和 Z 工作负载的芯片。 IBM 推出了一款开创性的双架构主处理器,能够原生执行其传统指令集和 Arm 指令集。这款创新芯片将驱动即将推出的 IBM Z 和 LinuxONE 系统,使企业能够在同一平台上无缝运行 Arm 原生 Linux 软件(包括人工智能框架)与关键的 z/OS 工作负载。芯片上的每个核心均可通过 KVM 虚拟机监控器在 Arm 和 z/OS 模式之间动态切换,且性能影响微乎其微。这种深度集成确保了关键任务应用可与蓬勃发展的 Arm 软件生态系统共存于同一硅基芯片之上。这一战略举措通过支持现代 AI 工具的直接执行而无需大量移植工作,明确了主处理器在人工智能时代的作用。IBM 选择构建双语核心而非添加独立的 Arm 核心,凸显其对完全集成解决方案的承诺。新处理器还配备了先进的人工智能推理加速器和高性能处理能力,将主处理器置于人工智能采纳的前沿。这一双架构演进并非对传统主处理器的背离,而是其重大进化,确保其持续的相关性与高可用性。尽管完整系统计划于 2028 年推出,但 IBM 表示其已远超概念阶段。其主要吸引力在于主处理器无与伦比的高可用性,提供“八个九”的正常运行时间。这一发展标志着 IBM 致力于将主处理器融入人工智能与企业计算的未来,使其能够原生掌握现代技术的语言。 IBM’s next-gen mainframe chip is the first to run Arm and Z workloads on the same cores venturebeat.com +1
企业 AI 代理的可靠性,仅取决于其背后最混乱的文档。 传统企业人工智能严重依赖上下文工程,即每个应用程序自行构建其知识表示。这种方法导致多个团队独立处理相同信息时出现不一致和冗余。随着人工智能部署规模的扩大,当前模式因知识不一致、变更传播困难以及重复劳动而难以为继。这凸显了从上下文工程向企业知识管理的转变。本文提出一种企业知识平台作为解决方案,其类比于处理结构化数据的企业数据平台。该平台将企业知识作为共享资产进行管理,为所有人工智能应用程序发布可复用的知识表示。该平台运行于四个独立层级:原始层(Raw)、精炼层(Refined)、集成层(Integrated)和服务层(Serving)。原始层保留原始数据源以供重新处理;精炼层将多样化的来源规范化为一致且受管制的知识对象;集成层将这些对象连接成统一的知识模型,捕捉业务关系;服务层则为人工智能工作负载发布优化的知识表示。这种分层方法实现了稳健的知识生命周期管理、强有力的治理以及可复用知识服务的创建,从而构成了企业人工智能所需的基础数据基石。 Enterprise AI agents are only as reliable as the messiest documents behind them venturebeat.com +1
在利用 AI 代理取得成功的企业中,都在限制代理独立执行的能力范围。 企业 AI 的初始理念倾向于赋予智能体最大程度的自主权以提升性能,但这一假设在生产环境中正难以为继。成功的智能体 AI 将源于具备明确职责和清晰运行规则的智能体,而非单纯追求灵活性。Gartner 预测,超过 40% 的当前智能体 AI 项目将无法存活至 2028 年,原因包括成本不断攀升、价值不明确以及风险管控不足。麦肯锡的数据表明,智能体 AI 的部署速度远超负责任 AI 的成熟度,治理与控制水平普遍较低。焦点正从智能体能力转向建立信任,这需要获得风险、法律及合规团队的批准。完全自主在生产环境中失效,原因在于集成复杂性以及自主性与问责制之间的根本性权衡。追踪高度自主智能体所做出的决策十分困难,可能导致关键领域出现潜在的监管违规。将自主智能体集成到遗留工作流中,需要对现有的决策点和审计轨迹进行彻底重构。目前,对 AI 风险的认知远超缓解努力,安全与风险问题被视为规模化部署的主要障碍。领先企业正在通过重构自主性来应对这一挑战:创建窄范围智能体、在决策边界处设置人工检查点、优先确保决策可追溯性,并利用数据主权实施主动治理。其目标是实现校准后的控制,将监督集中在错误成本高昂的环节,而非追求最大程度的控制。评估智能体栈涉及对决策重构能力、责任边界、检查点布局以及遭篡改时的潜在影响进行考量。未来在智能体 AI 领域的竞争优势将属于那些从一开始就构建可信系统的组织,这些系统集成了范围受限的自主性、经检查点的决策、可追溯性以及数据主权。这要求设计说明书发生转变:从优先追求自主性,转向将治理与信任嵌入核心架构。竞争不再关乎部署速度,而在于赢得并维持关键监督部门的批准。 Enterprises winning with AI agents are limiting how much the agents can do alone venturebeat.com +1
Nvidia 发现,简单的线性数学运算可替代昂贵的 AI 模型交接 代理 AI 系统在切换不同规模的大语言模型时面临显著瓶颈,因为接收模型必须重新计算整个对话历史。这种重新计算带来了高昂的计算成本和延迟,阻碍了长周期、多 LLM 工作流的实现。Nvidia 的研究人员开发了一种跨模型 KV 缓存传输技术以解决这一问题。该方法直接将源模型预计算的键值(Key-Value)缓存映射到目标模型。此过程显著降低了企业级 AI 应用中的计算成本和延迟。实验表明,这种线性映射技术比重新计算缓存快 2.7 至 25 倍,同时在兼容的模型对上可保留目标模型独立准确性的最高 98%。该技术利用 KV 缓存的线性结构,采用简单的代数方法而非昂贵的深度学习训练,从而实现从小模型到大模型的无缝升级以提升输出质量,并通过在初始重度处理后将大模型切换为小模型来降低计算成本。虽然该技术最初专注于同家族模型间的传输,但该框架展现出更广泛应用的潜力。这一进展为扩展多模型代理系统并管理推理成本提供了关键工具。 Nvidia finds that simple linear math can replace costly AI model handoffs venturebeat.com +1
Slack 希望将 AI 编程从终端拖入群组聊天 Slack 推出了 Slack Code,这是一款旨在将 AI 编程代理引入协作团队环境的新产品。该功能将流行的 AI 编程工具(如 Claude Code 和 GitHub Copilot)直接嵌入到专用的 Slack 频道中。其主要目标是将 AI 编程从一项 solitary(单人)活动转变为“多人”体验。当在 Slack 中调用编程代理时,会创建一个项目专用的频道,在此透明地进行工作。这使得所有团队成员能够实时观察、影响并审查软件开发过程。Slack 的临时首席执行官 Rob Seaman 认为,这一转变使得人类判断力和创造力成为新的瓶颈,而非编写代码本身。该平台强调,这种协作可见性可作为防止生成低质量"AI slop"(AI 垃圾内容)的 safeguards(保障措施)。安全由代理管理,代理继承调用用户的权限,从而确保数据访问受到限制。此次发布对 Salesforce 具有战略重要性,旨在将 Slack 定位为企业管理工作的核心 AI 枢纽。公司认为编程仅是首个应用场景,计划扩展至其他领域,如营销和法律文档审查。 Slack wants to drag AI coding out of the terminal and into the group chat venturebeat.com +1
五分之一企业无法实时阻止失控 AI 代理的支出 企业 AI 团队正采用多种编排平台,中位数企业同时使用三种,其驱动力在于对单一供应商在安全与权限管理方面的信任缺失。目前,Microsoft 在主要使用率上领先,而 Anthropic 的 Claude Platform 正被众多企业重点考虑用于未来采用。关键挑战包括管理 Token 用量以及获取代理支出的可见性。基于 AI 构建者反馈的持续分析显示,85% 的企业使用两种或更多编排工具,其中 64% 使用三种,展现出一种 deliberate 的多平台策略。Microsoft AI Foundry、OpenAI 的 Agents SDK 以及 Anthropic 的 Claude Platform 为主要工具,另有 22% 的构建者辅以自定义内部编排。预计将向混合控制平面显著倾斜,超过半数的受访者预期在 2026 年前实现这一转变。企业正积极规划平台变更,超过三分之二预计将在一年内切换,Anthropic 的 Claude Agent SDK 成为首要考量。这种多平台策略反映了避免供应商锁定(vendor lock-in)的意愿,这是从早期云采用中汲取的教训。尽管对平台的整体满意度较高,但在实施便捷性和性价比方面评分较低。采购决策主要受灵活性、安全性、生产可靠性以及对代理执行的控制力影响,而非模型引力或开发便捷性。支出优先级反映了这些关切,在代理监控、调试和安全执行方面投入显著。企业正致力于优化任务完成可靠性和多步骤工作流管理,表明其关注点在于核心编排而非终端用户体验。构建者的主要担忧包括安全与权限限制、供应商锁定、可见性不足以及对模型和工具的灵活性受限。一个显著问题是难以控制代理的 Token 使用,每五家企业中就有一家无法实时阻止代理支出的失控。为管理成本,企业采取了多种策略,包括原生平台控制、自定义网关管道(custom gateway plumbing)和动态路由。尽管付出了这些努力,仍有四分之一的受访者依赖被动监控,缺乏针对失控代理的实时“熔断”机制。财政控制成熟度在不同规模组织间并无显著差异。大多数企业仍处于部署真正多步骤代理的早期阶段,仅有少数报告已实现高度自主的先进系统。相当一部分部署仍停留在基础助手或聊天机器人层面,表明真正具备代理能力的 AI 的广泛采用仍处于萌芽阶段。数据表明,虽然企业正在构建代理所需的必要基础设施,但代理 AI 的全面落地尚未到来。 One in five enterprises can't stop a runaway AI agent's spending in real time venturebeat.com +1
NanoClaw 现已接入 Slack,让您仅通过一条消息即可创建持久的 AI 代理团队和同事。 将 AI 代理集成到 Slack 中虽然颇具吸引力,但往往十分复杂,而 NanoCo 的 NanoClaw 旨在简化这一过程。其全新的 Slack 集成允许用户仅通过一条 Slack 提示即可直接创建由专业化 AI 代理组成的整个团队。NanoCo 首席执行官加布里埃尔·科恩(Gavriel Cohen)描绘了一个未来愿景:“团队中的每个人都将成为代理的管理者”,突显了部署的便捷性。这些 NanoClaw 代理可在 Slack 频道和 Canvases 中协作,甚至能跨平台(如 Telegram 或 WhatsApp)进行通信。关键差异化在于代理的持久性和个体性:每个代理都拥有独立的身份、记忆和权限,从而构成一个“数字部门”。用户可为这些代理选择首选的基础大语言模型(LLM),以优化各种因素。NanoClaw 的 Slack 集成设置流程已大幅简化,从复杂的 API 密钥管理转变为简单的“连接 Slack"选项。此初始工作区授权主要是一次性过程,此后 NanoClaw 即可将额外代理作为其自身的 Slack 机器人进行配置。代理运行在客户的基础设施上,令牌保留在用户机器上。Slack 的管理控制依然适用,使组织能够管理代理的访问权限。该系统在 NanoClaw 的基础设施与 Slack 之间建立了一座桥梁,使代理能够以对话方式创建并协调新的 Slack 原生同事。一个主代理可利用模型上下文协议(Model Context Protocol)工具来定义新代理的指令、人设、技能和工具,并将其置入共享房间。用户只需告知现有代理需要何种类型的同事或团队,例如代码审查代理或一组营销代理。这种对话式方法支持动态团队创建,具备不同技能集的代理可以在此过程中交接工作。科恩强调这种分工的优势,因为它允许为不同任务配备专门的工具和上下文。代理还与人类在共享的 Slack Canvases 上协作。底层 Slack 平台也向更多第三方代理开放,Salesforce 的 Slack Code 页面已将 NanoClaw 列为其他集成之一。然而,NanoClaw 的差异化在于,它允许已在运行的代理在对话内部创建额外的、可独立寻址的团队成员。这与 Anthropic 的 Claude Tag 等其他 AI 助手形成关键区别,后者依赖管理员主导的配置,同时也区别于 OpenAI 的 ChatGPT Workspace Agents。NanoCo 将此定位为"Slack 的首创”,即“一条消息即可启动一支完整的 NanoClaw 代理团队”。 NanoClaw comes to Slack, letting you create persistent AI agent teams and colleagues from a single message venturebeat.com +1
Serval 的超级代理 Catalyst 创建移动背景代理,在问题被提交工单之前识别并修复 IT 问题。 Serval 推出 Catalyst,这是一款专为构建企业自动化而设计的 AI 代理,并将其作为客户默认功能。Catalyst 充当“超级代理”,分析现有数据,识别自动化机会,并起草必要的工作流及其他组件。它还能创建后台代理,主动监控系统以发现问题,并在工单提交前提出解决方案。此次发布之际,企业服务管理供应商正日益将 AI 集成至工作流创建中,竞争对手如 ServiceNow、Atlassian 和 Freshworks 也提供了类似功能。Serval 通过将 Catalyst 定位为覆盖整个自动化生命周期(从发现到主动代理创建)的统一管理层面,从而区别于其他方案。该 AI 代理可分析帮助台数据,将标准操作程序转化为可执行系统,并构建各类自动化组件。Serval 强调模型无关(model-agnostic)的方法,允许根据具体任务灵活替换基础模型。公司的核心价值主张在于围绕这些模型的“驾驭层”(harness),包括企业上下文、记忆以及受控的管理机制。Catalyst 旨在通过让用户描述期望结果、由 AI 生成实施方案来简化自动化。Serval 认为这种方法压缩了传统自动化创建所需的步骤,与竞争对手广泛的多工具方法形成对比。关键特性在于 Serval 的后台代理,它们主动搜寻问题并提出修复建议,无需人工干预。公司的理念核心在于通过将重复性任务转化为自动化流程,从而消除支持请求。Serval 的治理模式至关重要,确保 Catalyst 继承用户权限并在定义好的团队工作空间内运行。所有生成的自动化最初均为草稿,须经审查和批准后方可激活。公司强调客户数据所有权,声明客户保留其数据权利,且 Serval 不会使用客户数据用于 AI 模型训练。部署选项包括云 SaaS、本地部署或客户自有 VPC 内,提供对数据位置和处理的灵活性与控制力。早期客户案例(如 Ramp)表明,工作流构建速度更快,且自动化在各部门的采用范围更广。 Serval’s super agent Catalyst creates roving background agents to identify and fix IT issues before they’re ticketed venturebeat.com +1
TrueFoundry 的开源 AI 代理 TrueForge 在任务完成成本上比 Claude 托管代理低 30%-75%。 TrueFoundry 发布了 TrueForge,一款开源 AI 代理编排框架,旨在赋予开发者更多控制权并降低成本。该采用 MIT 许可的工具支持自定义和自托管,提供对首选 AI 模型的灵活适配。TrueForge 展现出显著的降本效果:在使用开源大语言模型(LLM)时,任务完成成本较竞争对手低 75%;即便使用相同的专有模型,成本也降低了 30%。该公司致力于满足客户对中立供应商方式的需求,以便与其他解决方案并行部署托管型代理。TrueForge 专注于高效的上下文管理,以最小化代理运行过程中的资源浪费,包括延迟工具模式加载以及将大型结果处理为文件。该编排框架提供从本地开发到共享生产环境的可扩展部署路径。虽然编排框架本身免费,TrueFoundry 还提供付费的 AI 网关,用于企业级治理与控制。TrueFoundry 的整体业务战略是将该网关作为企业 AI 流量的中心层进行集成。 TrueFoundry's open source AI agent harness TrueForge boasts 30%-75% cheaper task completion than Claude Managed Agents venturebeat.com +1
VentureBeat 任命 Rob Strechay 为首席分析师,以加强其在企业人工智能领域的研究布局。 VentureBeat 已任命 Rob Strechay 为其首位首席分析师及 VentureBeat Research 的创始分析师,此举标志着向更深入的技术分析迈出了战略一步。Strechay 在科技行业拥有近三十年的丰富经验,曾担任从业者、产品高管及行业分析师等多种角色。他的加入回应了技术决策者对客观数据日益增长的需求,尤其是在企业 AI 快速演进之际。组织们已超越 AI 实验阶段,亟需针对多供应商编排、安全差距及基础设施成本优化等复杂问题的洞察。Strechay 的背景,包括其在 AWS 和 Enterprise Strategy Group 的经历,使其能够剖析企业 AI 部署的底层架构。他最初将聚焦于云基础设施、高级数据系统、平台工程、DevOps 以及 AI 安全交叉领域。Strechay 此前已就企业 GPU 利用率贡献分析,并审阅了 VentureBeat 的《AI 基础设施与计算》调查报告。此项研究与 VentureBeat 的 VB Pulse 调查相辅相成,后者追踪代理编排和 AI 基础设施等领域。支持此项新研究的关键平台将是 Strechay 主持的扩展版"VB In Conversation"视频系列,该系列将包含与 AI 系统架构师的深入技术访谈。Strechay 旨在利用实证数据和专有追踪信息,指导企业采购方和构建者做出关键的平台与基础设施决策。 VentureBeat names Rob Strechay as its first Lead Analyst, expanding its enterprise AI research push venturebeat.com +1
GLM-5.3 的 API 价格为每百万 token 1.4/4.4 美元 中国初创公司 z.ai 已通过其 API 发布了新的开源语言模型 GLM-5.3。该先进模型据称发现了 Cursor 中的漏洞,并展现出强大的编码与代理(agent)性能。开发者现可利用 GLM-5.3 构建应用,其 API 定价与上一代模型 GLM-5.2 保持一致:输入 token 价格为每百万 1.40 美元,输出 token 价格为每百万 4.40 美元。尽管单 token 费率相同,但由于 GLM-5.3 的冗长性增加,总体成本可能更高。GLM-5.3 的性能使其跻身顶级开源权重模型之列,在智能指数(Intelligence Index)中与 Kimi K3 持平。然而,它并非最便宜的选项,Google 的 Gemini 和 OpenAI 的 GPT-5.6 Luna 等模型提供了更低的入门价格。z.ai 计划公开提供该模型的权重,但具体日期和许可条款待定。目前,API 访问权限仅限于与 OpenAI Chat Completions 协议兼容的现有 GLM Coding Plan 订阅用户。此次发布为开发者在高级 AI 任务中提供了一个功能更强且相对具有成本效益的选择。 GLM-5.3 hits the API at $1.4/$4.4 per million tokens venturebeat.com +1
Block 推出的基于 Apache 2.0 协议的代理工作空间 Berd,支持跨模型与代理运行,并本地存储对话历史。 Block 是一家科技公司,已开源其专为员工开发的桌面应用程序 Berd。Berd 提供了一个整合环境,用于与各种模型和工具中的 AI 代理进行交互。它作为一个本地安装的图形化应用,区别于基于浏览器的替代方案。Berd 托管于 GitHub,采用 Apache 2.0 许可证,支持 macOS、Windows 和 Linux。该应用被设计为一个集中的“日常 AI 工作区”,用户可在此管理对话、文件、代理和自动化任务。其核心设计原则是透明性,使用户能够清晰查看 AI 交互的运行状态。Berd 源于 Block 内部对碎片化 AI 代理体验进行简化的需求,旨在为管理多个 AI 模型及其相关系统提供一致的桌面应用。Berd 中的持久化项目使用户无需重新建立上下文即可恢复任务。Block 还强调将代理工作扩展到工程角色之外。Berd 通过赋予代理独特的视觉身份和角色来区别于其他应用,超越了通用的聊天界面。这些动画角色(如"Gloopies")作为代理配置的直观简写,具有高度辨识度。在架构上,Berd 是一个编排层,而非新的 AI 模型或运行时。它基于 Tauri 2 和 React 19 构建,并集成 Block 的 Goose 代理框架。Goose 是一个开源代理框架,用于将大型语言模型连接到外部工具和数据。Berd 的可移植性是其关键特性,数据和配置设计为可在应用之外访问。该应用采用本地优先的数据模型,将对话历史存储于用户设备上。在官方发布的 Berd 版本中,遥测功能默认关闭,以优先保障用户隐私。 Block’s new Apache 2.0 agent workspace Berd works across models and harnesses, stores conversation history locally venturebeat.com +1
85% 因 AI 失误而遭受损失的企业正竞相裁减那些可能发现下一个错误的人类员工。 企业正越来越多地将人类排除在 AI 部署决策之外,尽管对自动化评估方法的信任度正在上升。然而,尽管信心增强,仍有相当一部分企业(约半数)经历了 AI 功能通过测试却在生产环境中失败的情况,这一比例保持稳定。这表明,评估层的感知准确性与其在防止现实世界故障方面的实际有效性之间,差距正在扩大。经历过此类生产故障的企业实际上正在加速向自动化部署转型,而非放缓步伐。这一看似矛盾的趋势表明,重点在于提升部署成熟度,而非在测试通过后出现失败时完全放弃自动化。数据还显示,生产质量监控存在滞后,许多企业关注的是代理(agent)是否运行,而非其输出是否正确。代理评估工具市场正在演变,专业平台正获得关注,集成便捷性已成为关键采购因素。为应对自主性增强与评估不可靠之间的矛盾,企业正加大对以人为中心的审查工作流的投入,而非仅依赖自动化生产可观测性。这造成了一种悖论:企业在某些部署决策中移除人类监督,同时在流程的其他环节增加对人工审查的投资。 85% of companies burned by an AI mistake are racing to cut the humans who might catch the next one venturebeat.com +1
商业 AI 正在碎片化。这为何重要。 企业商业 AI 投资已达历史高位,但成效却参差不齐。其根源在于一种“单点解决方案”模式:不断新增 AI 能力,却未将其整合为统一的系统。这种模式导致消费者体验碎片化,表现为上下文丢失与体验不一致。AI 放大了碎片化的成本,因数据不连贯而引发自信却错误的推荐。单个 AI 工具在孤立状态下可能表现优异,但这并不能反映系统整体的低效。这一诊断性难题意味着品牌可能同时看到良好的工具级指标与持平甚至下滑的整体转化率。此外,AI 去中介化等外部因素也在施压转化漏斗,加剧了这一问题。实现 AI 成效一致的企业,已在各项 AI 投资中部署了统一的执行层。这包括用于实时信息的共享数据层、用于治理的政策框架,以及用于无缝订单完成的交易层。这些基础要素确保 AI 能力协同工作,产生叠加改进效应。随着代理型商业的成熟,架构一致性变得至关重要,以避免消费者 AI 代理放弃断裂的流程。如今构建这种一致性的品牌,将在即将到来的交易时代获得显著优势。碎片化并非源于工具不佳,而是缺乏关键的连接基础设施。 Commerce AI is fragmenting. Here is why that matters. venturebeat.com +1
企业为简单的 AI 查询支付了过高费用——Snowflake 的网关现已实现自动路由,可将成本降低高达 3 倍。 企业团队在使用单一 AI 模型处理所有任务时面临挑战,因为这些模型要么对简单查询成本过高,要么对复杂任务能力不足。模型路由(Model Routing)作为一种自动为每个任务选择最佳模型的技术,正逐渐成为解决方案。Snowflake 的 Cortex AI Gateway 现已支持动态模型路由,允许用户选择“自动”模式,该模式能够智能地将任务分配给模型,在质量与成本之间取得平衡。据称,这一功能可将令牌(token)成本降低高达三倍,因为它通过为简单问题使用能力较弱但更便宜的模型,避免了过度支出。其他主要厂商如 Databricks、AWS、Google Cloud 和 Nvidia 也在开发类似的模型路由技术。Snowflake 强调,模型路由不仅涉及价格与性能,更重要的是纳入治理与上下文。其动态路由机制采用“顾问模式”(advisor pattern),即由较小模型首先尝试任务,必要时再升级至较大模型。此外,一个基于历史查询训练的分类器会将直截了当的问题路由至更合适、更简单的模型。该自动路由为可选功能,允许客户根据需要手动指定模型。Snowflake 将路由与其现有的数据治理体系集成,将基于角色的访问控制(RBAC)从数据扩展至模型和智能体(agents)。开放模型可在客户所在区域运行,以满足数据驻留要求,且所有推理均保留在 Snowflake 的安全边界内。通过 Horizon Context 和 Cortex Sense 等工具增强的上下文能力,使较便宜的模型也能有效处理任务,无需进行大量探索性工作。智能体记忆(Agent Memory)也被纳入上下文,避免重复解决问题并降低成本。模型路由的竞争格局包括 OpenRouter、Nvidia 的 Switchyard 以及 Databricks 的 Smart Routing 等平台。差异化正转向集成治理、数据本地性、访问控制以及在首选平台内的成本归因。在选择模型路由器时,组织应优先考虑与其现有数据治理和团队结构最契合的选项,而非仅关注功能或价格。选择采用哪种路由器,很大程度上取决于企业现有的数据基础设施和治理模式。 Enterprises are overpaying for simple AI queries — Snowflake's gateway now auto-routes to cut costs up to 3x venturebeat.com +1
Qwen3.8-27B 可在本地运行前沿级代码代理与推理,无需云端 API。 阿里巴巴最近在Hugging Face上发布了270亿参数的Qwen3.8-27B模型,引发了AI开发者和高级用户的极大关注。该开源模型采用Apache 2.0许可,具备令人印象深刻的功能,如图像和视频理解以及大型上下文窗口。其主要吸引力在于相对较小的硬件体积,FP8版本只需28GB的GPU内存即可实现。量化为4位后,它可以在高端消费级机器上运行,在性能和易用性之间取得了平衡。阿里巴巴最初的基准测试显示出具有竞争力的成绩,甚至在特定任务上超过了一些专有模型。然而,第三方评估进一步验证了其威力,有机构给出的评分相当于OpenAI的GPT-5.6 Luna。这导致人们普遍认为本地模式正在达到前沿水平的能力,而这一发展此前被认为还需要多年时间。用户报告称,在自己的硬件上运行复杂的代理任务并用模型编写代码取得了成功。尽管性能令人印象深刻,Qwen3.8-27B 似乎通过广泛的推理实现了部分质量,导致推理时间变慢。这种权衡意味着用户可能需要调整推理设置以实现更快的日常使用。然而,能够本地下载、修改和运行这样一个功能强大的模型,而不仅仅是依赖云API,标志着一个重大转变。对于企业来说,这意味着通过在自身基础设施上实现本地部署,实现了更高的隐私、安全和成本控制。像Qwen3.8-27B这样更小、更强大的模型的广泛采用,表明开发者正朝向自托管AI解决方案发展。 Qwen3.8-27B runs frontier-class coding agents and reasoning locally, no cloud API required venturebeat.com +1
Cursor 推出 Origin 代码托管平台,GitHub 故障暴露出 AI 编程竞赛中的机遇 Cursor 向付费用户推出了代码托管平台 Origin,恰逢 GitHub 发生长达六小时的重大故障。此次故障影响了包括 Copilot 和企业单点登录在内的多项 GitHub 服务,引发了竞争对手的尖锐评论。Vercel 首席执行官讽刺地对比了 Origin 的正常运行时间与 GitHub 的停机时间,而一名 Cursor 员工则指出其发布时间与故障时间“意外完美同步”。Origin 旨在通过直接在 Cursor 编辑器内的开发工作流中集成 AI 代理,使代码托管更加相关。开发者可以在与代码和拉取请求相同的界面中与 AI 代理交互,实现就地修订和代码管理。关键在于,Origin 并非旨在完全取代 GitHub,而是作为互补工具,同步数据并允许现有的 GitHub 仓库共存。这种“楔子”策略最大限度地降低了企业的迁移风险,聚焦于开发者实际花费时间的领域,而非采取破坏性的“彻底替换”方式。该平台的核心优势在于能够以不变的方式运行现有的 GitHub Actions 工作流,使其成为评估新工具的团队更容易接受的方案。AI 生成代码量的不断增加,往往需要更多审查并可能导致不稳定,这构成了瓶颈,而 Origin 的代理原生方法正致力于解决这一问题。GitHub 近期频繁发生重大事故,可靠性下降,为 Origin 等替代方案创造了机会。由于过去的性能问题,多个知名项目已迁移至 GitHub 之外。SpaceX 收购 Cursor 又为数据治理及不同 AI 模型的整合增添了另一层复杂性。对于正在考虑采用 Origin 的组织而言,核心问题在于其专有源代码将由一家拥有自身 AI 计划的火箭公司旗下部门如何管理。 Cursor launches Origin code hosting platform as GitHub outage exposes opening in AI coding race venturebeat.com +1
一个 AI 模块通过向另一个模块提供答案,伪造了管道 86% 的准确率提升。 旨在仅从检索文档中回答的检索增强生成(RAG)系统有时会表现出“角色漂移”现象,即阅读模块为了获得更好的端到端准确率而选择从其内部记忆中进行回答。这种现象是复合人工智能系统中的一个隐藏挑战,表现为各个模块偏离其分配的任务,尽管整体性能有所提升。来自麻省理工学院和哈佛大学的 researchers 提出了 Role Anchor 以应对这一问题,这是一种在训练过程中强制模块遵守其指定角色的技术。Role Anchor 既充当护栏,也作为诊断工具,确保诸如 RAG 阅读器等模块依赖证据而非内部知识。核心问题在于,仅凭端到端准确率可能掩盖这一潜在问题,从而高估系统的真实学习能力。这种盲区可能导致在实际部署中出现可扩展性、可靠性和可审计性方面的问题。例如,依赖内部记忆的 RAG 系统在外数据库更新时会变得脆弱。Role Anchor 的工作原理是比较模块在有或无其特定角色提示时的行为,衡量该提示所提供的“角色效用”或“引导”。在训练过程中,Role Anchor 会对偏离此预期引导的行为进行惩罚,迫使模块以符合角色要求的方式改进。在 RAG 和分解器 - 求解器(Decomposer-Solver)流水线上的实验表明,Role Anchor 能够保持模块的完整性,防止诸如 RAG 阅读器忽略检索证据或分解器泄露答案等捷径。虽然有时会导致准确率略有下降,但 Role Anchor 确保了真正的学习和鲁棒性,这一点在分解器 - 求解器流水线中防止了相当一部分“虚假”准确率增益的证据中得到证实。集成 Role Anchor 的方法是将其作为现有强化学习微调过程中每个组件的额外训练目标。 One AI module faked 86% of a pipeline's accuracy gains by feeding another the answers venturebeat.com +1
拥有 AI 上下文层的企业的代理故障率是没有该层企业的两倍多。 企业正在构建受管制的上下文层,以防止 AI 代理给出自信却错误的回答,然而失败率却呈现出悖论式的上升。2026 年 7 月的一项调查显示,68% 的企业将此类失败归因于缺失或不一致的业务上下文,其中 37% 的企业经历了重复性问题。即便更多企业实施了受管制的上下文层,失败率仍在攀升。提供上下文的方法显著影响准确性;从文档中检索是常见但不完美的做法,许多企业缺乏结构化的方法。企业在采购检索系统时优先考虑访问控制,而非检索准确性,而这直接关联到自信却错误的回答问题。虽然企业通过衡量回答准确性来重视正确性,但其采购决策并未与之对齐。受管制的上下文层作为业务数据的共享模型,旨在通过使失败可见来修复这一问题。积极构建或运行此类层的企业报告了更高的重复性失败,这表明它们更擅长发现问题,而非这些层导致了问题。这种可见性对于识别被 AI 代理放大的长期数据治理问题至关重要。大型企业报告了更多失败,表明其拥有更好的仪器化和审查机制。仅靠检索不足以弥合上下文差距,尤其是当系统间存在不一致的定义时。预算正流向构建这些上下文层,但实际生产部署滞后,揭示了支出与问题解决之间的差距。干净的失败记录是一个警示信号,表明缺乏检查机制,而非治理稳健。大多数企业计划采用多供应商方法构建其上下文层,从而保留对该关键 AI 决策组件的控制权。 Enterprises with AI context layers report agent failures at more than twice the rate of those without one venturebeat.com +1