Google 的 Gemini 3.6 Flash 模型在长周期工程任务中可将 AI 代理的 token 成本降低高达 65%——而 3.5 Pro 版本即将推出。
Google DeepMind 推出了三款新的专有 AI 模型:Gemini 3.6 Flash、Gemini 3.5 Flash-Lite 和 Gemini 3.5 Flash Cyber。这些模型旨在实现更高的 token 效率,使 AI 代理在规模化部署时更加快速、智能且运营成本更低。Gemini 3.6 Flash 的定价为每百万输入 token 1.50 美元,每百万输出 token 7.50 美元;而 Gemini 3.5 Flash-Lite 则显著更便宜,分别为每百万 0.30 美元和 2.50 美元。相比之下,之前的模型如 Gemini 3.1 Flash-Lite 仍是最具成本效益的,但速度较慢。新的 Gemini 3.5 Flash-Lite 为优先考虑性能而非绝对最低成本的企業提供了更快的速度。Gemini 3.6 Flash 和 3.5 Flash-Lite 实现了显著的效率提升,在某些基准测试中 token 使用量减少了高达 65%。这些模型具备 100 万 token 的输入上下文窗口和 64,000 token 的输出限制。Gemini 3.6 Flash 适用于复杂的编码和知识型工作,而 3.5 Flash-Lite 则在高吞吐量、低延迟应用中表现卓越。Gemini 3.5 Flash Cyber 是一款专为网络安全研究设计的专用模型,仅向选定合作伙伴开放。所有这些模型均为专有且闭源,仅可通过 Google 的 API 访问。值得注意的是,备受期待的旗舰模型 Gemini 3.5 Pro 仍在进行合作伙伴测试。此次发布表明重点转向代理式 AI 能力,Flash 系列被比作高效的经济型货车,而旧款模型则如同耗油较多的传统车型。