DeepSeek V4 Flash API 成本:思维模式破... 笔记

DeepSeek V4 Flash API 成本:思维模式破坏严格 JSON

DeepSeek V4 Flash 在 0731 版本中存在一个缺陷:当启用思考模式时,结构化 JSON 输出中的整数字段可能出现损坏。该问题仅在严格 JSON 模式下发生,且在多数测试运行中均被观察到。禁用思考模式可解决损坏问题,并显著降低 token 用量。然而,0731 次重训在禁用思考模式时,会导致多步任务的性能出现更明显的下降。该模型具备缓存机制,存储 1,024 token 的页面,命中响应迅速,且条目至少保留 45 分钟。定价保持一致,输入 token 为每百万 0.14 美元,输出 token 为每百万 0.28 美元,缓存命中价格显著更低。与其他 V4 版本相比,0731 版本受结构化输出损坏的影响最为严重。API 上的 effort 拨杆未产生可测量的性能或 token 用量差异。对于 0731 版本,双跳数学等复杂任务现在高度依赖启用思考模式。上下文窗口容量可观,可容纳大型提示,输出限制似乎可协商。需要可靠结构化输出的用户,在缺陷修复前应在 0731 版本上禁用思考模式。