《如何挑选 AI 编程模型——2026 年初创公司 CTO ... 笔记

《如何挑选 AI 编程模型——2026 年初创公司 CTO 指南》

作者的基建账单因单一代码助手 API 的高昂成本而变得极其昂贵,这促使他们调查替代模型及其实际性能。他们在五项常见工程任务上对十种模型进行了基准测试,以评估其成本效益。研究发现,关于“业界最佳”模型的营销宣传并不可靠。目标是找到针对特定工作负载能带来最佳投资回报的模型。该基准测试通过对模型在正确性、代码质量、文档和边缘案例方面的评分,再除以其每百万 token 的输出成本,计算出“每美元得分”这一指标,该指标对于识别高效模型至关重要。作者发现,在常见任务上,专用且廉价的模型往往优于昂贵且通用的模型。然而,对于复杂推理或关键代码审查,高端模型则展现了其价值。测试表明,不同模型擅长不同类型的任务,从而催生了路由策略。作者现在根据提示的复杂性和性质,将请求定向到特定模型。这种方法据估计将 API 支出减少了 87%。此外,还提到了类似 Ga-Standard 的路由模型,作为那些不想自行构建路由逻辑者的选项。关键启示是避免供应商锁定。通过使用统一的 API 层,作者可以在价格变动或性能下降时轻松切换模型。这种抽象确保了灵活性,并避免了昂贵的迁移成本。作者主张采用与 OpenAI 兼容的接口作为标准,以最小化集成成本。最终,基准测试过程带来了显著的成本节约,并形成了更稳健、更具适应性的 AI 代码助手策略。