美国谷歌发布Gemini 3.7 Flash,API降50%
2026-08-14 09:46
收藏

维度网讯,谷歌(Google)发布新一代主力模型Gemini 3.7 Flash,将编程、智能体工作流和知识工作作为升级核心,并将API价格暂时下调一半。距Gemini 3.6 Flash发布仅三周,这一异常短暂的产品周期被谷歌归因于开发者反馈与算法改进。对企业开发者而言,更受关注的是智能能力提升与推理成本下降的组合:截至2026年12月31日,Gemini 3.7 Flash输入Token价格为每百万0.75美元,输出Token价格为每百万3.75美元。

Gemini 3.7 Flash 摄像头插图

从2027年1月1日起,价格将上调至输入Token每百万1.50美元、输出Token每百万7.50美元;上下文缓存成本也从首发期的每百万Token 0.075美元升至0.15美元。这意味着折扣只是暂时性的,但给了部署大规模编程与业务智能体的团队几个月时间,评估谷歌所称的“减少重试和人工监督”能否转化为更低的总运营成本。

谷歌 Gemini 3.7 Flash 定价图表

谷歌将Gemini 3.7 Flash称为“迄今为止面向编程和智能体最智能的主力模型”,强调该模型在遇到障碍时更擅长适应、必要时会澄清意图,并以更高保真度遵循指令。在企业编程智能体场景中,一个能减少不必要更改、从错误中恢复并更可靠执行多步计划的模型,可以直接降低人工干预频次;跨文档和应用程序运行的业务智能体同样受益于此。相比Gemini 3.6 Flash减少推理步骤、对话轮次和工具调用的设计思路,3.7 Flash把更多精力投入多步规划和工具调用,目标是更严谨的执行与更少的重试。谷歌DeepMind(Google DeepMind)表示,该模型在调试和问题解决方面有所提升,可以用更少的提示生成更实用的网页布局和应用程序,并在真实业务工作流中提高推理与准确性。

编程基准测试出现明显提升。在衡量生产代码质量的FrontierCode 1.1 Main上,Gemini 3.7 Flash得分43.6%,高于Gemini 3.6 Flash的34.4%,也略高于谷歌报告的Claude Sonnet 5(42.7%)和GPT-5.6 Terra(41.3%)。在长期软件工程评估DeepSWE v1.1上,3.7 Flash达到65.3%,前代产品为49.0%,而GPT-5.6 Terra以69.6%领先。网页开发方面,Gemini 3.7 Flash在Code Arena上的Elo得分为1588,高于3.6 Flash的1538、Claude Sonnet 5的1541和GPT-5.6 Terra的1523;谷歌称新模型能用更少提示生成更实用的布局和功能完整的应用,并更紧密遵循参考截图、图片和设计系统。

更广泛的基准测试结果则呈现复杂局面,这对企业按具体工作负载选型有实际参考价值。Gemini 3.7 Flash在Terminal-bench 2.1上得分85.8%,低于GPT-5.6 Terra的87.4%;Terra还在Terminal-bench 3.0和OSWorld-2.0上保持领先。Claude Sonnet 5在Agent's Last Exam的多模态桌面和操作系统任务中以33.3%的通过率领先,Gemini 3.7 Flash为26.3%。换言之,谷歌自身的数据并未显示3.7 Flash全面取代价格更高的竞品,而是表明该模型在编程与智能体工作负载上更具竞争力,同时定价档位更低。

企业工作流表现是更实际的检验维度。在衡量企业工作流自动化的AutomationBench上,Gemini 3.7 Flash得分30.4%,明显高于3.6 Flash的17.0%;谷歌表格中Claude Sonnet 5为10.7%,GPT-5.6 Terra为23.6%。在评估复杂PDF理解的GDP.PDF上,该模型达到34.0%,高于3.6 Flash的22.0%、Claude Sonnet 5的28.0%和GPT-5.6 Terra的24.7%。这些能力组合对企业智能体意义重大,因为实际部署往往涉及解读长报告、识别相关信息、调用工具、更新系统并生成人工审核文档的完整链条,链条可靠性比孤立推理基准得分更关键。

HPniMGObsAAuBbD

谷歌正通过Gemini Spark落地这一思路。Google AI Pro和Ultra订阅用户可以在个人AI智能体Spark中使用3.7 Flash,改善Google Workspace应用中的知识工作和工具使用,包括整合文件、起草电子邮件和更新状态文档等工作流。企业用户还可通过Gemini Enterprise Agent Platform和Gemini Enterprise应用获得该模型。

首发定价被看作是嵌入企业工作流的显著尝试。作为对比,Gemini 3.6 Flash的标准API定价为每百万输入Token 1.50美元、每百万输出Token 7.50美元;Claude Sonnet 5分别为2美元和10美元,GPT-5.6 Terra为2美元和12美元。对自主智能体而言,单次用户请求可能触发一长串模型调用、推理Token和工具交互,每Token成本更低但重试次数显著增加的模型不一定更便宜。谷歌将更低首发Token定价与所谓的首次通过准确率提升结合,若这些优势延续到生产环境,可能实质性改变大规模编程或文档处理智能体的运行成本。企业团队最终应关注的指标并非孤立的每百万Token价格,而是每成功完成任务的成本。

Gemini 3.7 Flash发布之际,外界正在讨论谷歌在AI前沿是否失去优势。谷歌尚未发布Gemini 3.5 Pro——该模型曾在5月被表述为将于次月推出,到7月又改为仍在合作伙伴测试中,周四的公告没有提供进一步时间表,因此谷歌最新发布的通用Pro模型仍是2月推出的Gemini 3.1 Pro。该模型此前被报道因未达到内部目标(尤其是编程方面)而错过原定计划,谷歌已开始训练其称为“最雄心勃勃”的Gemini 4。

这一系列延迟恰逢谷歌宣布对AI领导层进行重大调整。谷歌DeepMind联合创始人、诺贝尔奖得主德米斯·哈萨比斯(Demis Hassabis)转任该部门主席并出任Alphabet首席科学家,不再负责日常管理;前DeepMind首席技术官Koray Kavukcuoglu以高级副总裁身份运营该部门,直接向首席执行官桑达尔·皮查伊(Sundar Pichai)汇报。Kavukcuoglu负责Gemini模型开发、前沿研究、Gemini应用和开发者团队,将整个Gemini产品链整合到一位更偏产品导向的高管手中。首席科学家杰夫·迪恩(Jeff Dean)、Gemini联合负责人奥里奥尔·维尼亚尔斯(Oriol Vinyals)、Quoc Le和桑贾伊·格马瓦特(Sanjay Ghemawat)离职创办研究初创公司Discovery Loop;此前,Gemini联合负责人诺姆·沙泽尔(Noam Shazeer)已跳槽至OpenAI,诺贝尔奖得主、AlphaFold科学家约翰·江珀(John Jumper)转投Anthropic。路透社此前报道将发布放缓和编程短板归因于内部分歧、受限的计算资源分配以及谷歌的官僚体制。

外部对此解读不一。SemiAnalysis认为,谷歌越来越优先考虑向AI公司(包括Gemini的竞争对手)提供云基础设施这一高利润业务,而非将自己的模型保持在前沿;该分析还称谷歌实际上取消了3.5 Pro,但谷歌并未确认这一点,并继续表示该模型被推迟。The Verge给出了更审慎的判断:离职和模型延期确实严重,但谷歌通过搜索、Workspace、Android、云计算、定制AI芯片和消费者分发仍保有巨大优势;Gemini应用月活跃用户已超过9.5亿,其触达范围并不完全依赖排名最高的模型。Artificial Analysis的整体模型智能指数将Claude Opus 5评为63分,谷歌报告Gemini 3.7 Flash得分为56分,较3.6 Flash的52分有所进步。Arena的早期人类偏好结果显示3.7 Flash暂列第9位,网页开发排在第8位。

开发者可通过Google AI Studio、Android Studio中的Gemini API以及谷歌的Antigravity环境访问Gemini 3.7 Flash;企业可通过Gemini Enterprise Agent Platform和Gemini Enterprise进行部署,Google AI Pro或Ultra订阅用户可在支持国家通过Spark使用。谷歌同步更新了保障措施,涵盖化学、生物、放射性和核风险以及网络攻击滥用。

从Gemini 3.6 Flash到3.7 Flash的快速跃迁表明,算法改进无需等待新的旗舰代际即可进入生产产品。对开发者而言,这种节奏也带来运营层面的要求:生产团队在更换部署前,仍需针对自己的代码库、提示、工具架构和故障模式对新版本做基准测试。谷歌自身数据显示,该模型在生产级编程、网页开发、文档理解和工作流自动化方面均有较大改进,但并未宣称全面领先。通过首发定价,谷歌实际是在押注开发者会看重一个“与更昂贵系统足够有竞争力、同时足够便宜可反复运行”的模型。这一优势在2027年1月恢复全价后能否延续,将取决于3.7 Flash在实际任务中的可靠性,而非排行榜名次。

本文来自全球互联网及战略合作伙伴信息的编译与转载,仅为读者提供交流,有侵权或其它问题请及时告知,本站将予以修改或删除,未经正式授权严禁转载本文。邮箱:news@wedoany.com