Gemini 3.7 Flash API

活跃
google/gemini-3.7-flash
Google DeepMind发布日期: 8/13/2026

Gemini 3.7 Flash 是 Google DeepMind 推出的快速、高性价比的多模态主力模型,适用于编码、智能体以及复杂的长上下文任务。

$0.1875/$0.9375每百万token

Gemini 3.7 Flash API 背景介绍

概述

Gemini 3.7 Flash 是 Google DeepMind 最新的 Flash 系列主力模型,于 2026-08-13 发布,作为 Gemini 3.6 Flash 的直接继任者。Gemini 3.7 Flash API 专为需要更强编码能力、代理式执行和复杂多步推理,同时又不牺牲 Flash 级速度的高吞吐生产场景而设计。它是原生多模态模型,支持文本、图像、视频、音频和 PDF 输入,输出文本,并支持 1,048,576 个 token 的上下文窗口以及最多 65,536 个输出 token。它面向需要大规模、可靠的软件工程、文档分析和工具调用自动化的开发者与企业。

发展历史

Gemini 3.7 Flash 在 Gemini 3.6 Flash 发布约三周后上线,属于算法升级,而非完整的新预训练周期。Google DeepMind 将其定位为最强的 Flash 主力模型,面向编码、代理工作流以及金融、法律和生物科学分析等知识密集型任务。此次发布重点提升了生产代码质量、长程软件工程、Web 开发,以及对编译错误、测试失败和终端输出等执行失败的恢复能力。Gemini 3.7 Flash API 现已在 Google 的开发者和企业生态中全面可用,并且正日益成为 Google 工具中的默认 Flash 选项。

关键创新

  • 更强的多步工作流代理可靠性,包括对编译错误、测试失败和迭代调试循环的更好恢复能力
  • 软件工程和 Web 开发质量显著提升,包括更高的一次通过代码准确率和更好的设计到代码一致性
  • 原生多模态输入支持,结合生产级 API 工具能力,如函数调用、代码执行、结构化输出、缓存和搜索增强

Gemini 3.7 Flash API 技术规格

架构

Gemini 3.7 Flash 是 Gemini 3 Flash 家族中的原生多模态文本输出模型。Gemini 3.7 Flash API 支持文本、图像、视频、音频和 PDF 输入,适合将软件工程、文档理解和多模态分析结合起来的统一应用管线。它提供 1,048,576 个 token 的上下文窗口和最多 65,536 个输出 token,并支持低、中、高三档可配置思考级别。该模型还集成了面向生产的 API 功能,包括函数调用、代码执行、搜索增强、Google Maps 增强、文件搜索、URL 上下文、结构化输出,以及显式或隐式缓存。

参数

在所提供的研究背景中,Google DeepMind 尚未公开 Gemini 3.7 Flash 的参数规模。可以明确的是其产品规模和部署定位:它是一个 GA 级 Flash 模型,针对快速、成本高效的生产负载进行了优化,而非追求最高延迟的前沿推理。Gemini 3.7 Flash API 被定位为 Gemini 3.6 Flash 的算法改进继任者,其更强的编码和代理性能来自 3.6 之后的模型改进,而不是一次全新的预训练。

功能

  • 跨文本、图像、视频、音频和 PDF 的原生多模态理解,支持长上下文处理大型代码库和文档集合
  • 面向代理的高级 API 工具能力,包括函数调用、代码执行、结构化输出、搜索增强、文件搜索、URL 上下文和缓存
  • 强大的软件工程表现,适用于调试、代码生成、测试驱动迭代、设计到代码工作流以及长时间运行的开发任务
  • 在金融、法律分析、生物科学和复杂文档推理等知识密集型任务上处理能力更强

局限性

  • Gemini 3.7 Flash API 仅输出文本,不支持音频生成或图像生成
  • 它不支持 Live API,且其思考模式包括低、中、高,但不包括 minimal

Gemini 3.7 Flash API 性能

优势

  • 相较 Gemini 3.6 Flash 的基准测试显著提升,包括 FrontierCode 1.1 Main 从 34.4% 提升到 43.6%,DeepSWE v1.1 从约 49% 提升到 65.3%,WebDev Arena Elo 从 1538 提升到 1588,GDP.pdf 从 22.0% 提升到 34.0%,以及 Artificial Analysis Intelligence Index 从 52 提升到 56
  • 在真实世界的编码和代理场景中表现尤为出色:更高的一次通过代码准确率、调试过程中的自主恢复能力更强、设计一致性的 Web 生成更好,以及多步任务完成更可靠

实际效果

在实际应用中,Gemini 3.7 Flash 更像是一个高效的生产级模型,而不是一个只针对基准测试优化的系统。Gemini 3.7 Flash API 在模型必须读取大量上下文、调用工具、反复修正错误并持续推进到明确终态的工作流中尤其有效。这使其非常适合代码助手、内部工程代理、文档密集型企业工作流以及前端生成系统。它相较 Gemini 3.6 Flash 的提升表明其稳定性更好、编排开销更低,同时在部分编码和 Web 开发评测中仍能与更强的高端模型保持竞争力。

Gemini 3.7 Flash API 适用场景

应用场景

  • 你有一个软件工程工作流,涉及大型代码库、失败的测试、编译器消息以及反复调试循环。Gemini 3.7 Flash API 是理想选择,因为它明确针对编码和长程代理式执行进行了优化,能够检查上下文、调用工具、生成修复方案,并在更少人工干预下从错误中恢复。这有助于团队提高一次通过代码质量、减少开发者来回沟通,并加速 bug 修复、重构、测试生成和内部开发助手自动化等任务。
  • 你的产品团队需要将设计素材、截图和规格说明转化为高保真的 Web 界面。Gemini 3.7 Flash API 很适合这种场景,因为它将多模态理解与更强的 Web 开发性能和比前代更好的设计一致性结合在一起。它可以解析视觉输入、跨长需求文档进行推理,并生成面向生产的前端代码。这对于快速原型设计、将线框图转为可用界面,以及以更快的迭代周期对照设计系统审查实现质量都很有帮助。
  • 你有一个文档密集型业务流程,涉及法律审查、财务分析、生物科学研究或企业知识运营。Gemini 3.7 Flash API 是一个强有力的选择,因为它可以摄取长 PDF 和多模态证据,应用结构化输出,并支持在多步工作流中进行有依据的工具使用。这使团队能够提取发现、比较文档、总结复杂材料,并自动化分析师支持任务。其结果是在保持生产规模企业集成所需灵活性的同时,提高知识密集型工作的吞吐量。

最佳实践

  • 在多步工作流中,结合函数调用、代码执行、结构化输出和缓存等工具编排功能使用 Gemini 3.7 Flash API,以最大化可靠性
  • 处理长上下文编码或文档任务时,提供明确的任务结构、工件和成功标准,并根据任务复杂度选择合适的思考级别

技术规格

上下文长度1,048,576
发布日期8/13/2026
输入格式
textimagevideoaudiopdf
输出格式
textjson

功能特性

功能
multimodal inputtext generationcode generationsoftware engineeringagentic workflowsmulti step reasoningfunction callingcode executionsearch groundinggoogle maps groundingcomputer usefile searchurl contextstructured outputscachingdocument analysisweb development
支持的文件类型
.pdf.jpg.jpeg.png.webp.gif.mp3.wav.mp4.mov.txt