Gemini 3.7 Flash 于 2026 年 8 月 13 日正式上线并采用阶段性优惠定价。进入 9 月后,Google 又为该模型加入智能体式视频理解能力,使“是否迁移”不再只是比较每百万 Token 的标价,还要重新评估多轮调用、工具执行、长视频处理、失败重试和人工接管共同构成的单任务成本。根据 Google 于 2026 年 9 月 1 日更新的Gemini API 版本说明,该能力已经覆盖 Gemini 3.7 Flash 的 Interactions API 与 GenerateContent API。citeturn1search13
降价不等于总成本自动减半
Google 公布的阶段性价格为每百万输入 Token 0.75 美元、每百万输出 Token 3.75 美元,有效期截至 2026 年 12 月 31 日。公开价格页面在 2026 年 9 月 1 日仍显示这一费率,但团队做预算时不应将促销价视为固定成本,更不能简单得出“智能体费用减半”的结论。智能体通常需要反复规划、调用工具、读取返回结果并修正错误,输出长度和重试次数往往比输入单价更影响最终账单。相关当前价格与模型状态可查看2026 年 9 月 1 日更新的价格与规格记录。citeturn1search8
更实用的核算方式是统计“每个成功任务的成本”,而不是只统计“每次请求的成本”。建议记录完整任务的输入 Token、输出 Token、工具调用次数、失败重试次数、缓存命中率、完成时长和人工接管分钟数。若新模型单次调用便宜,却因为格式错误或工具参数不稳定增加重试,实际节省可能十分有限;反过来,如果任务一次完成率提高,即使推理过程略长,也可能减少人工复核和异常处理。
最新能力更新改变了哪些智能体场景
2026 年 9 月 1 日,Google 为 Gemini 3.7 Flash 发布智能体式视频理解能力。模型可以根据任务动态浏览视频时间线,并按需请求字幕、画面帧或音轨,而不是始终以固定方式处理全部内容。Google 表示,与静态处理方式相比,该机制在长视频场景中最多可减少 88% 的 Token 使用量。这里的“最多”属于特定条件下的官方结果,不能直接套用到所有视频,因此应以企业自己的视频长度、镜头密度和提问类型进行复测。citeturn1search13turn1search18
这一更新对会议录像检索、培训视频问答、媒体内容审核和设备巡检分析尤其值得关注。官方视频理解开发文档显示,Gemini 3.7 Flash 可处理视频摘要、信息提取、时间戳定位和基于视频内容的问答,并支持通过 File API、内嵌数据、云存储或公开视频地址提供素材。较大文件和需要重复使用的长视频更适合 File API,避免每轮对话都重新传递完整视频。citeturn1search18
响应质量应从结果正确扩展到执行可靠
评估智能体不能只看回答是否流畅。对于生产环境,响应质量至少包含任务理解、步骤规划、工具选择、参数生成、异常恢复、结构化输出和最终结果验证。尤其是涉及代码修改、企业数据写入或外部系统操作时,一段看似合理的解释并不能证明任务已经正确完成。
- 正确性:使用带标准答案或明确验收条件的真实任务,计算一次完成率和最终完成率。
- 稳定性:同一任务重复运行多次,检查工具调用顺序、结构化字段和结果差异。
- 响应效率:分别记录首个可见输出时间、完整任务耗时和工具等待时间,避免只比较生成速度。
- 异常恢复:模拟接口超时、权限不足、空结果和格式变化,观察模型能否停止危险操作并给出可执行的恢复方案。
- 安全合规:对写入、删除、付款、发布等高影响动作设置权限边界、人工审批、操作日志和回滚机制。
模型迁移应采用分流而非一次性替换
迁移第一步是固定测试集。可以从现网日志中抽取脱敏后的高频任务、长链任务和历史失败任务,同时保留原模型结果作为基线。第二步是在相同系统提示、工具定义、超时限制和最大输出长度下进行影子测试,避免因为参数不同而得到失真的比较。第三步只把低风险流量逐步切换到 Gemini 3.7 Flash,并设置自动回退条件。
视频能力上线后,还应单独建立长视频评测集。测试内容可覆盖会议中的决策点定位、指定人物发言检索、培训步骤提取以及异常画面追踪。除答案准确率外,还要比较实际 Token 消耗、时间戳偏差、遗漏率和处理时长。官方文档建议大文件或需要多次复用的视频使用 File API,这类输入方式的差异也应纳入成本测试。citeturn1search18
推荐将迁移门槛定义为:关键任务正确率不下降,单任务综合成本可控,延迟满足业务要求,严重错误能够被拦截,并且所有高风险工具调用可审计、可暂停、可回滚。
内容与合规边界不能交给模型自行判断
面向中文论坛或公开信息服务部署智能体时,应以“九不准”和“七条底线”所强调的法律法规、公共秩序、社会道德、信息真实性与公民合法权益为基础约束。模型迁移后需要重新执行安全回归测试,不应直接沿用旧模型的审核结论。涉及违法有害信息、谣言、侵权、隐私泄露、歧视性表达及可能危害公共安全的输出,应通过输入检测、来源校验、生成后审核和人工复核形成多层防线。
对于视频、会议记录和企业文件,还要遵守最小必要原则。上传前进行隐私识别与脱敏,限制智能体可以访问的数据范围,明确文件保存周期,并记录模型调用、工具操作和人工审批过程。降价只能降低推理支出,不能成为扩大数据采集范围或弱化权限控制的理由。
总结
Gemini 3.7 Flash 的阶段性低价为智能体试验提供了更低门槛,而 2026 年 9 月 1 日上线的智能体式视频理解进一步拓展了长视频检索和多模态工作流。真正合理的迁移决策,应同时考察成功任务成本、响应质量、异常恢复、工具调用安全和促销期后的长期预算。较稳妥的策略是先建立真实任务基线,再进行影子测试和小流量分流,最后依据可审计的数据决定迁移范围,而不是因为发布价格下降就直接替换生产模型。
事件或资料日期
- 2026 年 9 月 1 日:Google 发布 Gemini 3.7 Flash 智能体式视频理解更新,参见Gemini API 版本说明。citeturn1search13
- 2026 年 9 月 1 日:Google 更新 Gemini 3.7 Flash 视频处理示例与输入方式说明,参见视频理解开发文档。citeturn1search18
- 2026 年 9 月 1 日:公开价格与规格记录显示模型处于可用状态,阶段性费率为每百万输入 Token 0.75 美元、输出 Token 3.75 美元,参见价格与规格记录。citeturn1search8