← Back to all posts

9 min readUpdated 20 May 2026
Gemini 3.5Gemini APIAI AgentLLM 选型开发者指南

一文读懂 Google Gemini 3.5/3.1 家族:开发者选型与避坑指南 (2026最新版)

Yap Wei JunSoftware Engineer · Singapore

Listen to this article

AI-generated voice10:55

Download MP3

Generated Image May 20, 2026 - 12_20PM

目标:帮助新手与架构师快速理解 gemini-3.5-flash 和其他前沿 Gemini 模型,明确在何种场景下选择哪款模型,以实现性能与成本的最佳平衡。


一句话结论

目前 Google Gemini API 的最新主线已演进至 Gemini 3.5。当前正式可用(Stable)的主力旗舰模型是 Gemini 3.5 Flash,其 API 标识符(Model Code)为:

gemini-3.5-flash

快速选型一览表

核心需求推荐模型选用理由
复杂 Coding、Agent、长任务、多步骤工具调用gemini-3.5-flash最新稳定版主力模型,速度极快,推理能力强,专为真实 Agent 工作流设计
最强 Pro 级推理、复杂软件工程、高可靠工具调用gemini-3.1-pro-previewPro 级预览模型,适合高难度、深深度推理任务
极低成本、海量简单任务、分类、抽取、翻译gemini-3.1-flash-lite极致性价比,响应极快,适合高频轻量级任务
需要旧版 Gemini 3 Flash 行为或 Computer Usegemini-3-flash-preview预览模型,支持 Computer Use(浏览器/桌面操作),非通用首选
语音实时双向对话gemini-3.1-flash-live-previewLive API 专用模型,支持低延迟音频交互
图片生成与编辑gemini-3.1-flash-image-preview<br>gemini-3-pro-image-preview图像生成专用模型,非普通文本模型

1. 旗舰主力:Gemini 3.5 Flash

📊 基本资料

项目内容说明
API Model Codegemini-3.5-flash
模型状态Stable (稳定版)
最新更新2026-05
知识截止2025-01
输入模态Text, Image, Video, Audio, PDF
输出模态Text
上下文输入上限1,048,576 tokens (1M)
单次输出上限65,536 tokens (64K)

🎯 适用场景

gemini-3.5-flash 是当前最值得优先接入的通用模型,几乎可以作为所有新项目的默认起点:

  • Coding Agent:代码编写、自动补全与中小型重构。
  • 多步骤工具调用:在复杂的 Agent 规划中稳定执行 Function Calling。
  • 长上下文任务:阅读超长文档、多文件关联分析、执行与验证。
  • 企业级工作流:ERP / CRM 等业务系统中的智能助手。
  • 高级特性支持:原生支持 Search Grounding(谷歌搜索增强)、Structured Output(JSON Schema 强约束输出)。

❌ 不适用场景

  • 无法直接生成或编辑图片。
  • 不支持 Live API 的超低延迟语音双向对讲。
  • 不支持 Computer Use(如需测试该功能,请使用 gemini-3-flash-preview)。

💰 资费标准(Paid Tier, Standard)

计费项单价
Input TokensUSD 1.50 / 1M tokens
Output Tokens (含 Thinking)USD 9.00 / 1M tokens
Context CachingUSD 0.15 / 1M tokens

⚠️ 注意:如果启用了 Google Search / Maps Grounding,超出免费额度后,将按实际 Search Query 额外计费。


2. 深度推理:Gemini 3.1 Pro Preview

📊 基本资料

项目内容说明
API Model Codegemini-3.1-pro-preview
Custom Tools 专用端点gemini-3.1-pro-preview-customtools
模型状态Preview (预览版)
最新更新2026-02
知识截止2025-01
输入/输出上限输入 1M tokens / 输出 64K tokens

🎯 适用场景

适合对逻辑严密性要求极高、甘愿牺牲一定速度和成本的“重度推理”任务:

  • 大型代码重构规划:跨模块、跨库的复杂架构设计。
  • 深度 Debugging:分析超长日志,定位隐蔽的并发或内存 Bug。
  • 复杂软件工程决策:评估多种技术方案的利弊。
  • 高可靠性 Agent:如果你的 Agent 拥有大量自定义工具(如 view_file、run_shell),推荐使用专门优化的 gemini-3.1-pro-preview-customtools 端点。

💰 资费标准(Paid Tier, Standard)

上下文长度Input 价格 (每 1M)Output 价格 (每 1M)
<= 200k tokensUSD 2.00USD 12.00
> 200k tokensUSD 4.00USD 18.00

3. 极致性价比:Gemini 3.1 Flash-Lite

📊 基本资料

项目内容说明
API Model Codegemini-3.1-flash-lite
模型状态Stable (稳定版)
最新更新2026-05
输入/输出上限输入 1M tokens / 输出 64K tokens

🎯 适用场景

旨在以极低延迟和极低成本处理高并发、轻量级的任务:

  • 大规模文本处理:批量翻译、文本分类、情感分析。
  • 结构化数据提取:从非结构化文本中提取简单的 JSON 字段。
  • 智能路由(Router):作为前置网关,判断用户意图,简单任务直接回答,复杂任务再转发给 Flash 或 Pro。

❌ 不适用场景

  • 复杂的编程(Coding)与多步骤逻辑推理。
  • 复杂的 Agent 规划与高精度工具调用。

💰 资费标准(Paid Tier, Standard)

计费项单价
Input (Text / Image / Video)USD 0.25 / 1M tokens
Input (Audio)USD 0.50 / 1M tokens
Output (含 Thinking)USD 1.50 / 1M tokens

4. 特殊过渡:Gemini 3 Flash Preview

📊 基本资料

项目内容说明
API Model Codegemini-3-flash-preview
模型状态Preview (预览版)
最新更新2025-12

🎯 适用场景

在 gemini-3.5-flash 发布后,该模型已不再作为通用首选,但在以下特定场景仍有保留价值:

  • Computer Use 测试:需要让 AI 模拟人类操作浏览器或桌面(该特性目前在此预览版中支持)。
  • 旧系统兼容:需要复现或维持旧版 Gemini 3 Flash 的特定生成行为。

💰 资费标准(Paid Tier, Standard)

计费项单价
Input (Text / Image / Video)USD 0.50 / 1M tokens
Input (Audio)USD 1.00 / 1M tokens
Output (含 Thinking)USD 3.00 / 1M tokens

5. 专用模型一览

这些模型不适用于常规的文本对话,而是针对特定多模态场景优化的专用端点:

模型名称API Model Code核心用途
Gemini 3.1 Flash Live Previewgemini-3.1-flash-live-preview实时语音对讲(Audio-to-Audio),超低延迟
Gemini 3.1 Flash TTS Previewgemini-3.1-flash-tts-preview高质量文本转语音(Text-to-Speech)
Gemini 3.1 Flash Image Previewgemini-3.1-flash-image-preview快速图像生成与局部编辑
Gemini 3 Pro Image Previewgemini-3-pro-image-preview兼顾高画质与复杂 Prompt 理解的图像生成

6. 经典保留:Gemini 2.5 系列

如果您的老项目中仍在使用 2.5 系列,它们依然保持可用,但强烈建议新项目直接评估并接入 Gemini 3 / 3.5 系列。

  • gemini-2.5-pro:旧版高精度推理模型。
  • gemini-2.5-flash:旧版平衡型低延迟模型。
  • gemini-2.5-flash-lite:旧版低成本模型。

7. 推荐选型逻辑

💡 通用决策流

  1. 默认首选:直接上 gemini-3.5-flash 进行原型开发。
  2. 成本优化:若发现任务简单、并发极高、预算敏感,降级至 gemini-3.1-flash-lite。
  3. 能力升级:若遇到复杂代码重构、多步逻辑卡壳,升级至 gemini-3.1-pro-preview。
  4. 多模态专用:语音对话用 Live,生图用 Image 模型。

🏢 ERP / AI Agent 落地建议

业务场景推荐模型落地理由
Chatbox 默认对话 Agentgemini-3.5-flash响应快,双语能力强,体验流畅
SQL 生成 / ERP 表关系初步分类gemini-3.1-flash-lite结构化任务,批量处理成本极低
复杂 Debug / 跨模块重构计划gemini-3.1-pro-preview逻辑严密,不易产生幻觉
后台海量日志 Summary / 意图路由gemini-3.1-flash-lite吞吐量大,极省成本
多表关联查询 + 联网搜索(Grounding)gemini-3.5-flash完美支持 Function Calling 与 Grounding

8. 开发者必看:避坑指南

🚨 坑 1:不要使用 includes("mini") 匹配轻量模型

在很多开源框架或自定义代码中,开发者喜欢通过判断模型 ID 是否包含 "mini" 来识别轻量模型。 但在 Gemini 中,gemini 单词本身就包含 mini 子串! 如果直接使用 modelId.includes("mini"),会导致所有 Gemini 模型都被误判为 Lite 级别,从而引发配置混乱。

正确做法(使用正则边界匹配):

// 推荐的匹配模式
const LITE_TIER_PATTERN = /\b(?:flash-lite|flash|mini|haiku|nano)\b/i;
const isLiteTier = LITE_TIER_PATTERN.test(modelId);

🚨 坑 2:误把 Preview 当 Stable 部署到生产环境

带有 -preview 后缀的模型(如 gemini-3.1-pro-preview)属于预览版。Google 可能会随时调整其后台行为、速率限制(Rate Limits)也更为严格。

黄金法则:生产环境的核心工作流,请务必优先使用不带 -preview 的 Stable 模型(如 gemini-3.5-flash)。

🚨 坑 3:忽略了 Thinking Tokens 的输出成本

在 Gemini 的计费设计中,模型在输出最终答案前产生的“思考 Token”(Thinking Tokens)是计入 Output Tokens 计费的。对于复杂推理任务,实际账单可能会比预估的纯文本输出要高,架构师在做预算时需留出余量。

🚨 坑 4:Grounding 隐藏账单

开启 Google Search 或 Google Maps Grounding 后,API 会根据用户 Prompt 自动去检索真实世界信息。请注意,每一次检索(Search Query)在超出免费额度后都是单独计费的,在高并发场景下需做好配额限制。


9. 极简决策树

开始选型
 ├─ 任务类型是?
 │   ├─ 简单任务 (分类/翻译/简单提取/路由)
 │   │   └─ 👉 选 gemini-3.1-flash-lite (省钱、极快)
 │   │
 │   ├─ 核心任务 (普通Coding/Agent/ERP问答/多步工具调用)
 │   │   └─ 👉 选 gemini-3.5-flash (全能、稳定、首选)
 │   │
 │   └─ 极难任务 (深度Debug/架构设计/超长上下文推理)
 │       └─ 👉 选 gemini-3.1-pro-preview (高精度、强推理)
 │
 └─ 特殊模态需求?
     ├─ 实时语音双向对讲 ──👉 选 gemini-3.1-flash-live-preview
     └─ 图像生成与编辑 ────👉 选 gemini-3.1-flash-image-preview / gemini-3-pro-image-preview

10. 官方参考链接

← Back to all posts