一文读懂 Google Gemini 3.5/3.1 家族:开发者选型与避坑指南 (2026最新版)
Listen to this article
AI-generated voice10:55

目标:帮助新手与架构师快速理解
gemini-3.5-flash和其他前沿 Gemini 模型,明确在何种场景下选择哪款模型,以实现性能与成本的最佳平衡。
一句话结论
目前 Google Gemini API 的最新主线已演进至 Gemini 3.5。当前正式可用(Stable)的主力旗舰模型是 Gemini 3.5 Flash,其 API 标识符(Model Code)为:
gemini-3.5-flash
快速选型一览表
| 核心需求 | 推荐模型 | 选用理由 |
|---|---|---|
| 复杂 Coding、Agent、长任务、多步骤工具调用 | gemini-3.5-flash | 最新稳定版主力模型,速度极快,推理能力强,专为真实 Agent 工作流设计 |
| 最强 Pro 级推理、复杂软件工程、高可靠工具调用 | gemini-3.1-pro-preview | Pro 级预览模型,适合高难度、深深度推理任务 |
| 极低成本、海量简单任务、分类、抽取、翻译 | gemini-3.1-flash-lite | 极致性价比,响应极快,适合高频轻量级任务 |
| 需要旧版 Gemini 3 Flash 行为或 Computer Use | gemini-3-flash-preview | 预览模型,支持 Computer Use(浏览器/桌面操作),非通用首选 |
| 语音实时双向对话 | gemini-3.1-flash-live-preview | Live API 专用模型,支持低延迟音频交互 |
| 图片生成与编辑 | gemini-3.1-flash-image-preview<br>gemini-3-pro-image-preview | 图像生成专用模型,非普通文本模型 |
1. 旗舰主力:Gemini 3.5 Flash
📊 基本资料
| 项目 | 内容说明 |
|---|---|
| API Model Code | gemini-3.5-flash |
| 模型状态 | Stable (稳定版) |
| 最新更新 | 2026-05 |
| 知识截止 | 2025-01 |
| 输入模态 | Text, Image, Video, Audio, PDF |
| 输出模态 | Text |
| 上下文输入上限 | 1,048,576 tokens (1M) |
| 单次输出上限 | 65,536 tokens (64K) |
🎯 适用场景
gemini-3.5-flash 是当前最值得优先接入的通用模型,几乎可以作为所有新项目的默认起点:
- Coding Agent:代码编写、自动补全与中小型重构。
- 多步骤工具调用:在复杂的 Agent 规划中稳定执行 Function Calling。
- 长上下文任务:阅读超长文档、多文件关联分析、执行与验证。
- 企业级工作流:ERP / CRM 等业务系统中的智能助手。
- 高级特性支持:原生支持 Search Grounding(谷歌搜索增强)、Structured Output(JSON Schema 强约束输出)。
❌ 不适用场景
- 无法直接生成或编辑图片。
- 不支持 Live API 的超低延迟语音双向对讲。
- 不支持 Computer Use(如需测试该功能,请使用
gemini-3-flash-preview)。
💰 资费标准(Paid Tier, Standard)
| 计费项 | 单价 |
|---|---|
| Input Tokens | USD 1.50 / 1M tokens |
| Output Tokens (含 Thinking) | USD 9.00 / 1M tokens |
| Context Caching | USD 0.15 / 1M tokens |
⚠️ 注意:如果启用了 Google Search / Maps Grounding,超出免费额度后,将按实际 Search Query 额外计费。
2. 深度推理:Gemini 3.1 Pro Preview
📊 基本资料
| 项目 | 内容说明 |
|---|---|
| API Model Code | gemini-3.1-pro-preview |
| Custom Tools 专用端点 | gemini-3.1-pro-preview-customtools |
| 模型状态 | Preview (预览版) |
| 最新更新 | 2026-02 |
| 知识截止 | 2025-01 |
| 输入/输出上限 | 输入 1M tokens / 输出 64K tokens |
🎯 适用场景
适合对逻辑严密性要求极高、甘愿牺牲一定速度和成本的“重度推理”任务:
- 大型代码重构规划:跨模块、跨库的复杂架构设计。
- 深度 Debugging:分析超长日志,定位隐蔽的并发或内存 Bug。
- 复杂软件工程决策:评估多种技术方案的利弊。
- 高可靠性 Agent:如果你的 Agent 拥有大量自定义工具(如
view_file、run_shell),推荐使用专门优化的gemini-3.1-pro-preview-customtools端点。
💰 资费标准(Paid Tier, Standard)
| 上下文长度 | Input 价格 (每 1M) | Output 价格 (每 1M) |
|---|---|---|
| <= 200k tokens | USD 2.00 | USD 12.00 |
| > 200k tokens | USD 4.00 | USD 18.00 |
3. 极致性价比:Gemini 3.1 Flash-Lite
📊 基本资料
| 项目 | 内容说明 |
|---|---|
| API Model Code | gemini-3.1-flash-lite |
| 模型状态 | Stable (稳定版) |
| 最新更新 | 2026-05 |
| 输入/输出上限 | 输入 1M tokens / 输出 64K tokens |
🎯 适用场景
旨在以极低延迟和极低成本处理高并发、轻量级的任务:
- 大规模文本处理:批量翻译、文本分类、情感分析。
- 结构化数据提取:从非结构化文本中提取简单的 JSON 字段。
- 智能路由(Router):作为前置网关,判断用户意图,简单任务直接回答,复杂任务再转发给 Flash 或 Pro。
❌ 不适用场景
- 复杂的编程(Coding)与多步骤逻辑推理。
- 复杂的 Agent 规划与高精度工具调用。
💰 资费标准(Paid Tier, Standard)
| 计费项 | 单价 |
|---|---|
| Input (Text / Image / Video) | USD 0.25 / 1M tokens |
| Input (Audio) | USD 0.50 / 1M tokens |
| Output (含 Thinking) | USD 1.50 / 1M tokens |
4. 特殊过渡:Gemini 3 Flash Preview
📊 基本资料
| 项目 | 内容说明 |
|---|---|
| API Model Code | gemini-3-flash-preview |
| 模型状态 | Preview (预览版) |
| 最新更新 | 2025-12 |
🎯 适用场景
在 gemini-3.5-flash 发布后,该模型已不再作为通用首选,但在以下特定场景仍有保留价值:
- Computer Use 测试:需要让 AI 模拟人类操作浏览器或桌面(该特性目前在此预览版中支持)。
- 旧系统兼容:需要复现或维持旧版 Gemini 3 Flash 的特定生成行为。
💰 资费标准(Paid Tier, Standard)
| 计费项 | 单价 |
|---|---|
| Input (Text / Image / Video) | USD 0.50 / 1M tokens |
| Input (Audio) | USD 1.00 / 1M tokens |
| Output (含 Thinking) | USD 3.00 / 1M tokens |
5. 专用模型一览
这些模型不适用于常规的文本对话,而是针对特定多模态场景优化的专用端点:
| 模型名称 | API Model Code | 核心用途 |
|---|---|---|
| Gemini 3.1 Flash Live Preview | gemini-3.1-flash-live-preview | 实时语音对讲(Audio-to-Audio),超低延迟 |
| Gemini 3.1 Flash TTS Preview | gemini-3.1-flash-tts-preview | 高质量文本转语音(Text-to-Speech) |
| Gemini 3.1 Flash Image Preview | gemini-3.1-flash-image-preview | 快速图像生成与局部编辑 |
| Gemini 3 Pro Image Preview | gemini-3-pro-image-preview | 兼顾高画质与复杂 Prompt 理解的图像生成 |
6. 经典保留:Gemini 2.5 系列
如果您的老项目中仍在使用 2.5 系列,它们依然保持可用,但强烈建议新项目直接评估并接入 Gemini 3 / 3.5 系列。
gemini-2.5-pro:旧版高精度推理模型。gemini-2.5-flash:旧版平衡型低延迟模型。gemini-2.5-flash-lite:旧版低成本模型。
7. 推荐选型逻辑
💡 通用决策流
- 默认首选:直接上
gemini-3.5-flash进行原型开发。 - 成本优化:若发现任务简单、并发极高、预算敏感,降级至
gemini-3.1-flash-lite。 - 能力升级:若遇到复杂代码重构、多步逻辑卡壳,升级至
gemini-3.1-pro-preview。 - 多模态专用:语音对话用
Live,生图用Image模型。
🏢 ERP / AI Agent 落地建议
| 业务场景 | 推荐模型 | 落地理由 |
|---|---|---|
| Chatbox 默认对话 Agent | gemini-3.5-flash | 响应快,双语能力强,体验流畅 |
| SQL 生成 / ERP 表关系初步分类 | gemini-3.1-flash-lite | 结构化任务,批量处理成本极低 |
| 复杂 Debug / 跨模块重构计划 | gemini-3.1-pro-preview | 逻辑严密,不易产生幻觉 |
| 后台海量日志 Summary / 意图路由 | gemini-3.1-flash-lite | 吞吐量大,极省成本 |
| 多表关联查询 + 联网搜索(Grounding) | gemini-3.5-flash | 完美支持 Function Calling 与 Grounding |
8. 开发者必看:避坑指南
🚨 坑 1:不要使用 includes("mini") 匹配轻量模型
在很多开源框架或自定义代码中,开发者喜欢通过判断模型 ID 是否包含 "mini" 来识别轻量模型。
但在 Gemini 中,gemini 单词本身就包含 mini 子串!
如果直接使用 modelId.includes("mini"),会导致所有 Gemini 模型都被误判为 Lite 级别,从而引发配置混乱。
正确做法(使用正则边界匹配):
// 推荐的匹配模式
const LITE_TIER_PATTERN = /\b(?:flash-lite|flash|mini|haiku|nano)\b/i;
const isLiteTier = LITE_TIER_PATTERN.test(modelId);
🚨 坑 2:误把 Preview 当 Stable 部署到生产环境
带有 -preview 后缀的模型(如 gemini-3.1-pro-preview)属于预览版。Google 可能会随时调整其后台行为、速率限制(Rate Limits)也更为严格。
黄金法则:生产环境的核心工作流,请务必优先使用不带
-preview的 Stable 模型(如gemini-3.5-flash)。
🚨 坑 3:忽略了 Thinking Tokens 的输出成本
在 Gemini 的计费设计中,模型在输出最终答案前产生的“思考 Token”(Thinking Tokens)是计入 Output Tokens 计费的。对于复杂推理任务,实际账单可能会比预估的纯文本输出要高,架构师在做预算时需留出余量。
🚨 坑 4:Grounding 隐藏账单
开启 Google Search 或 Google Maps Grounding 后,API 会根据用户 Prompt 自动去检索真实世界信息。请注意,每一次检索(Search Query)在超出免费额度后都是单独计费的,在高并发场景下需做好配额限制。
9. 极简决策树
开始选型
├─ 任务类型是?
│ ├─ 简单任务 (分类/翻译/简单提取/路由)
│ │ └─ 👉 选 gemini-3.1-flash-lite (省钱、极快)
│ │
│ ├─ 核心任务 (普通Coding/Agent/ERP问答/多步工具调用)
│ │ └─ 👉 选 gemini-3.5-flash (全能、稳定、首选)
│ │
│ └─ 极难任务 (深度Debug/架构设计/超长上下文推理)
│ └─ 👉 选 gemini-3.1-pro-preview (高精度、强推理)
│
└─ 特殊模态需求?
├─ 实时语音双向对讲 ──👉 选 gemini-3.1-flash-live-preview
└─ 图像生成与编辑 ────👉 选 gemini-3.1-flash-image-preview / gemini-3-pro-image-preview
