Gemini 3.6 Flash 与 3.5 Flash-Lite 怎么选?月成本 $30 vs $8
·8 min read
先说结论:复杂 Agent、编码和多模态任务优先测试 Gemini 3.6 Flash;抽取、文档解析、子 Agent 和大批量重复任务优先测试 Gemini 3.5 Flash-Lite。Google 已将两者标记为正式可用于生产。官方输入/输出价格分别是 $1.50/$7.50 和 $0.30/$2.50/百万 tokens。
官方价格快照
| 模型 | 输入 / 百万 | 输出 / 百万 | 上下文 | 官方定位 |
|---|---|---|---|---|
| Gemini 3.6 Flash | $1.50 | $7.50 | 100 万 | 兼顾 Agent 与多模态能力 |
| Gemini 3.5 Flash-Lite | $0.30 | $2.50 | 100 万 | 低成本高吞吐 |
| Gemini 3.5 Flash | $1.50 | $9.00 | 100 万 | 上一代均衡型参照 |
以上是官方 API 价格,不是中转报价。ComputeUnion 将官方价和渠道价分开,因为更低的中转价格可能对应不同路由、限额、隐私条款、售后责任或模型映射。
两种业务规模的月成本
计算公式是:输入百万数 × 输入单价,加上输出百万数 × 输出单价。
| 负载 | 月输入 | 月输出 | 3.6 Flash | 3.5 Flash-Lite |
|---|---|---|---|---|
| 生产试用 | 1000 万 | 200 万 | $30 | $8 |
| 大规模系统 | 10 亿 | 2 亿 | $3,000 | $800 |
在固定 token 负载下,Flash-Lite 账单约低 73%。但如果准确率不足导致大量重试、升级调用或人工复核,账面节省会被吃掉。
外部能力参考
| 模型 | Artificial Analysis Intelligence Index | 能说明什么 | 不能说明什么 |
|---|---|---|---|
| Gemini 3.6 Flash(high) | 50 | 在注明配置下的带日期独立比较 | 不能代替你的任务准确率和成功任务成本 |
| Gemini 3.5 Flash-Lite | 36 | 公开评测中的相对通用能力 | 不代表每个抽取任务都需要更大的模型 |
哪些任务分别适合谁?
- 3.6 Flash:复杂工具调用、编码 Agent、多模态推理,以及失败代价高的任务。
- 3.5 Flash-Lite:分类、抽取、文档解析、请求路由、简单子 Agent 和大批量队列。
- 更实际的方式是分流:常规任务先走 Flash-Lite,不确定或失败的任务升级到 3.6 Flash。
迁移前应该怎么测试?
- 用两个模型重放同一组 100–500 条代表性请求。
- 记录结果通过率、重试次数、延迟和输入输出 tokens。
- 计算每个通过任务的成本,而不是只比较 token 单价。
- 迁移生产流量前检查工具调用兼容性和输出结构。
明确结论
困难的 Agent 与多模态任务,Gemini 3.6 Flash 是更稳妥的第一测试对象;高吞吐、边界清晰的任务,Gemini 3.5 Flash-Lite 更有成本优势。多数业务最合理的结构不是二选一,而是 Flash-Lite 走常规路径、3.6 Flash 负责升级处理。
数据来源与方法
可用状态、Model ID、上下文、官方定位和价格来自 Google 最新模型指南与 Flash-Lite 模型页;Intelligence Index 来自带日期的 Artificial Analysis 更新记录。月成本是按官方价格确定性计算,不是用户真实账单。
常见问题
Gemini 3.6 Flash API 多少钱?
Google 官方价格是输入 $1.50、输出 $7.50/百万 tokens。
Gemini 3.5 Flash-Lite API 多少钱?
Google 官方价格是输入 $0.30、输出 $2.50/百万 tokens。
大批量抽取任务应该选哪个?
边界清晰、可重复的抽取任务优先测试 Flash-Lite,但应按结果通过率计算真实成功任务成本。
两个模型都已经正式开放了吗?
是。Google 最新模型指南将两者列为 GA,可用于生产。