Gemini 3.6 Flash 与 3.5 Flash-Lite 怎么选?月成本 $30 vs $8

·8 min read

先说结论:复杂 Agent、编码和多模态任务优先测试 Gemini 3.6 Flash;抽取、文档解析、子 Agent 和大批量重复任务优先测试 Gemini 3.5 Flash-Lite。Google 已将两者标记为正式可用于生产。官方输入/输出价格分别是 $1.50/$7.50$0.30/$2.50/百万 tokens。

官方价格快照

模型输入 / 百万输出 / 百万上下文官方定位
Gemini 3.6 Flash$1.50$7.50100 万兼顾 Agent 与多模态能力
Gemini 3.5 Flash-Lite$0.30$2.50100 万低成本高吞吐
Gemini 3.5 Flash$1.50$9.00100 万上一代均衡型参照

以上是官方 API 价格,不是中转报价。ComputeUnion 将官方价和渠道价分开,因为更低的中转价格可能对应不同路由、限额、隐私条款、售后责任或模型映射。

两种业务规模的月成本

计算公式是:输入百万数 × 输入单价,加上输出百万数 × 输出单价。

负载月输入月输出3.6 Flash3.5 Flash-Lite
生产试用1000 万200 万$30$8
大规模系统10 亿2 亿$3,000$800

在固定 token 负载下,Flash-Lite 账单约低 73%。但如果准确率不足导致大量重试、升级调用或人工复核,账面节省会被吃掉。

外部能力参考

模型Artificial Analysis Intelligence Index能说明什么不能说明什么
Gemini 3.6 Flash(high)50在注明配置下的带日期独立比较不能代替你的任务准确率和成功任务成本
Gemini 3.5 Flash-Lite36公开评测中的相对通用能力不代表每个抽取任务都需要更大的模型

哪些任务分别适合谁?

  • 3.6 Flash:复杂工具调用、编码 Agent、多模态推理,以及失败代价高的任务。
  • 3.5 Flash-Lite:分类、抽取、文档解析、请求路由、简单子 Agent 和大批量队列。
  • 更实际的方式是分流:常规任务先走 Flash-Lite,不确定或失败的任务升级到 3.6 Flash。

迁移前应该怎么测试?

  1. 用两个模型重放同一组 100–500 条代表性请求。
  2. 记录结果通过率、重试次数、延迟和输入输出 tokens。
  3. 计算每个通过任务的成本,而不是只比较 token 单价。
  4. 迁移生产流量前检查工具调用兼容性和输出结构。

明确结论

困难的 Agent 与多模态任务,Gemini 3.6 Flash 是更稳妥的第一测试对象;高吞吐、边界清晰的任务,Gemini 3.5 Flash-Lite 更有成本优势。多数业务最合理的结构不是二选一,而是 Flash-Lite 走常规路径、3.6 Flash 负责升级处理。

数据来源与方法

可用状态、Model ID、上下文、官方定位和价格来自 Google 最新模型指南Flash-Lite 模型页;Intelligence Index 来自带日期的 Artificial Analysis 更新记录。月成本是按官方价格确定性计算,不是用户真实账单。

常见问题

Gemini 3.6 Flash API 多少钱?

Google 官方价格是输入 $1.50、输出 $7.50/百万 tokens。

Gemini 3.5 Flash-Lite API 多少钱?

Google 官方价格是输入 $0.30、输出 $2.50/百万 tokens。

大批量抽取任务应该选哪个?

边界清晰、可重复的抽取任务优先测试 Flash-Lite,但应按结果通过率计算真实成功任务成本。

两个模型都已经正式开放了吗?

是。Google 最新模型指南将两者列为 GA,可用于生产。

相关链接

← 返回博客