Google GeminiAPImobile developmentAndroidcost optimization
Google Gemini API移动端指南:定价、限制与何时转向端侧
Google的Gemini API提供激进的定价和原生Android集成。以下是规模化后定价的真实情况、免费层的边界,以及何时端侧模型更有意义。
Edward Xi Yang
Google的Gemini是最便宜的主流AI API。Gemini 2.0 Flash每百万输入令牌收费$0.10,每百万输出令牌收费$0.40。这比GPT-4o-mini便宜33%。还有一个额度慷慨的免费层。
对于Android开发者,Google提供了一个原生SDK,可以直接与你的Kotlin代码集成。不需要处理REST。
这听起来很适合移动应用。以下是现实更加微妙的部分。
定价优势
| 模型 | 输入(每百万令牌) | 输出(每百万令牌) |
|---|---|---|
| Gemini 2.0 Flash | $0.10 | $0.40 |
| Gemini 2.0 Flash-Lite | $0.075 | $0.30 |
| Gemini 1.5 Pro | $1.25 | $5.00 |
| GPT-4o-mini(对比) | $0.15 | $0.60 |
| Claude 3.5 Haiku(对比) | $0.80 | $4.00 |
Gemini Flash确实是主要供应商中按令牌推理最便宜的选择。如果能接受能力稍有降低,Flash-Lite更便宜。
免费层
Google通过Google AI Studio为Gemini API提供免费层:
- 速率限制: 每分钟15个请求
- 每日限制: 每天1,500个请求
- 令牌限制: 每分钟100万个令牌
- 无需信用卡
这对于开发和测试来说很慷慨。甚至可以支持小流量的生产应用。每天1,500个请求,大约可以服务50个MAU(每用户每天30个请求)。
但有个问题:免费层没有SLA,没有保证的正常运行时间,Google可以随时更改条款。这不是一个生产环境的基础。
原生Android SDK
Google为Android提供了Google AI Client SDK,这是所有AI供应商中最干净的移动端集成:
val model = GenerativeModel(
modelName = "gemini-2.0-flash",
apiKey = BuildConfig.GEMINI_API_KEY
)
// 简单生成
val response = model.generateContent("Summarize this article: $text")
println(response.text)
// 流式 传输
model.generateContentStream("Draft a reply to: $email").collect { chunk ->
responseText += chunk.text ?: ""
}这比直接向OpenAI发REST调用更简洁。SDK处理了序列化、错误处理和流式传输。
对于iOS,有一个通过Swift Package Manager提供的Swift SDK,遵循相同的模式。