Gemini API 提供多种优化机制,可帮助您根据具体的工作负载需求平衡速度、费用和可靠性。无论您是构建实时对话机器人,还是运行繁重的离线数据处理流水线,选择合适的范式都可以显著降低成本或提升性能。
| 功能 | 标准 | Flex | 优先级 | 批量 | 缓存 |
|---|---|---|---|---|---|
| 价格 | 全价 | 5 折优惠 | 比标准高出 75% 到 100% | 5 折优惠 | 90% 折扣 + 按比例分摊的 token 存储 |
| 延迟时间 | 秒到分钟 | 分钟(目标时长为 1-15 分钟) | 秒 | 最长 24 小时 | 首 token 延迟更短 |
| 可靠性 | 高 / 中高 | 尽力而为(可舍弃) | 高(不可拆卸) | 高(针对吞吐量) | 不适用 |
| 接口 | 同步 | 同步 | 同步 | 异步 | 保存的状态 |
| 最佳使用场景 | 常规应用工作流程 | 非紧急顺序链 | 面向用户的正式版应用 | 海量数据集、离线评估 | 针对同一文件的重复查询 |
推理服务层级(同步)
您可以在标准生成调用中传递 service_tier 参数,从而在可靠性优化和费用优化之间切换同步流量。
标准推理(默认)
标准层级是顺序生成内容的默认选项。它可提供正常的响应时间,无需额外付费或排长队。
- 可靠性:标准严重程度
- 价格:标准价格。
- 最适合:大多数日常交互式应用。