Gemini API 优化和推理

Gemini API 提供多种优化机制,可帮助您根据具体的工作负载需求平衡速度、费用和可靠性。无论您是构建实时对话机器人,还是运行繁重的离线数据处理流水线,选择合适的范式都可以显著降低成本或提升性能。

功能 标准 Flex 优先级 批量 缓存
价格 全价 5 折优惠 比标准高出 75% 到 100% 5 折优惠 90% 折扣 + 按比例分摊的 token 存储
延迟时间 秒到分钟 分钟(目标时长为 1-15 分钟) 最长 24 小时 首 token 延迟更短
可靠性 高 / 中高 尽力而为(可舍弃) 高(不可拆卸) 高(针对吞吐量) 不适用
接口 同步 同步 同步 异步 保存的状态
最佳使用场景 常规应用工作流程 非紧急顺序链 面向用户的正式版应用 海量数据集、离线评估 针对同一文件的重复查询

推理服务层级(同步)

您可以在标准生成调用中传递 service_tier 参数,从而在可靠性优化和费用优化之间切换同步流量。

标准推理(默认)

标准层级是顺序生成内容的默认选项。它可提供正常的响应时间,无需额外付费或排长队。

  • 可靠性:标准严重程度
  • 价格:标准价格。
  • 最适合:大多数日常交互式应用。

优先推理(延迟时间优化)