Gemini Flex API เป็นระดับการอนุมานที่ช่วยลดต้นทุนได้ 50% เมื่อเทียบกับอัตรามาตรฐาน แลกกับการตอบสนองที่ผันแปรและความพร้อมใช้งานอย่างเต็มที่ API นี้ออกแบบมาสำหรับเวิร์กโหลดที่ยอมรับการตอบสนองที่ช้าได้ ซึ่งต้องมีการประมวลผลแบบซิงโครนัส แต่ไม่จำเป็นต้องมีประสิทธิภาพแบบเรียลไทม์เหมือน API มาตรฐาน
วิธีใช้ Flex
หากต้องการใช้ระดับ Flex ให้ระบุ service_tier เป็น flex ในคำขอ โดยค่าเริ่มต้น คำขอจะใช้ระดับมาตรฐานหากละเว้นช่องนี้
Python
from google import genai
client = genai.Client()
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="Analyze this dataset for trends...",
service_tier='flex'
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from '@google/genai';
const client = new GoogleGenAI({});
async function main() {
const interaction = await client.interactions.create({
model: 'gemini-3.6-flash',
input: 'Analyze this dataset for trends...',
service_tier: 'flex'
});
console.log(interaction.output_text);
}
await main();
REST
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "Content-Type: application/json" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-d '{
"model": "gemini-3.6-flash",
"input": "Analyze this dataset for trends...",
"service_tier": "flex"
}'
วิธีทำงานของ Flex Inference
การอนุมาน Gemini Flex ช่วยลดช่องว่างระหว่าง API มาตรฐานกับ API แบบกลุ่มที่ใช้เวลาดำเนินการ 24 ชั่วโมง ของ Batch API โดยใช้ความสามารถในการประมวลผลที่ "ลดได้" ในช่วงเวลาที่ไม่ใช่ช่วงเวลาที่มีการใช้งานสูงสุด เพื่อมอบโซลูชันที่คุ้มค่าสำหรับงานเบื้องหลังและเวิร์กโฟลว์แบบลำดับ
| ฟีเจอร์ | Flex | รายการสำคัญ | มาตรฐาน | กลุ่ม |
|---|---|---|---|---|
| การกำหนดราคา | ส่วนลด 50% | มากกว่ามาตรฐาน 75-100% | ราคาเต็ม | ส่วนลด 50% |
| การตอบสนอง | นาที (เป้าหมาย 1-15 นาที) | ต่ำ (วินาที) | วินาทีถึงนาที | สูงสุด 24 ชั่วโมง |
| ความเชื่อถือได้ | อย่างเต็มที่ (ลดได้) | สูง (ลดไม่ได้) | สูง / สูงปานกลาง | สูง (สำหรับปริมาณงาน) |
| อินเทอร์เฟซ | แบบซิงโครนัส | แบบซิงโครนัส | แบบซิงโครนัส | แบบอะซิงโครนัส |
สิทธิประโยชน์สำคัญ
- ความคุ้มค่า: ประหยัดค่าใช้จ่ายได้มากสำหรับการประเมินที่ไม่ใช่การใช้งานจริง, เอเจนต์เบื้องหลัง และการเพิ่มคุณค่าของข้อมูล
- ใช้งานง่าย: เพียงเพิ่มพารามิเตอร์เดียวลงในคำขอที่มีอยู่
- เวิร์กโฟลว์แบบซิงโครนัส: เหมาะอย่างยิ่งสำหรับเชน API แบบลำดับที่คำขอถัดไปขึ้นอยู่กับเอาต์พุตของคำขอก่อนหน้า ซึ่งทำให้มีความยืดหยุ่นมากกว่าแบบกลุ่มสำหรับเวิร์กโฟลว์แบบ Agent
กรณีการใช้งาน
- การประเมินแบบออฟไลน์: การเรียกใช้การทดสอบการถดถอยหรือลีดเดอร์บอร์ด "LLM-as-a-judge"
- เอเจนต์เบื้องหลัง: งานแบบลำดับ เช่น การอัปเดต CRM, การสร้างโปรไฟล์ หรือการกลั่นกรองเนื้อหาที่ยอมรับความล่าช้าได้เป็นนาที
- การวิจัยที่ถูกจำกัดด้วยงบประมาณ: การทดลองทางวิชาการที่ต้องใช้โทเค็นจำนวนมากภายใต้งบประมาณที่จำกัด
ขีดจำกัดอัตรา
การเข้าชมการอนุมาน Flex จะนับรวมในขีดจำกัดอัตราทั่วไป โดยไม่ มีขีดจำกัดอัตราที่ขยายออกไปเหมือน Batch API
ความสามารถในการประมวลผลที่ลดได้
ระบบจะถือว่าการเข้าชม Flex มีลำดับความสำคัญต่ำกว่า หากมีการเข้าชมมาตรฐานเพิ่มขึ้นอย่างรวดเร็ว ระบบอาจขัดจังหวะหรือนำคำขอ Flex ออกเพื่อให้มีความสามารถในการประมวลผลสำหรับผู้ใช้ที่มีลำดับความสำคัญสูง หากต้องการการอนุมานที่มีลำดับความสำคัญสูง ให้ดู การอนุมานที่มีลำดับความสำคัญ
รหัสข้อผิดพลาด
เมื่อความสามารถในการประมวลผล Flex ไม่พร้อมใช้งานหรือระบบมีการใช้งานหนาแน่น API จะแสดงรหัสข้อผิดพลาดมาตรฐานดังนี้
- 503 ไม่พร้อมให้บริการ: ขณะนี้ระบบมีผู้ใช้เต็มแล้ว
- 429 มีคำขอมากเกินไป: ขีดจำกัดอัตราหรือทรัพยากรหมด
ความรับผิดชอบของไคลเอ็นต์
- ไม่มีการย้อนกลับฝั่งเซิร์ฟเวอร์: เพื่อป้องกันค่าใช้จ่ายที่ไม่คาดคิด ระบบจะไม่ ยกระดับคำขอ Flex เป็นระดับมาตรฐานโดยอัตโนมัติหากความสามารถในการประมวลผล Flex เต็ม
- การลองอีกครั้ง: คุณต้องใช้ตรรกะการลองอีกครั้งฝั่งไคลเอ็นต์ของคุณเองด้วย Exponential Backoff
- ระยะหมดเวลา: เนื่องจากคำขอ Flex อาจอยู่ในคิว เราจึงแนะนำให้ เพิ่มระยะหมดเวลาฝั่งไคลเอ็นต์เป็น 10 นาทีขึ้นไปเพื่อหลีกเลี่ยงการ ปิดการเชื่อมต่อก่อนเวลา
ปรับกรอบเวลาระยะหมดเวลา
คุณสามารถกำหนดค่าระยะหมดเวลาต่อคำขอสำหรับ REST API และไลบรารีของไคลเอ็นต์ได้ ตรวจสอบเสมอว่าระยะหมดเวลาฝั่งไคลเอ็นต์ครอบคลุมกรอบเวลาที่เซิร์ฟเวอร์รอได้ตามที่ต้องการ (เช่น 600 วินาทีขึ้นไปสำหรับคิวรอ Flex) SDK คาดหวังค่าระยะหมดเวลาเป็นมิลลิวินาที
ระยะหมดเวลาต่อคำขอ
Python
from google import genai
client = genai.Client(http_options={"timeout": 900000})
interaction = client.interactions.create(
model="gemini-3.6-flash",
input="why is the sky blue?",
service_tier="flex",
)
JavaScript
import { GoogleGenAI } from '@google/genai';
const client = new GoogleGenAI({});
async function main() {
const interaction = await client.