Inferenza della priorità

Descrizione: scopri come ottimizzare la latenza con il livello di inferenza Priority nell'API Interactions

L'API Gemini Priority è un livello di inferenza premium progettato per i workload mission critical che richiedono una latenza inferiore e la massima affidabilità a un prezzo premium. Il traffico del livello Priority ha la priorità rispetto al traffico dell'API standard e del livello Flex.

L'inferenza Priority è disponibile in tutti gli endpoint dell'API Interactions.

Come utilizzare Priority

Per utilizzare il livello Priority, imposta il campo service_tier nella richiesta su priority. Se il campo viene omesso, il livello predefinito è standard.

Python

from google import genai

client = genai.Client()

interaction = client.interactions.create(
    model="gemini-3.6-flash",
    input="Triage this critical customer support ticket immediately.",
    service_tier='priority'
)
print(interaction.output_text)

JavaScript

import { GoogleGenAI } from '@google/genai';

const ai = new GoogleGenAI({});

async function main() {
    const interaction = await ai.interactions.create({
        model: "gemini-3.6-flash",
        input: "Triage this critical customer support ticket immediately.",
        service_tier: "priority"
    });
    console.log(interaction.output_text);
}

await