Buforowanie kontekstu

W typowym procesie AI możesz wielokrotnie przekazywać te same tokeny wejściowe do modelu. Interfejs Gemini API oferuje niejawne buforowanie, które optymalizuje wydajność i koszty.

Niejawne buforowanie

Niejawne buforowanie jest domyślnie włączone w przypadku wszystkich modeli Gemini 2.5 i nowszych. Jest ono obsługiwane zarówno w trybie rozmowy ze stanem (przy użyciu parametru previous_interaction_id) i bezstanowym. Jeśli Twoje żądanie trafi do pamięci podręcznej, automatycznie przekażemy Ci oszczędności. Aby to włączyć, nie musisz nic robić. Minimalna liczba tokenów wejściowych do buforowania kontekstu jest podana w tabeli poniżej dla każdego modelu:

Model