Gemini मॉडल से, वीडियो फ़ाइलों का विश्लेषण करने के लिए कहा जा सकता है. इन फ़ाइलों को इनलाइन (base64-encoded) या यूआरएल के ज़रिए उपलब्ध कराया जा सकता है. जब आप Firebase AI Logic, का इस्तेमाल करते हैं, तो यह अनुरोध सीधे अपने ऐप्लिकेशन से किया जा सकता है.
इस सुविधा की मदद से, ये काम किए जा सकते हैं:
- वीडियो के लिए कैप्शन जनरेट करना और उनसे जुड़े सवालों के जवाब देना
- टाइमस्टैंप का इस्तेमाल करके, वीडियो के खास सेगमेंट का विश्लेषण करना
- ऑडियो ट्रैक और विज़ुअल फ़्रेम, दोनों को प्रोसेस करके वीडियो के कॉन्टेंट को टेक्स्ट में बदलना
- वीडियो के बारे में जानकारी देना, उन्हें सेगमेंट में बांटना, और उनसे जानकारी निकालना. इसमें ऑडियो ट्रैक और विज़ुअल फ़्रेम, दोनों शामिल हैं
इस गाइड में, वीडियो इनपुट से टेक्स्ट जनरेट करने के बारे में बताया गया है. हालांकि, वीडियो इनपुट से इमेज भी जनरेट की जा सकती हैं.
कोड के सैंपल पर जाएं स्ट्रीम किए गए जवाबों के लिए कोड पर जाएं
|
वीडियो के साथ काम करने के अन्य विकल्पों के लिए, अन्य गाइड देखें स्ट्रक्चर्ड आउटपुट जनरेट करना सिलसिलेवार बातचीत इमेज जनरेट करना |
शुरू करने से पहले
|
इस पेज पर, Gemini API प्रोवाइडर के हिसाब से कॉन्टेंट और कोड देखने के लिए, उस पर क्लिक करें. |
अगर आपने अब तक, शुरू करने के लिए गाइड में दिए गए निर्देशों का पालन नहीं किया है, तो उन्हें पूरा करें. इसमें बताया गया है कि
Firebase प्रोजेक्ट को कैसे सेट अप करें, अपने ऐप्लिकेशन को Firebase से कैसे कनेक्ट करें, एसडीके टूल कैसे जोड़ें,
अपने चुने गए Gemini API प्रोवाइडर के लिए बैकएंड सेवा को कैसे शुरू करें, और
GenerativeModel इंस्टेंस कैसे बनाएं.
हम आपको Google AI StudioGoogle AI Studio का इस्तेमाल करने का सुझाव देते हैं. इससे, प्रॉम्प्ट की जांच की जा सकती है और उनमें बदलाव किया जा सकता है.
इस सुविधा के साथ काम करने वाले मॉडल
इस गाइड में, वीडियो इनपुट से टेक्स्ट जनरेट करने के बारे में बताया गया है. यह सुविधा, इन Gemini मॉडल के साथ काम करती है:
gemini-3.1-pro-previewgemini-3.7-flash(और इसके पुराने वर्शनgemini-3.6-flashऔरgemini-3.5-flash)gemini-3.5-flash-lite(और इसका पुराना वर्शनgemini-3.1-flash-lite)
आम तौर पर इस्तेमाल किए जाने वाले Gemini 2.5 मॉडल, इस सुविधा के साथ काम करते हैं. हालांकि, इन सभी मॉडल को बंद कर दिया गया है.
वीडियो फ़ाइलों (base64-encoded) से टेक्स्ट जनरेट करना
|
इस सैंपल को आज़माने से पहले, अपने प्रोजेक्ट और ऐप्लिकेशन को सेट अप करने के लिए, इस गाइड का
शुरू करने से पहले सेक्शन पूरा करें. उस सेक्शन में, आपको अपने चुने हुए Gemini API प्रोवाइडर के लिए एक बटन पर भी क्लिक करना होगा, ताकि आपको इस पेज पर प्रोवाइडर के हिसाब से कॉन्टेंट दिखे. |
Gemini मॉडल से, टेक्स्ट और वीडियो के साथ प्रॉम्प्ट करके टेक्स्ट जनरेट करने के लिए कहा जा सकता है.
इसके लिए, हर
इनपुट फ़ाइल का mimeType और फ़ाइल उपलब्ध कराएं. इनपुट फ़ाइलों के लिए ज़रूरी शर्तें और सुझाव, इस पेज पर आगे दिए गए हैं.
Swift
टेक्स्ट और वीडियो फ़ाइलों के एक से ज़्यादा तरह के कॉन्टेंट वाले इनपुट से टेक्स्ट जनरेट करने के लिए,
generateContent()
को कॉल किया जा सकता है.
import FirebaseAILogic
// Initialize the Gemini Developer API backend service.
let ai = FirebaseAI.firebaseAI(backend: .googleAI())
// Create a `GenerativeModel` instance with a model that supports your use case.
let model = ai.generativeModel(modelName: "gemini-3.7-flash")
// Provide the video as `Data` with the appropriate MIME type.
let video = InlineDataPart(data: try Data(contentsOf: videoURL), mimeType: "video/mp4")
// Provide a text prompt to include with the video
let prompt = "What is in the video?"
// To generate text output, call generateContent with the text and video
let response = try await model.generateContent(video, prompt)
print(response.text ?? "No text in response.")
Kotlin
टेक्स्ट और वीडियो फ़ाइलों के एक से ज़्यादा तरह के कॉन्टेंट वाले इनपुट से टेक्स्ट जनरेट करने के लिए,
generateContent()
को कॉल किया जा सकता है.
// Initialize the Gemini Developer API backend service.
// Create a `GenerativeModel` instance with a model that supports your use case.
val model = Firebase.ai(backend = GenerativeBackend.googleAI())
.generativeModel("gemini-3.7-flash")
val contentResolver = applicationContext.contentResolver
contentResolver.openInputStream(videoUri).use { stream ->
stream?.let {
val bytes = stream.readBytes()
// Provide a prompt that includes the video specified above and text
val prompt = content {
inlineData(bytes, "video/mp4")
text("What is in the video?")