Gemini API का इस्तेमाल करके ऑडियो जनरेट करना

इस तरह का ऑडियो जनरेट किया जा सकता है:

TTS और Live API के बीच तुलना

लिखे हुए शब्दों को बोली में बदलने वाले (टीटीएस) मॉडल और Live API मॉडल, दोनों ही कम समय में काम करते हैं. ये ऐसे मॉडल हैं जो बोली जनरेट करते हैं. इन्हें जवाब देने के लिए अलग-अलग आवाज़ों और भाषाओं के लिए कॉन्फ़िगर किया जा सकता है. हालांकि, इनका इस्तेमाल अलग-अलग कामों के लिए किया जाता है.

  • लिखे गए शब्दों को सुनने की सुविधा (टीटीएस), अनुरोध-जवाब के बीच होने वाली एकतरफ़ा बातचीत है. इसमें टेक्स्ट इनपुट के तौर पर दिया जाता है और ऑडियो आउटपुट के तौर पर मिलता है. इसे उन स्थितियों के लिए बनाया गया है जिनमें दिए गए टेक्स्ट को सटीक तरीके से सुनाने की ज़रूरत होती है. साथ ही, स्टाइल और आवाज़ को बारीकी से कंट्रोल करने की ज़रूरत होती है. जैसे, पॉडकास्ट में सुनाई जाने वाली कहानी, ऑडियो बुक या लेख को तेज़ आवाज़ में पढ़ना.

  • Live API जनरेशन में, रीयल-टाइम में बोलकर बातचीत करने (बोलकर इनपुट देना, बोलकर आउटपुट पाना) के लिए, दोनों दिशाओं में स्ट्रीमिंग की सुविधा उपलब्ध है. यह डाइनैमिक कॉन्टेक्स्ट में बातचीत करने के लिए सबसे अच्छा है. इसमें मॉडल यह तय करता है कि जवाब देने के लिए कौनसी स्पीच का इस्तेमाल करना है. ध्यान दें कि Live API के नए मॉडल में, वीडियो और इमेज भी इनपुट के तौर पर इस्तेमाल की जा सकती हैं.