Audio mit der Gemini API generieren

Sie können die folgenden Arten von Audioinhalten generieren:

Vergleich zwischen TTS und Live API

Sowohl TTS-Modelle (Text-to-Speech) als auch Live API-Modelle sind Modelle mit geringer Latenz, die Sprache generieren und für verschiedene Antwortstimmen und ‑sprachen konfiguriert werden können. Sie sind jedoch für ganz unterschiedliche Anwendungsfälle gedacht.

  • Die Sprachausgabe (Text-to-Speech, TTS) ist eine unidirektionale Anfrage-Antwort-Interaktion (Texteingabe, Audioausgabe). Es ist auf Szenarien zugeschnitten, in denen der bereitgestellte Text genau wiedergegeben werden muss und Stil und Klang präzise gesteuert werden sollen, z. B. bei Podcast-Narrativen, Hörbüchern oder beim Vorlesen von Artikeln.

  • Die Live API-Generation unterstützt bidirektionales Streaming für Sprachunterhaltungen in Echtzeit (Spracheingabe, Sprachausgabe). Es eignet sich hervorragend für dynamische Gesprächskontexte, in denen das Modell entscheidet, welche Sprache zurückgegeben werden soll. Die neuesten Live API-Modelle unterstützen auch Video- und Bildeingaben.