Gemini API를 사용하여 오디오 생성

다음과 같은 종류의 오디오를 생성할 수 있습니다.

TTS와 Live API 비교

텍스트 음성 변환 (TTS) 모델과 Live API 모델은 모두 지연 시간이 짧고 다양한 응답 음성 및 언어로 구성할 수 있는 음성 생성 모델입니다. 하지만 사용 사례는 매우 다릅니다.

  • 텍스트 음성 변환 (TTS) 생성단방향 요청-응답 상호작용 (텍스트 입력, 오디오 출력)입니다. 팟캐스트 내레이션, 오디오북, 기사 낭독과 같이 스타일과 사운드를 세밀하게 제어하여 제공된 텍스트를 정확하게 낭독해야 하는 시나리오에 적합합니다.

  • Live API 생성실시간 음성 대화 (음성 입력, 음성 출력)를 위한 양방향 스트리밍을 지원합니다. 모델이 반환할 적절한 음성을 결정하는 동적 대화 컨텍스트에서 뛰어난 성능을 발휘합니다. 최신 Live API 모델은 동영상 및 이미지 입력도 지원합니다.