Gemini API 會使用 Gemini 3.5 Transcribe 模型 (gemini-3.5-transcribe),將音訊檔案中的語音轉換為文字。根據 Gemini 的音訊理解能力,這項 API 可提供準確的轉錄內容,並自動辨識語言、區分說話者、提供字詞層級的時間戳記,以及自訂詞彙提示。此外,這項功能還提供智慧轉錄模式,可移除贅詞並智慧格式化。
如要轉錄音訊檔案,請上傳音訊並傳遞至 gemini-3.5-transcribe:
Python
from google import genai
client = genai.Client()
audio_file = client.files.upload(file="path/to/sample.mp3")
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[
{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}
],
)
print(interaction.output_text)
JavaScript
import { GoogleGenAI } from "@google/genai"