音訊轉錄

Gemini API 會使用 Gemini 3.5 Transcribe 模型 (gemini-3.5-transcribe),將音訊檔案中的語音轉換為文字。根據 Gemini 的音訊理解能力,這項 API 可提供準確的轉錄內容,並自動辨識語言、區分說話者、提供字詞層級的時間戳記,以及自訂詞彙提示。此外,這項功能還提供智慧轉錄模式,可移除贅詞並智慧格式化。

如要轉錄音訊檔案,請上傳音訊並傳遞至 gemini-3.5-transcribe

Python

from google import genai

client = genai.Client()

audio_file = client.files.upload(file="path/to/sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai"