將長音訊檔案轉錄成文字

這個頁面說明如何使用 Speech-to-Text API 和非同步語音辨識,將長音訊檔案 (長度超過 1 分鐘) 轉錄為文字。

關於非同步語音辨識

「批次語音辨識」會啟動長時間執行的音訊處理作業。使用非同步語音辨識功能轉錄長度超過 60 秒的音訊。如果是較短的音訊,使用同步語音辨識會更快、更簡單。非同步語音辨識的上限為 480 分鐘 (8 小時)。

批次語音辨識只能轉錄儲存在 Cloud Storage 中的音訊。轉錄稿輸出內容可內嵌在回應中 (適用於單一檔案的批次辨識要求),或寫入 Cloud Storage。

批次辨識要求會傳回 Operation,其中包含要求目前辨識處理作業的相關資訊。您可以輪詢作業,瞭解作業何時完成,以及何時可取得轉錄稿。

事前準備