Расшифровка аудиозаписи

API Gemini преобразует речь в аудиофайлах в текст, используя модель транскрипции Gemini 3.5 ( gemini-3.5-transcribe ). Основанный на возможностях Gemini по распознаванию аудио, он обеспечивает точную транскрипцию с автоматическим определением языка, диаризацией говорящего, временными метками на уровне слов и пользовательскими подсказками по словарю. Он также предоставляет интеллектуальный режим транскрипции с удалением невнятных звуков и интеллектуальным форматированием.

Для расшифровки аудиофайла загрузите аудиофайл и передайте его в gemini-3.5-transcribe :

Python

from google import genai

client = genai.Client()

audio_file = client.files.upload(file="path/to/sample.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
)

print(interaction.output_text)

JavaScript

import { GoogleGenAI } from "@google/genai";

const client = new GoogleGenAI({});

const audioFile = await client.files.upload({
  file: "path/to/sample.mp3",
  config: