Einführung in die Audiocodierung für Cloud Speech-to-Text

Eine Audiocodierung bezeichnet die Art und Weise, in der Audiodaten gespeichert und übertragen werden. Auf der Seite wird beschrieben, wie solche Codierungen in Bezug auf die Cloud Speech-to-Text API funktionieren.

Richtlinien zur Auswahl der besten Codierung für Ihre Anwendung finden Sie in unserem Leitfaden mit Best Practices.

Audioformate im Vergleich zu Audiocodierungen

Ein Audioformat ist nicht dasselbe wie eine Audiocodierung. WAV-Audiodateien definieren beispielsweise das Format des Headers einer Audiodatei, sind aber selbst keine Audiocodierung. Bei WAV-Dateien wird häufig, aber nicht immer, eine lineare PCM-Codierung verwendet. Sie können nicht davon ausgehen, dass eine -Datei eine bestimmte Codierung aufweist. Dazu müssen Sie den Header prüfen.

FLAC ist jedoch sowohl ein Dateiformat als auch eine Codierung, was gelegentlich zu einer gewissen Verwirrung führt. Eine FLAC-Datei muss die Abtastrate im Header enthalten, damit sie an die Cloud Speech-to-Text API gesendet werden kann. FLAC ist die einzige Codierung, bei der Audiodaten einen Header haben müssen. Alle anderen Audiocodierungen geben Audiodaten ohne Header an. Wenn wir in der Cloud Speech-to-Text API auf FLAC verweisen, beziehen wir uns immer auf den Codec. Beim Verweis auf ein FLAC-Dateiformat verwenden wir die Formulierung „eine FLAC-Datei“.

Unterstützte Audiocodierungen für Cloud Speech-to-Text

Die Cloud Speech-to-Text API unterstützt verschiedene Codierungen. In der nachstehenden Tabelle sind die unterstützten Audio-Codecs aufgelistet:

Codec Name Verlustfrei Hinweise zur Verwendung
MP3 MPEG Audio Layer III Nein Die MP3-Codierung ist ein Beta-Feature, das nur in v1p1beta1 verfügbar ist. Weitere Informationen finden Sie in der Referenzdokumentation zu RecognitionConfig.
FLAC Free Lossless Audio Codec Ja 16 Bit oder 24 Bit für Streams
LINEAR16 Linear PCM