Chirp 3
Das allgemeine Sprach-zu-Text-Modell von Google Cloud für Streaming, Datei und kostengünstige dynamische Batch-Transkription in vielen Sprachen und Regionen.
Das allgemeine Sprach-zu-Text-Modell von Google Cloud für Streaming, Datei und kostengünstige dynamische Batch-Transkription in vielen Sprachen und Regionen.
Übersicht in einfacher englischer Sprache
Chirp 3 befindet sich in Google Cloud Speech-to-Text V2 und unterstützt daher mehrere Betriebsmuster anstelle einer festen App. Teams können es für Live-Streams, kurze synchrone Anfragen oder asynchrone Batches verwenden und Spracherkennung, Sprachanpassung und Rauschunterdrückung hinzufügen, wenn die ausgewählte Region und Sprache dies unterstützen.
Die Merkmalsmatrix ist nicht in allen Sprachen einheitlich. Die Diarisierung und einige Anpassungsoptionen gelten für dokumentierte Teilmengen, und der Standort des Endpunkts wirkt sich auf die Verfügbarkeit aus. Der richtige Vergleich ist daher eine exakte Sprache, Region und Anfrageart – nicht nur die Anzahl der Schlagzeilensprachen.
Kategorievergleich
Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.
Preise und Vergleiche
Geben Sie Ihre Nutzung ein. Die Schätzung wird sofort aktualisiert.
Nutzt die Aufnahmedauer in Stunden: 30 Minuten = 0,5 Stunden. Zusatzfunktionen und Mindestgebühren können die Rechnung ändern.
Chirp 3
Google Cloud
Geschätzte Summe (USD)
Für die angegebene Nutzung · USD · API-Preis, kein Abonnement
Schätzungen ohne Steuern, Tools, Cache-Speicherung/-Schreiben, Freikontingente und individuelle Rabatte. Bei Bildern zählt nur die Ausgabe, nicht Prompt oder Referenzbilder. Qualitätsmodi unterscheiden sich. Nicht aufgeführte Einstellungen gelten nicht als kostenlos.
API- und Provider-Zugriff
Verfügbarkeit
Allgemein verfügbar in Google Cloud Speech-to-Text V2 mit Streaming-, Synchron- und Batch-Erkennungsrouten.
Funktionen und unterstützte Sprachen variieren je nach Google Cloud-Region; Wählen Sie einen regionalen Endpunkt aus der Live-Dokumentation Chirp 3.
Überprüfen Sie die Live-VerfügbarkeitDaten und Schulung
Laut Google werden Speech-to-Text-Inhalte nicht über die Bereitstellung des Dienstes hinaus verwendet, es sei denn, der Kunde stimmt der Datenprotokollierung zu. Streaming- und synchrone Inhalte werden im Speicher verarbeitet; Asynchrone Ergebnisse können wie dokumentiert vorübergehend gespeichert werden.
Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.
Lesen Sie die Richtlinien des AnbietersHäufig gestellte Fragen
Das allgemeine Sprach-zu-Text-Modell von Google Cloud für Streaming, Datei und kostengünstige dynamische Batch-Transkription in vielen Sprachen und Regionen. Chirp 3 befindet sich in Google Cloud Speech-to-Text V2 und unterstützt daher mehrere Betriebsmuster anstelle einer festen App. Teams können es für Live-Streams, kurze synchrone Anfragen oder asynchrone Batches verwenden und Spracherkennung, Sprachanpassung und Rauschunterdrückung hinzufügen, wenn die ausgewählte Region und Sprache dies unterstützen.
Chirp 3 wurde gemäß den zitierten Anbietermaterialien auf 13. Oktober 2025 veröffentlicht.
Allgemein verfügbar in Google Cloud Speech-to-Text V2 mit Streaming-, Synchron- und Batch-Erkennungsrouten. Die in diesem Handbuch aufgeführten Zugriffsrouten sind Google Cloud.
0,016 $/Min. Standard · 0,003 $/Min. dynamischer Batch. Dies sind die aktuellen Google Cloud Speech-to-Text-Tarife für die relevanten Erkennungsrouten; Berechtigte Volumenstufen und Cloud-Verträge können die effektiven Kosten verändern.
Allgemein verfügbar in Google Cloud Speech-to-Text V2 mit Streaming-, Synchron- und Batch-Erkennungsrouten. Funktionen und unterstützte Sprachen variieren je nach Google Cloud-Region; Wählen Sie einen regionalen Endpunkt aus der Live-Dokumentation Chirp 3.
Laut Google werden Speech-to-Text-Inhalte nicht über die Bereitstellung des Dienstes hinaus verwendet, es sei denn, der Kunde stimmt der Datenprotokollierung zu. Streaming- und synchrone Inhalte werden im Speicher verarbeitet; Asynchrone Ergebnisse können wie dokumentiert vorübergehend gespeichert werden. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.
Verwandte Vergleiche
Das Streaming-Spracherkennungsmodell von Meta für Live-Untertitel, lange Audioinhalte, viele Sprecher, Code-Switching und domänenbezogene Transkription.
Vollständigen Vergleich öffnenDas schnelle Batch-Transkriptionsmodell von Microsoft für lange Aufnahmen, Sprecherbezeichnungen, Wort-Timing, Keyword-Bias und saubere oder wörtliche Transkripte.
Vollständigen Vergleich öffnenDas auf Genauigkeit ausgerichtete Transkriptionsmodell von AssemblyAI für Dateien und Live-Audio mit Code-Umschaltung, Sprecherbezeichnungen, Zeitstempeln und kontextbezogenen Eingabeaufforderungen.
Vollständigen Vergleich öffnenDas mehrsprachige Speech-to-Text-Modell von ElevenLabs für detaillierte Transkripte mit vielen Sprechern, Wortzeit, Audioereignissen und großen benutzerdefinierten Schlüsselbegriffslisten.
Vollständigen Vergleich öffnen