Chirp 3
Modèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions.
Modèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions.
Présentation de l'anglais simple
Chirp 3 se trouve dans Google Cloud Speech-to-Text V2, il prend donc en charge plusieurs modèles opérationnels plutôt qu'une seule application fixe. Les équipes peuvent l'utiliser pour des flux en direct, de courtes requêtes synchrones ou des lots asynchrones et peuvent ajouter une détection de langue, une adaptation vocale et un débruitage là où la région et la langue sélectionnées les prennent en charge.
Sa matrice de fonctionnalités n’est pas uniforme dans toutes les langues. La diarisation et certaines options d'adaptation s'appliquent aux sous-ensembles documentés, et l'emplacement du point final affecte la disponibilité. La bonne comparaison porte donc sur la langue, la région et le mode de requête exacts, et non uniquement sur le nombre de langues du titre.
Comparaison des catégories
Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.
Tarifs et comparaisons
Indiquez votre utilisation. L’estimation se met à jour à chaque modification.
Utilise la durée en heures : 30 minutes = 0,5 heure. Options et frais minimums peuvent modifier la facture.
Chirp 3
Google Cloud
Total estimé (USD)
Pour l’utilisation indiquée · USD · Tarif API, hors abonnement
Les estimations excluent taxes, outils, stockage/écriture du cache, quotas gratuits et remises personnalisées. Pour les images, seule la sortie est incluse, pas le prompt ni les références. Les modes de qualité varient. Un paramètre non répertorié n’est pas gratuit.
Accès API et fournisseur
Disponibilité
Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots.
Les fonctionnalités et les langues prises en charge varient selon la région Google Cloud ; choisissez un point de terminaison régional dans la documentation Chirp 3 en direct.
Vérifier la disponibilité en directDonnées et formation
Google indique que le contenu Speech-to-Text n'est pas utilisé au-delà de la fourniture du service, à moins que le client n'accepte l'enregistrement des données. Le contenu en streaming et synchrone est géré en mémoire ; les résultats asynchrones peuvent être conservés temporairement comme indiqué.
Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.
Lire la politique du fournisseurQuestions fréquemment posées
Modèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions. Chirp 3 se trouve dans Google Cloud Speech-to-Text V2, il prend donc en charge plusieurs modèles opérationnels plutôt qu'une seule application fixe. Les équipes peuvent l'utiliser pour des flux en direct, de courtes requêtes synchrones ou des lots asynchrones et peuvent ajouter une détection de langue, une adaptation vocale et un débruitage là où la région et la langue sélectionnées les prennent en charge.
Chirp 3 a été publié sur 13 octobre 2025 selon les documents du fournisseur cités.
Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots. Les voies d'accès répertoriées dans ce guide sont Google Cloud.
0,016 $/min standard · 0,003 $/min lot dynamique. Il s'agit des tarifs de synthèse vocale Google Cloud actuels pour les voies de reconnaissance pertinentes ; Les niveaux de volume éligibles et les contrats cloud peuvent modifier le coût effectif.
Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots. Les fonctionnalités et les langues prises en charge varient selon la région Google Cloud ; choisissez un point de terminaison régional dans la documentation Chirp 3 en direct.
Google indique que le contenu Speech-to-Text n'est pas utilisé au-delà de la fourniture du service, à moins que le client n'accepte l'enregistrement des données. Le contenu en streaming et synchrone est géré en mémoire ; les résultats asynchrones peuvent être conservés temporairement comme indiqué. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.
Comparaisons associées
Modèle de reconnaissance vocale en streaming de Meta pour les sous-titres en direct, l'audio long, de nombreux haut-parleurs, la commutation de code et la transcription sensible au domaine.
Ouvrir la comparaison complèteModèle de transcription par lots rapide de Microsoft pour les enregistrements longs, les étiquettes des locuteurs, la synchronisation des mots, la polarisation des mots clés et les transcriptions claires ou textuelles.
Ouvrir la comparaison complèteModèle de transcription axé sur la précision du AssemblyAI pour les fichiers et l'audio en direct, avec commutation de code, étiquettes de locuteur, horodatages et invites contextuelles.
Ouvrir la comparaison complèteModèle de synthèse vocale multilingue de ElevenLabs pour des transcriptions détaillées avec de nombreux locuteurs, une synchronisation des mots, des événements audio et de grandes listes de mots clés personnalisées.
Ouvrir la comparaison complète