Tous les modèles
Google Cloud

Chirp 3

Modèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions.

Présentation de l'anglais simple

Qu'est-ce que Chirp 3 ?

Chirp 3 se trouve dans Google Cloud Speech-to-Text V2, il prend donc en charge plusieurs modèles opérationnels plutôt qu'une seule application fixe. Les équipes peuvent l'utiliser pour des flux en direct, de courtes requêtes synchrones ou des lots asynchrones et peuvent ajouter une détection de langue, une adaptation vocale et un débruitage là où la région et la langue sélectionnées les prennent en charge.

Sa matrice de fonctionnalités n’est pas uniforme dans toutes les langues. La diarisation et certaines options d'adaptation s'appliquent aux sous-ensembles documentés, et l'emplacement du point final affecte la disponibilité. La bonne comparaison porte donc sur la langue, la région et le mode de requête exacts, et non uniquement sur le nombre de langues du titre.

Bon ajustement pour

  • Transcription cloud multilingue
  • Équipes mélangeant des charges de travail en temps réel et par lots
  • Applications Google Cloud nécessitant des points de terminaison régionaux

Comparaison des catégories

Les faits importants pour les modèles transcription

Il s'agit de spécifications publiées par le fournisseur et non de scores de référence Cody. Suivez les sources liées pour connaître les limites actuelles et les exceptions spécifiques aux points de terminaison.

Prix des transcriptions
0,016 $/min standard · 0,003 $/min lot dynamiquePrix ​​actuel du fournisseur par heure ou minute audio pour l'itinéraire de traitement indiqué.
En direct ou par lots
Streaming, synchrone et batchSi le modèle gère les flux en temps réel, les enregistrements téléchargés ou les deux.
Langues
Plus de 85 langues et paramètres régionauxCouverture linguistique publiée par le fournisseur, séparant la couverture formée ou annoncée des langues spécifiquement vérifiées si nécessaire.
Étiquettes des enceintes
Pris en charge pour un sous-ensemble de langues documentéSi le modèle identifie qui a parlé et toute limite de locuteurs publiée.
Horodatages
Horodatages au niveau des mots avec contraintes d'itinéraireInformations de synchronisation disponibles au niveau du mot, du segment ou de l'énoncé.
Contrôle du vocabulaire
Adaptation de la parole, vocabulaire personnalisé, détection de langue, débruitageAmélioration des mots clés, orthographe personnalisée, contexte, invites ou autres moyens d'améliorer les termes du domaine.
Où l'utiliser
Google Cloud synthèse vocale V2API directe, catalogue cloud, application ou point de terminaison régional documenté par le fournisseur.

Tarifs et comparaisons

Estimez votre coût

Indiquez votre utilisation. L’estimation se met à jour à chaque modification.

Utilise la durée en heures : 30 minutes = 0,5 heure. Options et frais minimums peuvent modifier la facture.

Chirp 3

Google Cloud

Total estimé (USD)

Aucun tarif vérifié

Pour l’utilisation indiquée · USD · Tarif API, hors abonnement

Comprendre cette estimation

Les estimations excluent taxes, outils, stockage/écriture du cache, quotas gratuits et remises personnalisées. Pour les images, seule la sortie est incluse, pas le prompt ni les références. Les modes de qualité varient. Un paramètre non répertorié n’est pas gratuit.

Accès API et fournisseur

Où obtenir Chirp 3

Disponibilité

Régions et étape d'accès

Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots.

Les fonctionnalités et les langues prises en charge varient selon la région Google Cloud ; choisissez un point de terminaison régional dans la documentation Chirp 3 en direct.

Vérifier la disponibilité en direct

Données et formation

L'itinéraire compte.

Google indique que le contenu Speech-to-Text n'est pas utilisé au-delà de la fourniture du service, à moins que le client n'accepte l'enregistrement des données. Le contenu en streaming et synchrone est géré en mémoire ; les résultats asynchrones peuvent être conservés temporairement comme indiqué.

Il s'agit d'une lecture concise du matériel du fournisseur cité, et non d'un avis juridique. Une passerelle tierce peut avoir des conditions de stockage, de routage, de formation et de résidence différentes de celles de l'API directe du modéliste.

Lire la politique du fournisseur

Questions fréquemment posées

FAQ Chirp 3

Qu'est-ce que Chirp 3 ?

Modèle général de synthèse vocale de Google Cloud pour le streaming, les fichiers et la transcription par lots dynamiques à faible coût dans de nombreuses langues et régions. Chirp 3 se trouve dans Google Cloud Speech-to-Text V2, il prend donc en charge plusieurs modèles opérationnels plutôt qu'une seule application fixe. Les équipes peuvent l'utiliser pour des flux en direct, de courtes requêtes synchrones ou des lots asynchrones et peuvent ajouter une détection de langue, une adaptation vocale et un débruitage là où la région et la langue sélectionnées les prennent en charge.

Quand Chirp 3 est-il sorti ?

Chirp 3 a été publié sur 13 octobre 2025 selon les documents du fournisseur cités.

Où puis-je accéder à Chirp 3 ?

Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots. Les voies d'accès répertoriées dans ce guide sont Google Cloud.

Combien coûte Chirp 3 ?

0,016 $/min standard · 0,003 $/min lot dynamique. Il s'agit des tarifs de synthèse vocale Google Cloud actuels pour les voies de reconnaissance pertinentes ; Les niveaux de volume éligibles et les contrats cloud peuvent modifier le coût effectif.

Où le Chirp 3 est-il disponible ?

Généralement disponible dans Google Cloud Speech-to-Text V2 avec des itinéraires de reconnaissance en streaming, synchrone et par lots. Les fonctionnalités et les langues prises en charge varient selon la région Google Cloud ; choisissez un point de terminaison régional dans la documentation Chirp 3 en direct.

Mes données API Chirp 3 sont-elles utilisées pour la formation ?

Google indique que le contenu Speech-to-Text n'est pas utilisé au-delà de la fourniture du service, à moins que le client n'accepte l'enregistrement des données. Le contenu en streaming et synchrone est géré en mémoire ; les résultats asynchrones peuvent être conservés temporairement comme indiqué. La politique appartient à l'itinéraire du fournisseur et aux conditions du compte, vérifiez-la donc à nouveau avant de l'utiliser en production.