Todos os modelos
Google Cloud

Chirp 3

Modelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.

Visão geral em inglês simples

O que Chirp 3 realmente é

Chirp 3 fica dentro do Google Cloud Speech-to-Text V2, portanto, oferece suporte a vários padrões operacionais em vez de um aplicativo fixo. As equipes podem usá-lo para transmissões ao vivo, solicitações síncronas curtas ou lotes assíncronos e podem adicionar detecção de idioma, adaptação de fala e eliminação de ruído onde a região e o idioma selecionados os suportarem.

Sua matriz de recursos não é uniforme em todos os idiomas. A diarização e algumas opções de adaptação se aplicam a subconjuntos documentados, e a localização do terminal afeta a disponibilidade. A comparação correta é, portanto, o idioma, a região e o modo de solicitação exatos – e não apenas a contagem do idioma do título.

Bom ajuste para

  • Transcrição multilíngue na nuvem
  • Equipes combinando cargas de trabalho em tempo real e em lote
  • Aplicativos Google Cloud que precisam de endpoints regionais

Comparação de categorias

Os fatos que importam para os modelos transcrição

Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.

Preço da transcrição
Padrão de US$ 0,016/min · Lote dinâmico de US$ 0,003/minPreço atual do provedor por hora ou minuto de áudio para a rota de processamento listada.
Ao vivo ou em lote
Streaming, síncrono e em loteSe o modelo lida com streams em tempo real, gravações carregadas ou ambos.
Idiomas
Mais de 85 idiomas e localidadesCobertura de idiomas publicada pelo provedor, separando a cobertura treinada ou anunciada de idiomas especificamente verificados quando necessário.
Etiquetas de alto-falante
Compatível com um subconjunto documentado de idiomasSe o modelo identifica quem falou e qualquer limite de oradores publicado.
Carimbos de data e hora
Carimbos de data e hora em nível de palavra com restrições de rotaInformações disponíveis sobre temporização em nível de palavra, segmento ou enunciado.
Controle de vocabulário
Adaptação de fala, vocabulário personalizado, detecção de idioma, eliminação de ruídoAumento de palavras-chave, ortografia personalizada, contexto, solicitações ou outras formas de melhorar os termos do domínio.
Onde usar
Google Cloud Fala para Texto V2API direta, catálogo de nuvem, aplicativo ou endpoint regional documentado pelo provedor.

Preços e comparações

Estime seu custo

Defina seu uso. A estimativa é atualizada enquanto você digita.

Usa a duração em horas: 30 minutos = 0,5 hora. Recursos extras e cobranças mínimas podem alterar o total.

Chirp 3

Google Cloud

Total estimado (USD)

Sem preço revisado

Para o uso indicado · USD · Preço de API, não de assinatura

Como funciona esta estimativa

Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.

Acesso à API e ao provedor

Onde obter Chirp 3

Disponibilidade

Regiões e estágio de acesso

Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote.

Os recursos e os idiomas suportados variam de acordo com a região Google Cloud; escolha um endpoint regional na documentação Chirp 3 ativa.

Verifique a disponibilidade ao vivo

Dados e treinamento

A rota é importante.

Google afirma que o conteúdo de fala em texto não é usado além do fornecimento do serviço, a menos que o cliente opte pelo registro de dados. O conteúdo síncrono e de streaming é tratado na memória; os resultados assíncronos podem ser retidos temporariamente conforme documentado.

Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.

Leia a política do provedor

Perguntas frequentes

Perguntas frequentes sobre Chirp 3

O que é Chirp 3?

Modelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões. Chirp 3 fica dentro do Google Cloud Speech-to-Text V2, portanto, oferece suporte a vários padrões operacionais em vez de um aplicativo fixo. As equipes podem usá-lo para transmissões ao vivo, solicitações síncronas curtas ou lotes assíncronos e podem adicionar detecção de idioma, adaptação de fala e eliminação de ruído onde a região e o idioma selecionados os suportarem.

Quando o Chirp 3 foi lançado?

Chirp 3 foi lançado em 13 de outubro de 2025 de acordo com os materiais do fornecedor citado.

Onde posso acessar Chirp 3?

Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote. As rotas de acesso listadas neste guia são Google Cloud.

Quanto custa Chirp 3?

Padrão de US$ 0,016/min · Lote dinâmico de US$ 0,003/min. Estas são as taxas atuais de conversão de fala em texto Google Cloud para as rotas de reconhecimento relevantes; níveis de volume elegíveis e contratos de nuvem podem alterar o custo efetivo.

Onde o Chirp 3 está disponível?

Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote. Os recursos e os idiomas suportados variam de acordo com a região Google Cloud; escolha um endpoint regional na documentação Chirp 3 ativa.

Os dados da minha API Chirp 3 são usados ​​para treinamento?

Google afirma que o conteúdo de fala em texto não é usado além do fornecimento do serviço, a menos que o cliente opte pelo registro de dados. O conteúdo síncrono e de streaming é tratado na memória; os resultados assíncronos podem ser retidos temporariamente conforme documentado. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.