Chirp 3
Modelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.
Modelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões.
Visão geral em inglês simples
Chirp 3 fica dentro do Google Cloud Speech-to-Text V2, portanto, oferece suporte a vários padrões operacionais em vez de um aplicativo fixo. As equipes podem usá-lo para transmissões ao vivo, solicitações síncronas curtas ou lotes assíncronos e podem adicionar detecção de idioma, adaptação de fala e eliminação de ruído onde a região e o idioma selecionados os suportarem.
Sua matriz de recursos não é uniforme em todos os idiomas. A diarização e algumas opções de adaptação se aplicam a subconjuntos documentados, e a localização do terminal afeta a disponibilidade. A comparação correta é, portanto, o idioma, a região e o modo de solicitação exatos – e não apenas a contagem do idioma do título.
Comparação de categorias
Estas são especificações publicadas pelo fornecedor, não pontuações de benchmark Cody. Siga as fontes vinculadas para limites atuais e exceções específicas de endpoint.
Preços e comparações
Defina seu uso. A estimativa é atualizada enquanto você digita.
Usa a duração em horas: 30 minutos = 0,5 hora. Recursos extras e cobranças mínimas podem alterar o total.
Chirp 3
Google Cloud
Total estimado (USD)
Para o uso indicado · USD · Preço de API, não de assinatura
Estimativas sem impostos, ferramentas, armazenamento/gravação de cache, franquias gratuitas e descontos personalizados. Imagens incluem apenas a saída, sem prompt ou referências. Os modos de qualidade variam. Configurações não listadas não são consideradas gratuitas.
Acesso à API e ao provedor
Disponibilidade
Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote.
Os recursos e os idiomas suportados variam de acordo com a região Google Cloud; escolha um endpoint regional na documentação Chirp 3 ativa.
Verifique a disponibilidade ao vivoDados e treinamento
Google afirma que o conteúdo de fala em texto não é usado além do fornecimento do serviço, a menos que o cliente opte pelo registro de dados. O conteúdo síncrono e de streaming é tratado na memória; os resultados assíncronos podem ser retidos temporariamente conforme documentado.
Esta é uma leitura concisa do material citado do fornecedor, e não um aconselhamento jurídico. Um gateway de terceiros pode ter diferentes termos de armazenamento, roteamento, treinamento e residência da API direta do criador do modelo.
Leia a política do provedorPerguntas frequentes
Modelo geral de fala para texto do Google Cloud para streaming, arquivo e transcrição de lote dinâmico de baixo custo em vários idiomas e regiões. Chirp 3 fica dentro do Google Cloud Speech-to-Text V2, portanto, oferece suporte a vários padrões operacionais em vez de um aplicativo fixo. As equipes podem usá-lo para transmissões ao vivo, solicitações síncronas curtas ou lotes assíncronos e podem adicionar detecção de idioma, adaptação de fala e eliminação de ruído onde a região e o idioma selecionados os suportarem.
Chirp 3 foi lançado em 13 de outubro de 2025 de acordo com os materiais do fornecedor citado.
Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote. As rotas de acesso listadas neste guia são Google Cloud.
Padrão de US$ 0,016/min · Lote dinâmico de US$ 0,003/min. Estas são as taxas atuais de conversão de fala em texto Google Cloud para as rotas de reconhecimento relevantes; níveis de volume elegíveis e contratos de nuvem podem alterar o custo efetivo.
Geralmente disponível em Google Cloud Speech-to-Text V2 com rotas de streaming, síncronas e de reconhecimento em lote. Os recursos e os idiomas suportados variam de acordo com a região Google Cloud; escolha um endpoint regional na documentação Chirp 3 ativa.
Google afirma que o conteúdo de fala em texto não é usado além do fornecimento do serviço, a menos que o cliente opte pelo registro de dados. O conteúdo síncrono e de streaming é tratado na memória; os resultados assíncronos podem ser retidos temporariamente conforme documentado. A política pertence à rota do provedor e aos termos da conta, portanto, verifique-a novamente antes do uso em produção.
Comparações relacionadas
Modelo de reconhecimento de fala de streaming do Meta para legendas ao vivo, áudio longo, muitos alto-falantes, troca de código e transcrição com reconhecimento de domínio.
Abrir comparação completaModelo de transcrição em lote rápido do Microsoft para gravações longas, rótulos de alto-falante, tempo de palavra, polarização de palavras-chave e transcrições limpas ou literais.
Abrir comparação completaModelo de transcrição focado na precisão do AssemblyAI para arquivos e áudio ao vivo, com troca de código, rótulos de alto-falante, carimbos de data e hora e prompts contextuais.
Abrir comparação completaModelo multilíngue de conversão de fala em texto do ElevenLabs para transcrições detalhadas com muitos alto-falantes, tempo de palavra, eventos de áudio e grandes listas de termos-chave personalizados.
Abrir comparação completa