Chirp 3
Ogólny model zamiany mowy na tekst Google Cloud do przesyłania strumieniowego, plików i taniej dynamicznej transkrypcji wsadowej w wielu językach i regionach.
Ogólny model zamiany mowy na tekst Google Cloud do przesyłania strumieniowego, plików i taniej dynamicznej transkrypcji wsadowej w wielu językach i regionach.
Przegląd w prostym języku angielskim
Chirp 3 znajduje się w Google Cloud zamiany mowy na tekst V2, więc obsługuje kilka wzorców operacyjnych, a nie jedną stałą aplikację. Zespoły mogą go używać do transmisji na żywo, krótkich żądań synchronicznych lub asynchronicznych partii, a także mogą dodawać wykrywanie języka, adaptację mowy i usuwanie szumu, jeśli obsługuje je wybrany region i język.
Jego matryca funkcji nie jest jednolita w każdym języku. Diaryzacja i niektóre opcje adaptacji dotyczą udokumentowanych podzbiorów, a lokalizacja punktu końcowego wpływa na dostępność. Dlatego właściwym porównaniem jest dokładny język, region i tryb żądania, a nie sama liczba języków nagłówka.
Porównanie kategorii
Są to specyfikacje opublikowane przez dostawcę, a nie wyniki testów porównawczych Cody. Skorzystaj z połączonych źródeł, aby poznać aktualne limity i wyjątki specyficzne dla punktu końcowego.
Ceny i porównania
Podaj zużycie. Szacunek aktualizuje się podczas wpisywania.
Używa czasu nagrania w godzinach: 30 minut = 0,5 godziny. Dodatkowe funkcje i opłaty minimalne mogą zmienić rachunek.
Chirp 3
Google Cloud
Szacowany koszt (USD)
Dla podanego użycia · USD · Cena API, nie abonamentu
Szacunki nie obejmują podatków, narzędzi, zapisu i przechowywania pamięci podręcznej, darmowych limitów ani rabatów. Dla obrazów obejmują tylko wynik, bez promptu i obrazów referencyjnych. Tryby jakości różnią się. Brak stawki nie oznacza bezpłatności.
Dostęp do API i dostawcy
Dostępność
Ogólnie dostępne w Google Cloud zamiana mowy na tekst V2 z trasami rozpoznawania strumieniowego, synchronicznego i wsadowego.
Funkcje i obsługiwane języki różnią się w zależności od regionu Google Cloud; wybierz regionalny punkt końcowy z aktualnej dokumentacji Chirp 3.
Sprawdź dostępność na żywoDane i szkolenia
Google mówi, że treść zamiany mowy na tekst nie jest używana poza świadczeniem usługi, chyba że klient wyrazi zgodę na rejestrowanie danych. Treść przesyłana strumieniowo i synchronicznie jest obsługiwana w pamięci; wyniki asynchroniczne mogą być przechowywane tymczasowo zgodnie z dokumentacją.
Jest to zwięzła lektura cytowanych materiałów dostawcy, a nie porada prawna. Brama innej firmy może mieć inne warunki przechowywania, routingu, szkolenia i miejsca zamieszkania niż bezpośrednie API twórcy modelu.
Przeczytaj politykę dostawcyCzęsto zadawane pytania
Ogólny model zamiany mowy na tekst Google Cloud do przesyłania strumieniowego, plików i taniej dynamicznej transkrypcji wsadowej w wielu językach i regionach. Chirp 3 znajduje się w Google Cloud zamiany mowy na tekst V2, więc obsługuje kilka wzorców operacyjnych, a nie jedną stałą aplikację. Zespoły mogą go używać do transmisji na żywo, krótkich żądań synchronicznych lub asynchronicznych partii, a także mogą dodawać wykrywanie języka, adaptację mowy i usuwanie szumu, jeśli obsługuje je wybrany region i język.
Według materiałów cytowanego dostawcy Chirp 3 został wydany na 13 października 2025.
Ogólnie dostępne w Google Cloud zamiana mowy na tekst V2 z trasami rozpoznawania strumieniowego, synchronicznego i wsadowego. Drogi dostępu wymienione w tym przewodniku to Google Cloud.
Standard 0,016 USD/min · Partia dynamiczna 0,003 USD/min. Są to aktualne stawki zamiany mowy na tekst Google Cloud dla odpowiednich ścieżek rozpoznawania; kwalifikujące się poziomy wolumenów i umowy w chmurze mogą zmienić efektywny koszt.
Ogólnie dostępne w Google Cloud zamiana mowy na tekst V2 z trasami rozpoznawania strumieniowego, synchronicznego i wsadowego. Funkcje i obsługiwane języki różnią się w zależności od regionu Google Cloud; wybierz regionalny punkt końcowy z aktualnej dokumentacji Chirp 3.
Google mówi, że treść zamiany mowy na tekst nie jest używana poza świadczeniem usługi, chyba że klient wyrazi zgodę na rejestrowanie danych. Treść przesyłana strumieniowo i synchronicznie jest obsługiwana w pamięci; wyniki asynchroniczne mogą być przechowywane tymczasowo zgodnie z dokumentacją. Polityka należy do warunków trasy dostawcy i konta, dlatego sprawdź ją ponownie przed użyciem w środowisku produkcyjnym.
Powiązane porównania
Model Meta do strumieniowego rozpoznawania mowy dla napisów na żywo, długiego dźwięku, wielu głośników, przełączania kodów i transkrypcji uwzględniającej domeny.
Otwórz pełne porównanieModel szybkiej transkrypcji wsadowej Microsoft do długich nagrań, etykiet głośników, synchronizacji słów, stronniczości słów kluczowych i czystych lub dosłownych transkrypcji.
Otwórz pełne porównanieModel AssemblyAI zorientowany na dokładność transkrypcji plików i dźwięku na żywo, z przełączaniem kodów, etykietami głośników, znacznikami czasu i podpowiedziami kontekstowymi.
Otwórz pełne porównanieWielojęzyczny model zamiany mowy na tekst ElevenLabs umożliwiający szczegółowe transkrypcje z wieloma mówcami, synchronizacją słów, zdarzeniami audio i dużymi niestandardowymi listami kluczowych terminów.
Otwórz pełne porównanie