Chirp 3
다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다.
다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다.
일반 영어 개요
Chirp 3는 Google Cloud Speech-to-Text V2 내에 위치하므로 하나의 고정 앱이 아닌 여러 작동 패턴을 지원합니다. 팀은 이를 라이브 스트림, 짧은 동기 요청 또는 비동기 배치에 사용할 수 있으며 선택한 지역 및 언어가 지원하는 경우 언어 감지, 음성 적응 및 잡음 제거 기능을 추가할 수 있습니다.
기능 매트릭스는 모든 언어에서 동일하지 않습니다. 분할 및 일부 적응 옵션은 문서화된 하위 집합에 적용되며 끝점 위치는 가용성에 영향을 미칩니다. 따라서 올바른 비교는 헤드라인 언어 수만 보는 것이 아니라 정확한 언어, 지역 및 요청 모드입니다.
카테고리 비교
이는 Cody 벤치마크 점수가 아닌 공급자가 게시한 사양입니다. 현재 제한 및 엔드포인트별 예외는 연결된 소스를 따르세요.
요금 및 비교
사용량을 입력하면 예상 비용이 바로 업데이트됩니다.
녹음 길이를 시간 단위로 입력합니다. 30분은 0.5시간입니다. 추가 기능과 최소 요금에 따라 청구액이 달라질 수 있습니다.
Chirp 3
Google Cloud
예상 총액 (USD)
위 사용량 기준 · USD · 구독료가 아닌 API 요금
세금, 도구, 캐시 저장·쓰기, 무료 할당량, 개별 할인은 제외됩니다. 이미지 비용은 출력만 포함하며 프롬프트와 참조 이미지 비용은 제외됩니다. 품질 모드는 모델마다 다릅니다. 미등록 설정은 무료로 간주하지 않습니다.
API 및 공급자 액세스
가용성
일반적으로 스트리밍, 동기 및 일괄 인식 경로를 갖춘 Google Cloud Speech-to-Text V2에서 사용할 수 있습니다.
기능과 지원되는 언어는 Google Cloud 지역에 따라 다릅니다. 라이브 Chirp 3 문서에서 지역 엔드포인트를 선택하세요.
실시간 가용성 확인데이터 및 교육
Google는 고객이 데이터 로깅을 선택하지 않는 한 Speech-to-Text 콘텐츠는 서비스 제공 외에는 사용되지 않는다고 말합니다. 스트리밍 및 동기 콘텐츠는 메모리에서 처리됩니다. 비동기 결과는 문서화된 대로 일시적으로 유지될 수 있습니다.
이는 법적 조언이 아닌 인용된 제공자 자료에 대한 간략한 설명입니다. 타사 게이트웨이는 모델 제작자의 직접 API와 다른 스토리지, 라우팅, 교육 및 상주 조건을 가질 수 있습니다.
공급자 정책 읽기자주 묻는 질문
다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다. Chirp 3는 Google Cloud Speech-to-Text V2 내에 위치하므로 하나의 고정 앱이 아닌 여러 작동 패턴을 지원합니다. 팀은 이를 라이브 스트림, 짧은 동기 요청 또는 비동기 배치에 사용할 수 있으며 선택한 지역 및 언어가 지원하는 경우 언어 감지, 음성 적응 및 잡음 제거 기능을 추가할 수 있습니다.
Chirp 3는 인용된 공급자 자료에 따라 2025년 10월 13일에서 릴리스되었습니다.
일반적으로 스트리밍, 동기 및 일괄 인식 경로를 갖춘 Google Cloud Speech-to-Text V2에서 사용할 수 있습니다. 이 가이드에 나열된 액세스 경로는 Google Cloud입니다.
$0.016/분 표준 · $0.003/분 동적 배치. 이는 관련 인식 경로에 대한 현재 Google Cloud 음성-텍스트 속도입니다. 적격 볼륨 계층 및 클라우드 계약에 따라 유효 비용이 변경될 수 있습니다.
일반적으로 스트리밍, 동기 및 일괄 인식 경로를 갖춘 Google Cloud Speech-to-Text V2에서 사용할 수 있습니다. 기능과 지원되는 언어는 Google Cloud 지역에 따라 다릅니다. 라이브 Chirp 3 문서에서 지역 엔드포인트를 선택하세요.
Google는 고객이 데이터 로깅을 선택하지 않는 한 Speech-to-Text 콘텐츠는 서비스 제공 외에는 사용되지 않는다고 말합니다. 스트리밍 및 동기 콘텐츠는 메모리에서 처리됩니다. 비동기 결과는 문서화된 대로 일시적으로 유지될 수 있습니다. 정책은 공급자 경로 및 계정 조건에 속하므로 프로덕션 사용 전에 다시 확인하십시오.
관련 비교
라이브 캡션, 긴 오디오, 다수의 화자, 코드 전환 및 도메인 인식 전사를 위한 Meta의 스트리밍 음성 인식 모델입니다.
전체 비교 열기긴 녹음, 화자 레이블, 단어 타이밍, 키워드 편향 및 깔끔한 또는 축어적 대본을 위한 Microsoft의 빠른 일괄 대본 모델입니다.
전체 비교 열기코드 전환, 화자 레이블, 타임스탬프 및 상황에 맞는 프롬프트를 갖춘 파일 및 라이브 오디오용 AssemblyAI의 정확성 중심 전사 모델입니다.
전체 비교 열기ElevenLabs' 다국어 음성-텍스트 모델은 많은 화자, 단어 타이밍, 오디오 이벤트 및 대규모 사용자 정의 키워드 목록이 포함된 자세한 대본을 제공합니다.
전체 비교 열기