리소스

음성 인식 및 전사를 위한 최고의 AI 모델

회의, 통화, 캡션, 미디어 및 음성 제품을 위한 음성-텍스트 모델. 시간당 비용, 실시간 또는 일괄 처리, 언어, 화자 라벨, 타임스탬프, 어휘 제어 및 API 액세스를 비교하세요.

5 모델의 1–5 표시

전사

Google Cloud · 안정적

Chirp 3

다양한 언어와 지역에서 스트리밍, 파일 및 저렴한 동적 배치 전사를 위한 Google Cloud의 일반 음성-텍스트 모델입니다.

전사 가격
$0.016/분 표준 · $0.003/분 동적 배치
라이브 또는 배치
스트리밍, 동기 및 배치
모델 가이드 보기
전사

코드 전환, 화자 레이블, 타임스탬프 및 상황에 맞는 프롬프트를 갖춘 파일 및 라이브 오디오용 AssemblyAI의 정확성 중심 전사 모델입니다.

전사 가격
$0.21/시간 비동기 · $0.45/시간 스트리밍
라이브 또는 배치
업로드된 파일 및 실시간 스트리밍
모델 가이드 보기
전사

ElevenLabs · 안정적

Scribe v2

ElevenLabs' 다국어 음성-텍스트 모델은 많은 화자, 단어 타이밍, 오디오 이벤트 및 대규모 사용자 정의 키워드 목록이 포함된 자세한 대본을 제공합니다.

전사 가격
$0.22 / 오디오 시간; 실시간은 별도로 나열됨
라이브 또는 배치
일괄 및 긴 오디오; 별도의 실시간 경로
모델 가이드 보기

비교할 항목

전사 가격
나열된 처리 경로에 대한 오디오 시간 또는 분당 현재 공급자 가격입니다.
라이브 또는 배치
모델이 실시간 스트림, 업로드된 녹음 또는 둘 다를 처리하는지 여부입니다.
언어
공급자가 게시한 언어 적용 범위, 필요한 경우 특별히 검증된 언어와 훈련되거나 광고된 적용 범위를 분리합니다.

이 라이브러리를 사용하는 방법

과대 광고가 아닌 직업을 비교하십시오.

실제 제품 결정을 위한 실용적인 API 정보가 포함된 선별된 교차 카테고리 세트인 개척자, 전문가 및 카테고리 정의 모델입니다.

Cody는 범용 품질 리더보드를 실행하지 않습니다. 공급자 청구에는 라벨이 지정되어 있으며 가격에는 세금 및 옵션 도구가 제외되어 있으며 프로덕션 구매자는 모델을 선택하기 전에 실시간 공급자 조건을 확인해야 합니다.

  1. 01

    기술 제한, 수명 주기, 가격 책정, 지역별 액세스 및 데이터 정책이 있는 경우 자사 문서를 사용하세요.

  2. 02

    동일한 카테고리 내의 모델만 비교하고 각 제공업체의 측정 기준을 유지하세요.

  3. 03

    제공자가 비교 가능한 사실을 추정하는 대신 공개하지 않은 경우 표시 미공개입니다.

  4. 04

    가격과 가용성을 날짜가 지정된 스냅샷으로 처리하고 모든 페이지를 실시간 제공업체 문서에 연결하세요.

속도는 단위를 유지합니다.

음성 대기 시간, 텍스트 처리량, 비디오 렌더링 시간 및 월드 모델 프레임 속도는 서로 바꿔 사용할 수 없습니다.

알 수 없는 상태는 알 수 없는 상태로 유지됩니다.

누락된 출시 날짜, 국가 목록 또는 지연 시간 번호는 예상 대신 게시되지 않음으로 표시됩니다.

모든 사실에는 날짜가 있습니다

모델 페이지는 기본 소스에 연결되며 가격, 액세스 및 정책이 마지막으로 확인된 시기를 표시합니다.

모델을 작업에 활용

모델을 선택한 다음 더 나은 개요를 제공하세요.

Cody의 확장된 프롬프트 플레이북과 선별된 에이전트 기술을 사용하여 모델 선택을 반복 가능한 워크플로로 전환하세요.