OpenAI · 안정적
GPT-Realtime-2.1
텍스트 및 이미지 컨텍스트도 필요한 도구 사용 음성 에이전트를 위한 OpenAI의 실시간 음성 대 음성 추론 모델입니다.
- 가격 기준
- 오디오 $32 입력 · $64 출력 / 100만 토큰
- 상호작용 모드
- 텍스트/이미지 컨텍스트를 갖춘 음성 대 음성
리소스
5 모델의 1–5 표시
OpenAI · 안정적
텍스트 및 이미지 컨텍스트도 필요한 도구 사용 음성 에이전트를 위한 OpenAI의 실시간 음성 대 음성 추론 모델입니다.
Google의 미리 보기 오디오-오디오 모델은 다중 모드 인식, 사고, 검색 기반 및 기능 호출을 통해 지연 시간이 짧은 대화를 제공합니다.
ElevenLabs' 자연스러운 대화, 감정 전달, 오디오 태그 및 70개 이상의 언어를 위한 표현력이 풍부한 실시간 텍스트 음성 변환 모델입니다.
Inworld의 최신 표현력이 풍부한 실시간 텍스트 음성 변환 모델은 대화 내용을 기억하고 100개 이상의 언어로 말할 수 있도록 설계되었습니다.
도구 액세스가 가능한 1초 미만의 대화 에이전트를 위한 SpaceXAI의 현재 실시간 음성 대 음성 모델입니다.
이 라이브러리를 사용하는 방법
실제 제품 결정을 위한 실용적인 API 정보가 포함된 선별된 교차 카테고리 세트인 개척자, 전문가 및 카테고리 정의 모델입니다.
Cody는 범용 품질 리더보드를 실행하지 않습니다. 공급자 청구에는 라벨이 지정되어 있으며 가격에는 세금 및 옵션 도구가 제외되어 있으며 프로덕션 구매자는 모델을 선택하기 전에 실시간 공급자 조건을 확인해야 합니다.
기술 제한, 수명 주기, 가격 책정, 지역별 액세스 및 데이터 정책이 있는 경우 자사 문서를 사용하세요.
동일한 카테고리 내의 모델만 비교하고 각 제공업체의 측정 기준을 유지하세요.
제공자가 비교 가능한 사실을 추정하는 대신 공개하지 않은 경우 표시 미공개입니다.
가격과 가용성을 날짜가 지정된 스냅샷으로 처리하고 모든 페이지를 실시간 제공업체 문서에 연결하세요.
음성 대기 시간, 텍스트 처리량, 비디오 렌더링 시간 및 월드 모델 프레임 속도는 서로 바꿔 사용할 수 없습니다.
누락된 출시 날짜, 국가 목록 또는 지연 시간 번호는 예상 대신 게시되지 않음으로 표시됩니다.
모델 페이지는 기본 소스에 연결되며 가격, 액세스 및 정책이 마지막으로 확인된 시기를 표시합니다.
모델을 작업에 활용
Cody의 확장된 프롬프트 플레이북과 선별된 에이전트 기술을 사용하여 모델 선택을 반복 가능한 워크플로로 전환하세요.