Alle Modelle
ElevenLabs

Scribe v2

Das mehrsprachige Speech-to-Text-Modell von ElevenLabs für detaillierte Transkripte mit vielen Sprechern, Wortzeit, Audioereignissen und großen benutzerdefinierten Schlüsselbegriffslisten.

Übersicht in einfacher englischer Sprache

Was Scribe v2 eigentlich ist

Scribe v2 verwandelt lange Audio- oder Videodateien in strukturierte Transkripte mit Spracherkennung, Wortzeitstempeln, Sprechertagebüchern und Audio-Tags für Ereignisse, die über die Sprache hinausgehen. Schlüsselbegriffseingaben helfen Teams dabei, Namen, Produkte und Vokabeln beizubehalten, die bei allgemeinen Erkennungsmodellen häufig fehlen.

ElevenLabs bietet Dateitranskription und eine separat kostenpflichtige Echtzeitroute. Die breitere Plattform bietet auch Sprach- und Agentenprodukte, die Audio-Pipelines eines Anbieters vereinfachen können, obwohl jede Funktion über eigene Abrechnungs- und Datenkontrollen verfügt.

Gute Passform für

  • Mehrsprachige Medientranskription
  • Aufnahmen mit vielen Sprechern oder Klangereignissen
  • Audio-Stacks verwenden bereits ElevenLabs

Kategorievergleich

Die Fakten, die für die transkription-Modelle wichtig sind

Hierbei handelt es sich um vom Anbieter veröffentlichte Spezifikationen, nicht um Cody-Benchmark-Ergebnisse. Folgen Sie den verlinkten Quellen für aktuelle Grenzwerte und endpunktspezifische Ausnahmen.

Transkriptionspreis
0,22 $/Audiostunde; Echtzeit separat aufgeführtAktueller Anbieterpreis pro Audiostunde oder Minute für den aufgeführten Verarbeitungsweg.
Live oder Batch
Batch- und langes Audio; separate EchtzeitrouteOb das Modell Echtzeit-Streams, hochgeladene Aufzeichnungen oder beides verarbeitet.
Sprachen
Über 90 SprachenVom Anbieter veröffentlichte Sprachabdeckung, die bei Bedarf geschulte oder beworbene Abdeckung von speziell verifizierten Sprachen trennt.
Lautsprecheretiketten
Bis zu 32 LautsprecherOb das Modell identifiziert, wer gesprochen hat, und ob ein veröffentlichtes Sprecherlimit vorliegt.
Zeitstempel
Zeitstempel auf WortebeneVerfügbare Timing-Informationen auf Wort-, Segment- oder Äußerungsebene.
Vokabelkontrolle
Bis zu 1.000 Schlüsselbegriffe; Audio-Tags und SpracherkennungKeyword-Boosting, benutzerdefinierte Rechtschreibung, Kontext, Eingabeaufforderungen oder andere Möglichkeiten zur Verbesserung von Domain-Begriffen.
Wo kann man es verwenden?
ElevenLabs Speech-to-Text-APIDirekte API, Cloud-Katalog, Anwendung oder regionaler Endpunkt, dokumentiert vom Anbieter.

Preise und Vergleiche

Kosten schätzen

Geben Sie Ihre Nutzung ein. Die Schätzung wird sofort aktualisiert.

Nutzt die Aufnahmedauer in Stunden: 30 Minuten = 0,5 Stunden. Zusatzfunktionen und Mindestgebühren können die Rechnung ändern.

Scribe v2

ElevenLabs

Geschätzte Summe (USD)

Kein geprüfter Preis

Für die angegebene Nutzung · USD · API-Preis, kein Abonnement

So funktioniert die Schätzung

Schätzungen ohne Steuern, Tools, Cache-Speicherung/-Schreiben, Freikontingente und individuelle Rabatte. Bei Bildern zählt nur die Ausgabe, nicht Prompt oder Referenzbilder. Qualitätsmodi unterscheiden sich. Nicht aufgeführte Einstellungen gelten nicht als kostenlos.

API- und Provider-Zugriff

Wo bekomme ich Scribe v2?

Verfügbarkeit

Regionen und Zugriffsphase

Verfügbar über die ElevenLabs Speech-to-Text-API und Produktschnittstellen; Echtzeit verwendet eine separate Modellroute.

Globale Optionen und Datenresidenzoptionen hängen vom ElevenLabs-Plan, dem Endpunkt und der Unternehmenskonfiguration ab.

Überprüfen Sie die Live-Verfügbarkeit

Daten und Schulung

Die Route ist wichtig.

Mit ElevenLabs können berechtigte API-Kunden ihre Datennutzungspräferenzen verwalten. Die Nulldatenaufbewahrung durch enable_logging=false ist auf qualifizierte Unternehmenskonfigurationen und unterstützte Modelle beschränkt, einschließlich Scribe v2; Überprüfen Sie den Live-Plan und den regionalen Endpunkt.

Hierbei handelt es sich um eine prägnante Lektüre des zitierten Anbietermaterials und nicht um eine Rechtsberatung. Ein Drittanbieter-Gateway kann andere Speicher-, Routing-, Schulungs- und Residenzbedingungen haben als die direkte API des Modellherstellers.

Lesen Sie die Richtlinien des Anbieters

Häufig gestellte Fragen

Scribe v2 FAQ

Was ist Scribe v2?

Das mehrsprachige Speech-to-Text-Modell von ElevenLabs für detaillierte Transkripte mit vielen Sprechern, Wortzeit, Audioereignissen und großen benutzerdefinierten Schlüsselbegriffslisten. Scribe v2 verwandelt lange Audio- oder Videodateien in strukturierte Transkripte mit Spracherkennung, Wortzeitstempeln, Sprechertagebüchern und Audio-Tags für Ereignisse, die über die Sprache hinausgehen. Schlüsselbegriffseingaben helfen Teams dabei, Namen, Produkte und Vokabeln beizubehalten, die bei allgemeinen Erkennungsmodellen häufig fehlen.

Wann wurde Scribe v2 veröffentlicht?

Scribe v2 wurde gemäß den zitierten Anbietermaterialien auf 9. Januar 2026 veröffentlicht.

Wo kann ich auf Scribe v2 zugreifen?

Verfügbar über die ElevenLabs Speech-to-Text-API und Produktschnittstellen; Echtzeit verwendet eine separate Modellroute. Die in diesem Handbuch aufgeführten Zugriffsrouten sind ElevenLabs und ElevenLabs API.

Wie viel kostet Scribe v2?

0,22 $/Audiostunde für Scribe v2. ElevenLabs listet separate Preise für Batch Scribe v2 und Scribe v2 Realtime auf. Die Erkennung und Schwärzung von Entitäten kann separat in Rechnung gestellt werden.

Wo ist Scribe v2 erhältlich?

Verfügbar über die ElevenLabs Speech-to-Text-API und Produktschnittstellen; Echtzeit verwendet eine separate Modellroute. Globale Optionen und Datenresidenzoptionen hängen vom ElevenLabs-Plan, dem Endpunkt und der Unternehmenskonfiguration ab.

Werden meine Scribe v2-API-Daten für das Training verwendet?

Mit ElevenLabs können berechtigte API-Kunden ihre Datennutzungspräferenzen verwalten. Die Nulldatenaufbewahrung durch enable_logging=false ist auf qualifizierte Unternehmenskonfigurationen und unterstützte Modelle beschränkt, einschließlich Scribe v2; Überprüfen Sie den Live-Plan und den regionalen Endpunkt. Die Richtlinie gehört zu den Routen- und Kontobedingungen des Anbieters. Überprüfen Sie sie daher vor der produktiven Nutzung erneut.