Whisper
✓ geprüft, Sync 2026-08-20Whisper is a general-purpose speech recognition model developed by OpenAI. It is trained on a large dataset of diverse audio and is also a multi-task model that can perform multili….
Was es tut.
Whisper ist ein allgemeines Spracherkennungsmodell, das von OpenAI entwickelt wurde. Es wurde auf einem großen Datensatz mit vielfältigen Audioinhalten trainiert und ist auch ein Multitasking-Modell, das mehrsprachige Spracherkennung sowie Sprachübersetzung und Sprachidentifikation durchführen kann. Whisper verwendet ein Transformer-Sequenz-zu-Sequenz-Modell, das auf verschiedene Aufgaben der Sprachverarbeitung trainiert wurde, einschließlich mehrsprachiger Spracherkennung, Sprachübersetzung, Identifikation gesprochener Sprachen und Sprachaktivitätsdetektion. Diese Aufgaben werden gemeinsam als eine Sequenz von Token dargestellt, die vom Dekodor vorhergesagt werden sollen, wodurch ein einziges Modell mehrere Stufen einer traditionellen Sprachverarbeitungspipeline ersetzen kann. Das Multitasking-Trainingsformat verwendet eine Reihe spezieller Token, die als Aufgabenbezeichner oder Klassifikationsziele dienen.
Funktionen
- Mehrsprachige Spracherkennung
- Sprachübersetzung
- Spracherkennung
- Sprachaktivitätsdetektion