// STADT-BREMERHAVEN — INTELLIGENZA ARTIFICIALE
Meta Muse Voice Transcribe: Spracherkennung in Echtzeit für den Mac
von Benjamin Mamerow
2. Sep. 2026 |
0
Meta stellt mit Muse Voice Transcribe ein neues Modell für Entwickler vor, das gesprochene Sprache ohne Verzögerung in Text umwandeln können soll. Das Modell steckt bereits in mehreren Produkten: in der Mac-App von Meta AI, im Entwickler-Tool Muse Code und als offene Schnittstelle, die auch andere Entwickler nutzen können.
Statt mehrere Einzelschritte hintereinander abzuarbeiten, erledigt das System drei Aufgaben gleichzeitig: Es erkennt die Sprache selbst, unterscheidet zwischen mehr als 20 verschiedenen Stimmen und erkennt, wann jemand eine Pause macht. Eine nachträgliche Bearbeitung der Transkription ist dadurch nicht mehr nötig. Was die Sprachvielfalt angeht, wurde das Modell auf über 70 Sprachen trainiert, zum Marktstart sind allerdings erst 25 davon offiziell geprüft und freigegeben.
Innerhalb eines Satzes kann zwischen verschiedenen Sprachen gewechselt werden, ohne dass das System aus dem Takt kommt. Auch längere Aufnahmen über 60 Minuten sollen möglich sein. Für Entwickler, die das Modell über die API einbinden wollen, fallen Kosten von 3 US-Dollar pro 1.000 Audiominuten an, was ungefähr 0,18 US-Dollar pro Stunde entspricht.
Der technische Ansatz hier nennt sich Adaptive Delay. Statt sich fest zwischen schneller Verarbeitung und hoher Genauigkeit zu entscheiden, wägt das Modell so bei jedem Wort neu ab, wie viel Kontext gebraucht wird. Einfache, alltägliche Wörter werden sofort ausgegeben, bei komplizierteren Formulierungen wartet das System einen kurzen Moment, um die Fehlerquote niedrig zu halten.
Hinweis: Dieser Artikel enthält Affiliate-Links. Kauft ihr darüber ein, erhalten wir eine kleine Provision - ohne Aufpreis für euch und ohne Einfluss auf unsere redaktionelle Meinung.