Speech-to-Text auf dem Mac: 5 Wege, gesprochene Sprache in Text zu verwandeln (2026)

Speech-to-Text auf dem Mac: 5 Wege, gesprochene Sprache in Text zu verwandeln (2026)

Speech-to-Text auf dem Mac – Anleitung

„Speech-to-Text auf dem Mac" meint in der Praxis zwei verschiedene Aufgaben, die oft durcheinandergeworfen werden: live diktieren, während man spricht, und eine bereits aufgenommene Datei transkribieren, etwa einen Meeting-Mitschnitt, ein Interview oder eine Sprachmemo. macOS deckt die erste Aufgabe kostenlos und gut ab. Für die zweite gibt es mit der App „Sprachmemos" seit macOS 15 einen eingebauten, aber eng begrenzten Weg; für alles andere braucht es ein separates Werkzeug.

Transparenzhinweis: Ich leite Subanana, ein Transkriptions-Tool, und beschreibe weiter unten auch die Software-Lösung für die zweite Aufgabe.

Live diktieren am Mac: die eingebauten Optionen

Die macOS-Diktierfunktion

Die Diktierfunktion ist in jeder App verfügbar, die Text entgegennimmt: Mail, Notizen, ein Textfeld im Browser. Aktivieren lässt sie sich unter Apple-Menü → Systemeinstellungen → Tastatur, wo der Abschnitt „Diktierfunktion" eingeschaltet wird; danach reicht der Tastaturkurzbefehl, die Mikrofon-Taste (sofern vorhanden) oder „Bearbeiten" → „Diktat starten", um zu starten. In unterstützten Sprachen setzt die Funktion Kommas, Punkte und Fragezeichen automatisch, ohne dass man sie ansagen muss; abschalten lässt sich das unter „Tastatur" → „Diktat" über die Option „Automatische Interpunktion". Ein wichtiger Vorbehalt direkt von Apple: die Diktierfunktion ist nicht in allen Sprachen oder Regionen verfügbar, und der Funktionsumfang unterscheidet sich je nach Sprache.

Sprachsteuerung (Voice Control)

Wer den ganzen Mac statt nur einzelner Textfelder per Sprache bedienen will, Menüs öffnen, klicken, scrollen, findet das unter Sprachsteuerung, einer separaten Bedienungshilfe. Ist sie aktiviert, lässt sie sich auch zum reinen Diktieren nutzen; die Standard-Diktierfunktion ist dann nicht gleichzeitig verfügbar, solange die Sprachsteuerung aktiviert ist. Für die meisten, die nur Text eintippen wollen, bleibt die einfache Diktierfunktion der direktere Weg. Sprachsteuerung lohnt sich vor allem, wenn die komplette Bedienung per Stimme das Ziel ist, nicht nur das Diktieren selbst.

Drittanbieter-Diktier-Apps

Daneben hat sich eine eigene Kategorie von Mac-Apps etabliert, die Diktieren systemweit schneller und flexibler machen als Apples Bordmittel: mit eigenen Tastenkürzeln, Wörterbüchern für Fachbegriffe und teils lokaler Verarbeitung ganz ohne Internetverbindung. Sie lösen dieselbe Aufgabe wie die macOS-Diktierfunktion, oft mit mehr Kontrolle über Tempo und Formatierung. Wie Apples eigene Lösung bleiben sie dabei auf live gesprochenen Text ausgerichtet.

Sprachmemos: die eingebaute Transkription für App-eigene Aufnahmen

Seit macOS 15 (oder neuer) kann die App „Sprachmemos" auf einem Mac mit Apple Chips Gesprochenes in den eigenen Audioaufnahmen erkennen und als Text transkribieren; das Transkript lässt sich während oder nach der Aufnahme direkt in der App ansehen. Das erfasst zum Beispiel eine am Mac aufgenommene Sprachmemo oder eine vom iPhone synchronisierte; auch ältere Aufnahmen, die auf macOS 14 oder einem nicht unterstützten Gerät entstanden sind, transkribiert die App beim Öffnen automatisch nach.

Zwei Einschränkungen direkt von Apple: Vorausgesetzt sind mindestens macOS 15 und ein Mac mit Apple Chips — ältere macOS-Versionen oder Intel-Macs bleiben außen vor. Und die Audiotranskription ist nicht in allen Ländern oder Regionen verfügbar.

Das Sprachmemos-Transkript ist reiner Text zum Ansehen in der App. Für Sprechertrennung bei mehreren Stimmen oder eine automatische Zusammenfassung ist weiter unten der Subanana-Workflow beschrieben.

Die Grenze der App bleibt: Ein aufgezeichnetes Zoom-Meeting, ein Interview vom separaten Diktiergerät oder eine Audiodatei aus einer anderen Quelle sind keine Sprachmemos-Aufnahmen — dafür braucht es ein eigenständiges Transkriptions-Tool.

Bereits aufgenommene Audio- und Videodateien transkribieren

Für alles, was nicht als eigene Sprachmemos-Aufnahme vorliegt — ein aufgezeichnetes Zoom-Meeting, ein Interview vom Diktiergerät, eine Audiodatei aus einer anderen Quelle —, ist auch die eingebaute Transkription oben keine Option. Gefragt ist ein eigenständiges Transkriptions-Tool: eine fertige Datei hochladen und Text zurückbekommen, ohne den Inhalt noch einmal laut vorzulesen oder auf eine kompatible Sprachmemos-Aufnahme angewiesen zu sein.

Entscheidungshilfe: Live diktieren oder Datei transkribieren?

Mit Subananas Transkriptions-Tool läuft das in drei Schritten:

  1. Datei hochladen. Audio oder Video, egal ob vom Mac, iPhone-Sprachmemo oder Meeting-Mitschnitt, und die Ausgangssprache wählen.
  2. Transkribieren lassen. Subanana testet laufend mehrere Spracherkennungsmodelle gegeneinander und leitet jede Datei an das für ihre Sprache stärkste Modell weiter. Das Ergebnis ist ein interpunktiertes Transkript mit Sprechertrennung, wenn mehrere Personen zu hören sind.
  3. Glossar ergänzen. Bei Fachbegriffen oder Eigennamen fixiert ein geteiltes Glossar für den ganzen Arbeitsbereich oder eine projektgebundene Liste die richtige Schreibweise schon vor der Transkription. Das erspart die Zeile-für-Zeile-Korrektur danach.

Im Meeting-Modus fasst ein Zusammenfassungs-Schritt anschließend die wichtigsten Punkte und Entscheidungen zusammen; das Transkript selbst lässt sich als TXT, DOCX, XLSX oder Markdown exportieren. In der kostenlosen Version lässt sich das Ergebnis ohne Kreditkarte in einer Vorschau ansehen (die ersten 15 Minuten je Datei); der Export selbst braucht einen bezahlten Plan, ab 9 USD/Monat bei jährlicher Abrechnung (Einzelheiten auf der Preisseite).

Vergleich: Welche Methode für welchen Zweck?

MethodeWofür geeignetKostenVerarbeitungQuelle
macOS-DiktierfunktionLive-Text in beliebiger App diktierenKostenlos, in macOS enthaltenAutomatische Zeichensetzung in unterstützten Sprachen; Verfügbarkeit variiert je nach Sprache/RegionApple Support, „Nachrichten und Dokumente auf dem Mac diktieren"
SprachsteuerungMac komplett per Stimme bedienen, inkl. DiktatKostenlos, in macOS enthaltenErsetzt die Standard-Diktierfunktion, solange die Sprachsteuerung aktiviert istApple Support, dieselbe Quelle
SprachmemosBereits aufgenommene Sprachmemo transkribieren, wenn sie in der App liegtKostenlos, in macOS enthaltenNur ab macOS 15 + Apple Chip; nicht in allen Ländern/Regionen verfügbar; Transkript als reiner Text in der AppApple Support, „Anzeigen einer Transkription der App Sprachmemos auf dem Mac"
SubananaBereits aufgenommene Audio-/Videodateien transkribieren, mit Sprechertrennung und ZusammenfassungKostenlose Vorschau (15 Min./Datei); Export ab 9 USD/Monat, jährlich abgerechnetCloud-Verarbeitung, mehrere STT-Modelle im Wettbewerb je Sprachesubanana.com/de/pricing

Als Faustregel: Existiert die Aufnahme schon als Datei, ist der Umweg über Diktieren meist langsamer als der direkte Upload.

Speech-to-Text auf dem Mac: häufige Fragen

Wie aktiviere ich Spracherkennung auf dem Mac?

Für die eingebaute Diktierfunktion: Apple-Menü → Systemeinstellungen → Tastatur, dort den Abschnitt „Diktierfunktion" einschalten. Danach lässt sich in jeder App per Tastaturkurzbefehl, Mikrofon-Taste (sofern vorhanden) oder „Bearbeiten" → „Diktat starten" diktieren.

Wie wandle ich Sprache in Text auf dem Mac um?

Zwei getrennte Wege, je nach Ausgangslage. Für spontanes Tippen per Stimme reicht die macOS-Diktierfunktion aus dem ersten Abschnitt. Für eine Datei, die schon aufgenommen ist, siehe den Transkriptions-Workflow weiter oben; der Text kommt dabei aus dem Upload, nicht aus erneutem Sprechen.

Hat macOS eine eingebaute Sprachausgabe?

Das ist die umgekehrte Richtung: Text zu Sprache statt Sprache zu Text. macOS bringt dafür eine eigene, von der Diktierfunktion getrennte Funktion mit, die markierten Text vorliest; sie liegt in einem anderen Bereich der Systemeinstellungen als „Tastatur" (wo die Diktierfunktion sitzt). Für Speech-to-Text, die Richtung, um die es in diesem Beitrag geht, ist sie nicht relevant.

Wie transkribiere ich Audio in Text auf dem Mac?

Datei in ein Transkriptions-Tool laden, Sprache bestätigen, Ergebnis abwarten. Bei Subanana kommt dabei ein interpunktiertes Transkript mit Sprechertrennung heraus, plus optional eine Zusammenfassung im Meeting-Modus, exportierbar in mehreren Formaten. Das deckt Meetings, Interviews und Sprachmemos ab, für die Diktieren ungeeignet ist, weil der Ton bereits existiert statt live gesprochen zu werden.

Weiterführend

Kommt der Ton vom iPhone statt vom Mac? Unser Leitfaden zu iPhone-Sprachmemos zeigt, wo das eingebaute Transkript aufhört und wann sich ein separates Tool lohnt. Dieselbe Logik gilt auch für Sprachmemos allgemein. Für alle anderen Dateiformate (MP3, WAV, M4A) gibt unser Leitfaden zum Transkribieren von Audiodateien den vollständigen Workflow. Wer dienstlich aufnimmt und auf DSGVO-Konformität achten muss, findet die rechtlichen Grundlagen in unserem Beitrag zum DSGVO-konformen Transkribieren.

Schluss mit dem Abtippen.

Aus Gesprochenem wirdArbeit, die Sie ausliefern können.

Kostenlos starten