Spracherkennungssoftware vergleichen: Genauigkeit, Sprechererkennung, Sprachen und Datenschutz

Spracherkennungssoftware vergleichen: Genauigkeit, Sprechererkennung, Sprachen und Datenschutz

"Spracherkennungssoftware" ist im Deutschen ein Sammelbegriff für zwei ziemlich unterschiedliche Werkzeuge. Die einen – Dragon von Nuance ist der bekannteste Name – wandeln Sprache in Echtzeit in Text um, während Sie in eine beliebige Anwendung sprechen: E-Mail, Word, ein Formular. Die anderen nehmen eine bereits existierende Aufnahme – ein Meeting, ein Interview, eine Sprachmemo – und liefern Ihnen ein sauberes, durchsuchbares Transkript. Beide Kategorien laufen unter demselben Suchbegriff, lösen aber unterschiedliche Probleme.

Die meisten Vergleichsartikel vermischen das und werfen fünf, sechs Tools in eine Tabelle, ohne zu klären, welches Problem der Leser eigentlich hat. Das Ergebnis: Wer eine Lösung für "in Word diktieren" sucht, landet bei einem Transkriptionstool, das das gar nicht kann – und umgekehrt.

Dieser Artikel macht die Unterscheidung zuerst, dann vergleicht er innerhalb jeder Kategorie: Dragon Professional und die in Windows eingebaute Spracherkennung fürs Live-Diktat, Sonix und Subanana fürs Transkribieren bestehender Aufnahmen. Offenlegung vorab: Ich betreibe Subanana selbst und decke unten auch ab, für wen es die falsche Wahl ist.

Vergleich von Spracherkennungssoftware: Dragon, Sonix und Subanana

Methodik

Die Angaben zu Dragon stammen von der offiziellen deutschen Produktseite dragon.nuance.com/de-de/dragon-professional und dem zugehörigen Nuance-Shop, beide in dieser Session abgerufen. Die Angaben zu Sonix stammen von sonix.ai inklusive der öffentlichen Preisseite, ebenfalls in dieser Session abgerufen. Die Angaben zu Subanana stammen aus der eigenen Produktdokumentation. Herstellerangaben zur Erkennungsgenauigkeit sind als solche gekennzeichnet – es handelt sich um Marketingaussagen der jeweiligen Anbieter, nicht um unabhängig geprüfte Benchmarks.

Live-Diktat: Sprache wird sofort zu Text, während Sie sprechen

Diese Kategorie ersetzt die Tastatur. Sie sprechen, der Text erscheint sofort im aktiven Fenster – E-Mail-Programm, Textverarbeitung, Formular. Das Mikrofon ist durchgehend aktiv, die Software läuft systemweit im Hintergrund.

Dragon Professional v16 (Nuance)

Dragon ist der Platzhirsch dieser Kategorie und praktisch gleichbedeutend mit "Spracherkennung" im deutschsprachigen Raum. Die aktuelle Version, Dragon Professional v16, ist laut Nuance für Windows 11 optimiert und abwärtskompatibel mit Windows 10 – die Software läuft ausschließlich unter Windows, es gibt keine aktuelle Mac-Version im Produktangebot.

Nuance selbst beschreibt Dragon Professional v16 als Lösung für Front- und Backend: Diktieren in Echtzeit einerseits, Transkription bereits vorhandener Audiodateien andererseits ("Kombinieren Sie Dragon mit einem digitalen Aufnahmegerät, um Informationen von Kundenmeetings festzuhalten und später mit Dragon zu transkribieren"). Der Kern des Produkts und der Grund, warum es den Markt seit über 25 Jahren dominiert, bleibt aber das Diktieren: eigene Sprachbefehle und Makros zur Automatisierung wiederkehrender Textbausteine, Signaturen und mehrstufiger Workflows, dazu individuelle Wortlisten für Fachvokabular.

Nuance wirbt mit einer Erkennungsgenauigkeit von "bis zu 99 %" und einer dreifachen Geschwindigkeit gegenüber dem Tippen – beides Herstellerangaben, keine unabhängig verifizierten Werte. Die Produktlinie richtet sich klar an Fachanwender: Neben Dragon Professional gibt es eigene Varianten für Recht (Dragon Legal), eine mobile Variante (Dragon Anywhere Mobile) sowie Branchenpakete für Behörden, Banken, Versicherungen und das Gesundheitswesen. Eine frei zugängliche Preisliste für den deutschen Markt zeigt die Nuance-Seite nicht – Interessenten werden zum Fachhandel oder zur individuellen Beratung weitergeleitet, was zum unternehmensorientierten Vertriebsmodell passt. Eine separate Consumer-Variante ("Dragon Home") führt die aktuelle Produktübersicht nicht mehr; das Sortiment ist heute auf Dragon Professional, Dragon Legal und die jeweiligen Anywhere-Varianten konzentriert.

Für wen: Vielschreiber unter Zeitdruck, die dauerhaft in Windows-Anwendungen diktieren wollen – Ärzt:innen, Jurist:innen, Sachbearbeitung mit hohem Dokumentationsaufwand. Der Einmalkauf plus der Windows-Zwang machen Dragon für Gelegenheitsnutzer:innen oder Mac-Anwender:innen unattraktiv.

Windows-integrierte Spracherkennung

Wer nur gelegentlich diktieren möchte und kein Budget für eine dedizierte Lösung hat, hat mit der in Windows eingebauten Spracherkennung bereits eine kostenlose Option auf dem Rechner – ganz ohne zusätzliche Installation. Sie deckt die Grundfunktionen ab (Text diktieren, Cursor per Sprache steuern), kommt aber nicht an Dragons Fachvokabular, Makros oder Genauigkeitsanspruch heran. Eine ausführliche Einrichtungsanleitung inklusive der Grenzen im Alltag haben wir in einem eigenen Beitrag zusammengefasst: Windows-Spracherkennung einrichten und nutzen.

Auch Words eingebaute Diktierfunktion gehört in diese Kategorie – praktisch, wenn Sie ausschließlich in Word arbeiten, aber eben auf dieses eine Programm beschränkt.

Transkription bestehender Aufnahmen: aus Audio wird ein fertiges Dokument

Diese Kategorie löst ein anderes Problem: Sie haben bereits eine Aufnahme – ein aufgezeichnetes Meeting, ein Interview, eine Sprachmemo vom Diktiergerät oder Smartphone, ein importiertes Video – und wollen daraus ein sauberes, durchsuchbares Transkript oder Untertitel. Es wird nicht live mitgeschrieben, während jemand spricht; die Datei wird hochgeladen oder importiert und im Nachgang verarbeitet.

Sonix

Sonix ist ein browserbasiertes Transkriptions- und Untertitel-Tool aus San Francisco (gegründet 2017), das sich an Journalist:innen, Forschung, Rechts- und Medienbranche richtet. Laut eigener Angabe unterstützt die Plattform mehr als 54 Sprachen inklusive automatischer Übersetzung, Sprechertrennung und Zeitstempeln; die eigene Marketingaussage zur Erkennungsgenauigkeit liegt bei "99 %" – auch hier eine Herstellerangabe.

Die Preisstruktur ist nutzungsbasiert: Pay-as-you-go kostet 10 US-Dollar pro Stunde Audiomaterial ohne Abo, der Core-Plan liegt bei 25 US-Dollar im Monat für 5 Stunden Transkription, Advanced bei 50 US-Dollar für 20 Stunden, Pro bei 80 US-Dollar für 40 Stunden (Preise laut sonix.ai, Stand dieser Session, exklusive USt.; Sonix rechnet ausschließlich in US-Dollar ab). Exportiert wird als DOCX, PDF, TXT sowie SRT und VTT für Untertitel; SOC 2 Type II und HIPAA-Konformität richten sich an regulierte Branchen wie Recht und Gesundheitswesen.

Für wen: Teams mit hohem, planbarem Stundenvolumen, die stundenweise abrechnen wollen, oder regulierte Branchen mit Compliance-Anforderungen.

Subanana

Subanana verarbeitet ebenfalls bestehende Aufnahmen statt Live-Diktat: Meetings, Interviews, Sprachmemos und hochgeladene Audio- oder Videodateien werden zu Transkript, Meeting-Zusammenfassung oder Untertiteln. Dateien lassen sich direkt hochladen (Audio und Video, bis 30 GB oder 8 Stunden Länge – auf allen Plänen inklusive des kostenlosen), per öffentlichem Link von YouTube, Instagram oder Facebook importieren, oder direkt im Browser als Mikrofon- beziehungsweise Bildschirmaufnahme erfassen. Für wiederkehrende Meetings gibt es zusätzlich eine Bot-Integration für Google Meet und Microsoft Teams, die die Aufzeichnung im Nachgang automatisch transkribiert; Zoom lässt sich über eine Chrome-Erweiterung erfassen.

Statt auf ein einzelnes Spracherkennungsmodell zu setzen, wird laufend zwischen mehreren aktuellen Modellen verglichen und pro Ausgangssprache das jeweils am besten bewertete ausgewählt – inklusive automatischer Nachkontrolle, die auffällige Ausreißer erkennt und mit einem anderen Modell neu verarbeitet. Ein Fachvokabular-Glossar (workspace- und projektweit, auch als XLSX/CSV-Bulk-Import) sorgt dafür, dass Eigennamen und Fachbegriffe konsistent bleiben. Exportiert wird als SRT, VTT, TXT, DOCX, XLSX oder Markdown, inklusive zweisprachiger SRT-Dateien und Video-Export mit eingebrannten Untertiteln.

Der kostenlose Plan zeigt die ersten 15 Minuten jeder Datei zur Vorschau, exportiert aber nur ein wasserzeichenversehenes Video – für Transkript- oder Untertitel-Export braucht es einen bezahlten Plan. Die bezahlten Pläne starten bei 18 US-Dollar im Monat (Lite, ab 9 US-Dollar bei Jahreszahlung) und reichen bis 75 US-Dollar im Monat (Max, ab 50 US-Dollar bei Jahreszahlung) mit steigendem Minutenkontingent.

Neben der Transkription bestehender Aufnahmen gibt es außerdem eine Live-Untertitel-Funktion für Veranstaltungen und Vorträge: Das Mikrofon wird live erfasst und Zuschauer:innen verfolgen die Untertitel – optional live übersetzt – über einen geteilten Link auf ihrem eigenen Gerät. Das ist etwas anderes als Diktieren in eine Anwendung: Der Text landet nicht im aktiven Fenster einer beliebigen Software, sondern auf den Bildschirmen der Zuschauer:innen, und lässt sich im Nachgang nicht exportieren.

Für wen: Wer wiederkehrend Meetings, Interviews oder andere bestehende Aufnahmen in Text verwandeln will, ohne stundenweise abzurechnen, und wem mehrsprachige Untertitel oder eine Meeting-Zusammenfassung wichtig sind.

Vergleichstabelle

Vergleich von Dragon Professional, Windows-Spracherkennung, Sonix und Subanana: Live-Diktat vs. Transkription bestehender Aufnahmen, Sprachen und Einstiegspreis

SoftwareHauptzweckPlattformLive-Diktat in beliebige AppsBestehende Aufnahmen transkribierenSprachenEinstiegspreis
Dragon Professional v16Live-Diktat (+ Batch-Transkription)WindowsJaJa (mit Aufnahmegerät kombiniert)Deutsch + weitere, Anzahl nicht öffentlich beziffertPreis auf Anfrage / Fachhandel
Windows-SpracherkennungLive-Diktat, BasisfunktionenWindowsJaNeinSystemsprachen von WindowsKostenlos (in Windows enthalten)
SonixTranskription bestehender AufnahmenBrowser (alle Plattformen)NeinJa54+10 US-$/Std. (PAYG) oder ab 25 US-$/Monat
SubananaTranskription bestehender Aufnahmen + Meeting-ZusammenfassungBrowser (alle Plattformen)NeinJa95+Kostenlos (Vorschau) / ab 18 US-$/Monat für Export

Live-Diktat = Text erscheint sofort in einer beliebigen aktiven Anwendung, während gesprochen wird. Preise Stand dieser Session, Nettopreise in US-Dollar, jeweils vom Hersteller selbst angegeben.

Welche Software passt zu Ihnen?

Die Antwort hängt fast vollständig davon ab, wann der Text entstehen soll.

Sie wollen sofort diktieren, während Sie sprechen – in E-Mail, Word oder einem Formular: Dann brauchen Sie eine Diktier-Software. Bei gelegentlichem Bedarf reicht die kostenlose Windows-Spracherkennung oder Words Diktierfunktion für den Einstieg. Bei hohem, täglichem Diktatvolumen mit Fachvokabular – etwa in Kanzlei oder Praxis – lohnt sich der Umstieg auf Dragon Professional, vorausgesetzt Sie arbeiten unter Windows.

Sie haben bereits eine Aufnahme – Meeting, Interview, Sprachmemo, Vortrag – und wollen daraus ein Transkript, eine Zusammenfassung oder Untertitel: Dann ist ein Transkriptionstool die richtige Kategorie, kein Diktierprogramm. Bei planbarem, hohem Stundenvolumen und Compliance-Anforderungen ist Sonix mit stundenbasierter Abrechnung eine Option. Für wiederkehrende Meetings, mehrsprachige Untertitel oder wenn Sie erst unverbindlich testen wollen, bevor Sie zahlen, ist Subanana die naheliegendere Wahl – inklusive kostenloser Vorschau ohne Kreditkarte.

Eine Mischung aus beidem: Manche Arbeitsalltage brauchen tatsächlich beides – tägliches Diktieren in Word und wöchentliche Meeting-Protokolle aus Aufzeichnungen. In dem Fall sind zwei spezialisierte Tools meist die bessere Lösung als der Versuch, eines für beide Aufgaben zu zweckentfremden; die beiden Kategorien sind technisch zu unterschiedlich aufgebaut, um sich gegenseitig gut zu ersetzen.

Häufige Fragen

Welche Spracherkennungssoftware ist die beste?

Das kommt auf die Aufgabe an. Für Live-Diktat in beliebige Windows-Anwendungen ist Dragon Professional der etablierte Marktführer mit dem größten Funktionsumfang für Fachanwender:innen. Für die Transkription bestehender Aufnahmen – Meetings, Interviews, Sprachmemos – ist "die beste" Software eher eine Frage von Preismodell und Anwendungsfall: stundenbasiert und Compliance-orientiert (Sonix) oder mit kostenloser Vorschau, mehrsprachigen Untertiteln und Meeting-Fokus (Subanana). Es gibt kein Tool, das beide Kategorien gleich gut abdeckt.

Welche kostenlose Spracherkennungssoftware gibt es?

Für Live-Diktat ist die in Windows eingebaute Spracherkennung komplett kostenlos und ohne Zusatzinstallation nutzbar, ebenso Words eingebaute Diktierfunktion innerhalb von Microsoft Office. Für die Transkription bestehender Aufnahmen bietet Subanana einen kostenlosen Plan ohne Kreditkarte, der die ersten 15 Minuten jeder Datei zur Vorschau anzeigt – für den Export als Transkript oder Untertitel ist allerdings ein bezahlter Plan nötig.

Welche Spracherkennungs-App ist die beste?

Auch hier zählt der Zweck. Für mobiles Diktieren bietet Nuance mit Dragon Anywhere Mobile eine eigene App im Dragon-Ökosystem an. Für unterwegs aufgenommene Sprachmemos, die im Nachgang zu Text werden sollen, ist das Smartphone als Diktiergerät in Kombination mit einer browserbasierten Transkriptionslösung oft die praktikablere Kombination, weil die Aufnahme und die Textverarbeitung nicht an eine einzelne App gebunden sind.

Wie kann ich gesprochenen Text in Schrift umwandeln?

Zwei Wege, je nach Situation. Wenn Sie gerade sprechen und der Text sofort erscheinen soll, brauchen Sie Diktier-Software wie Dragon oder die Windows-Spracherkennung. Wenn bereits eine Aufnahme existiert – etwa eine WhatsApp-Sprachnachricht oder ein Sprachmemo – laden Sie die Datei einfach in ein Transkriptionstool wie Subanana hoch; das System wandelt sie automatisch in Text um, den Sie direkt weiterverwenden oder als Word-, Excel- oder Untertiteldatei exportieren können.

Fazit

"Spracherkennungssoftware" ist kein einheitliches Werkzeug, sondern zwei Kategorien mit unterschiedlicher Technik dahinter: Live-Diktat in beliebige Anwendungen (Dragon, Windows-Spracherkennung) und Transkription bestehender Aufnahmen (Sonix, Subanana). Der schnellste Weg zur richtigen Entscheidung ist nicht ein Feature-Vergleich über alle fünf Tools hinweg, sondern die eine Frage: Soll der Text entstehen, während Sie sprechen, oder existiert die Aufnahme bereits?

Wenn Ihre Antwort "ich habe bereits eine Aufnahme, ein Meeting oder ein Interview, das zu Text werden soll" lautet, testen Sie Subananas KI-Meeting-Transkription kostenlos – ohne Kreditkarte, mit sofortiger Vorschau Ihrer ersten Datei.

Schluss mit dem Abtippen.

Aus Gesprochenem wirdArbeit, die Sie ausliefern können.

Kostenlos starten