VoxaFlow ist eine Diktier-App für macOS, die Spracherkennung und Textbereinigung komplett auf dem Gerät ausführt. Ich habe sie entwickelt und gebe hier einen Überblick über Aufbau, Messwerte und das Netzwerkverhalten. Die App ist in Version 0.7.2 als kostenlose Public Beta verfügbar, Voraussetzung sind Apple Silicon (M1 oder neuer) und macOS 14.
Pipeline in zwei Stufen
Zwischen fn-Taste und Text arbeiten zwei Modelle nacheinander:
- Die Spracherkennung übernimmt Parakeet TDT v3. Das Modell deckt 25 europäische Sprachen ab, die Sprache wird automatisch erkannt. Ein Wechsel zwischen Deutsch und Englisch innerhalb eines Tages braucht keine Einstellung.
- Die Bereinigung macht ein kleines Sprachmodell aus der Qwen3-Familie. Es bekommt das rohe Transkript und liefert den Text, der gemeint war.
Beide Stufen laufen auf Neural Engine und GPU. Der Unterschied zum reinen Transkript ist größer, als man vermutet, denn die Erkennung liefert im Rohzustand zum Beispiel Folgendes:
ähm schick den entwurf an mark nee an mike bis freitag
Nach der Bereinigung steht da:
Schick den Entwurf an Mike bis Freitag.
Die Stufe entfernt Füllwörter, übernimmt Selbstkorrekturen, setzt Satzzeichen und Groß- und Kleinschreibung und behandelt Pausen mitten im Satz nicht als Satzende. Begriffe aus dem Benutzerwörterbuch werden in der gewünschten Schreibweise ausgegeben. Ein Umformulieren findet nicht statt, der Tonfall des Sprechers bleibt erhalten.
Latenz
Ein Diktat wird bereits während des Sprechens verarbeitet und nicht erst nach dem Loslassen. Deshalb hängt die Wartezeit kaum von der Länge ab. Meine Messung mit Version 0.6.5 auf einem M3 Mac mit dem Bereinigungsmodell Qwen3 4B ergab 1,2 Sekunden bis zum fertigen Text nach einem Diktat von 95 Sekunden. Für kurze Diktate liegt der Wert niedriger (bei einer Beispielmail waren es 0,72 Sekunden). Es ist eine Messung auf einer Maschine und einer Modellkonfiguration, andere Chips und Speicherausbau können abweichen.
Modellwahl nach Arbeitsspeicher
Die App wählt das Bereinigungsmodell nach dem verfügbaren RAM. Macs mit 8 GB verwenden ein kleineres und schnelleres Modell, ab 16 GB wird das größere geladen. Die Modelle werden einmalig nach der Installation heruntergeladen, zusammen etwa 2,5 GB. Für die Installation sollten etwa 3 GB frei sein.
Wie der Text in die Zielanwendung kommt
VoxaFlow schreibt am Cursor wie eine Tastatur. Deshalb braucht es keine Integration pro Anwendung. Getestet und vorgesehen ist der Einsatz in Mail, Slack, Notion, Notes, Terminal, Xcode, VS Code, Cursor und Claude Code, im Prinzip überall, wo ein Textcursor existiert.
Der Command Mode (Control + fn) arbeitet auf markiertem Text. Die Sprachanweisung („kürzer“, „als Stichpunkte“, „ins Englische übersetzen“) wird auf die Auswahl angewendet, und das Ergebnis ersetzt sie.
Netzwerkverhalten
Die App baut drei Verbindungen auf, alle zu eigenen Servern bei Hetzner in Deutschland:
- Modell-Download, einmalig nach der Installation. Übertragen wird nur die Anfrage nach den Dateien.
- Update-Check, einmal täglich und abschaltbar. Es gehen weder Systemprofil noch Kennungen raus. Die Anfragen werden anonym gezählt, um die Zahl aktiver Installationen zu kennen.
- Lizenzprüfung ab Version 0.8, zur Registrierung der Beta oder Testphase und danach alle 30 Tage. Übertragen werden eine gehashte Geräte-ID, die App-Version und gegebenenfalls der Lizenzschlüssel.
Audio, Text, Auswahl, Zwischenablage und genutzte Apps werden nicht übertragen. Audio liegt nur während des Diktats im Arbeitsspeicher und wird danach verworfen. Die Zusicherung wird automatisiert geprüft: Ein Netzwerktest startet die App, protokolliert jede Anfrage und schlägt fehl, sobald ein anderer Server als die eigenen erscheint. Auf der Serverseite werden IP-Adressen in den Logs gekürzt und nach 7 Tagen gelöscht, die Website setzt keine Cookies. Mit dem Hosting-Anbieter besteht ein Auftragsverarbeitungsvertrag nach Art. 28 DSGVO.
Die vollständige Liste aller Anfragen steht unter voxaflow.ai/privacy.
Coding Edition
In Entwicklung ist eine Edition für das Diktieren von Prompts und Terminalbefehlen. Geplant sind Folgendes:
- Bezeichner und Dateinamen aus dem eigenen Repository werden exakt geschrieben, zum Beispiel
SettingsView,user_idoderMAX_RETRIES. - Buchstabieren per Sprache, etwa „camel case max retries“.
- Ein Terminal-Modus, der erkennt, wann ein Coding-Agent zuhört.
- Englische Prompts aus deutscher Sprache, wobei technische Begriffe erhalten bleiben.
Eine iPhone-Version (Start über Action-Button, Text landet in der Zwischenablage) ist ebenfalls in Arbeit, einen Termin gibt es noch nicht.
Lizenzmodell
Bis zum 31. Januar 2027 ist die Beta kostenlos und enthält alle bisherigen Funktionen, ohne Account. Ab dem 1. Januar 2027 gibt es drei Editionen als Einmalkauf mit einer Lizenz für zwei Geräte. Free ist dauerhaft kostenlos mit 2.500 Wörtern pro Woche und Diktaten bis 2 Minuten. Pro kostet 49 Euro, Coding 89 Euro. Die ersten 500 Käufer zahlen 39 bzw. 69 Euro, und Beta-Nutzer bekommen diesen Einführungspreis garantiert.
Download und Dokumentation: voxaflow.ai.