Deine Stimme verlässt nie dein Gerät

Die meisten Whisper Apps laden deine Aufnahmen auf Cloud-Server hoch. Wir haben Whisper Notes so gebaut, dass es komplett auf dem Gerät läuft — kein Internet, keine Datensammlung, kein Kompromiss.

Aktualisiert Januar 2026•10 Min Lesezeit

Warum wir eine Local-First Whisper App gebaut haben

Als wir mit der Entwicklung von Whisper Notes begannen, standen wir vor einer Wahl: Cloud-Infrastruktur für die Transkription nutzen (einfacher zu bauen, höhere Genauigkeit) oder alles auf dem Gerät ausführen (schwieriger zu bauen, vollständige Privatsphäre). Wir wählten die Geräte-Verarbeitung.

Der Grund ist einfach. Sprachaufnahmen enthalten biometrische Daten, die nach einer Offenlegung nicht geändert werden können. Anders als ein Passwort kannst du deine Stimme nicht zurücksetzen. Einmal zu einem Cloud-Dienst hochgeladen, existiert dein Audio auf einer Infrastruktur, die du nicht kontrollierst — unterworfen Datenlecks, Training-Data-Pipelines und Aufbewahrungsrichtlinien, die du vielleicht nie zu sehen bekommst.

Whisper Notes verwendet OpenAIs Whisper Large V3 Turbo Modell, das nativ auf Apple Silicon läuft. Dein Audio wird von der Neural Engine deines Geräts verarbeitet. Keine Internetverbindung erforderlich. Keine Datenübertragung. Die App kann buchstäblich keine Daten nach außen senden — sie hat keinen Server zum Anrufen.

Die versteckten Kosten von kostenlosen Whisper Apps

Nach unserer Erfahrung folgen kostenlose Transkriptions-Tools einem konsistenten Muster: Sie laden dein Audio auf Cloud-Server hoch, verarbeiten es remote und behalten Daten, um ihre Modelle zu verbessern. Das Produkt ist nicht die Software — es ist deine Stimme.

Stimmdaten sind permanent

Anders als Passwörter oder Kreditkartennummern kann Stimm-Biometrie nach einer Kompromittierung nicht geändert werden. Wenige Sekunden Aufnahme erfassen akustische Signaturen, die dich in verschiedenen Kontexten identifizieren.

Voice-Cloning-Technologie benötigt heute nur noch drei bis fünf Sekunden Sample-Audio. Die menschliche Erkennungsgenauigkeit für hochwertige Stimm-Deepfakes liegt bei nur 24,5%. 2025 wurde ein Stimmklon des italienischen Verteidigungsministers verwendet, um fast eine Million Euro zu erpressen. Das ist kein theoretisches Risiko.

Wenn du Audio zu einem Cloud-Transkriptionsdienst hochlädst, erstellst du eine permanente Aufzeichnung deiner biometrischen Identität auf einer Infrastruktur, die du nicht kontrollierst.

Die Cloud-Transkriptions-Datenleck-Landschaft

KI-bezogene Sicherheitsvorfälle stiegen 2024 um 56,4%. Zweiundachtzig Prozent der Datenlecks betreffen jetzt Cloud-Infrastruktur. Im Gesundheitswesen wurden geschützte Gesundheitsinformationen über Transkriptions-Agenten, EHR-Integrationen und falsch konfigurierte Data Lakes offengelegt.

Das Muster ist vorhersehbar: Sensible Daten fließen in KI-Systeme, die Sichtbarkeit sinkt, und Angreifer oder Unfälle legen offen, was privat bleiben sollte. Call-Center-Transkripte werden zu Modellen gestreamt, während Kontonummern ohne Maskierung in Debug-Logs landen.

Die erste Hälfte 2025 sah einen starken Anstieg großer Datenlecks mit sensibleren Datenkategorien. Statt nur Benutzernamen und Passwörtern legen Lecks jetzt genetische Profile, Sprachaufnahmen und biometrische Identifikatoren offen.

Die Richtung der Entwicklung

Im März 2025 kündigte Amazon an, die Einstellung Sprachaufnahmen nicht senden auf Echo-Geräten einzustellen. Alle Benutzerinteraktionen mit Alexa-Geräten werden jetzt standardmäßig aufgezeichnet und an Amazons Server gesendet, ohne Opt-out-Option.

Das ist keine isolierte Entscheidung. Große Plattformen bewegen sich in Richtung mehr Datensammlung, nicht weniger. Die wirtschaftlichen Anreize der KI-Entwicklung begünstigen die Ansammlung von Trainingsdaten. Datenschutzoptionen, die heute existieren, existieren morgen vielleicht nicht mehr.

Wir haben Whisper Notes mit der entgegengesetzten Architektur gebaut: Es gibt keinen Server, an den Daten gesendet werden könnten. Das ist keine Einstellung, die geändert werden kann. Es ist eine fundamentale Einschränkung, wie die App gebaut wurde.

Der wahre Preis von kostenlos

Kostenlose Whisper-Web-Tools verwenden oft dein Audio, um ihre Modelle zu verbessern. Das steht in Nutzungsbedingungen, die kaum ein Nutzer liest. Cloud-Dienste mit Minutenpreisen von $0,006 bis $0,40 pro Minute summieren sich bei regelmäßiger Nutzung auf Hunderte Dollar jährlich.

Abo-Dienste wie Otter.ai kosten etwa $99 pro Jahr. Über fünf Jahre sind das $495—für einen Dienst, der dein Audio auf Remote-Servern verarbeitet.

Whisper Notes kostet einmalig $7,99. Kein Abo. Keine Minutengebühren. Keine Datensammlung. Das Geschäftsmodell ist einfach: Du bezahlst für Software, du besitzt die Software.

Kosten pro Jahr

DiensttypJahr 1Jahr 2Jahr 3Datenhandhabung
Whisper Notes$7,99$0$0Verlässt nie das Gerät
Abo-Dienst$99$99$99Cloud-verarbeitet
Cloud-API pro Minute$120-480$120-480$120-480Cloud-verarbeitet
Kostenlose Web-Tools$0$0$0Für KI-Training verwendet

Wann du besser einen Cloud-Dienst nimmst

Auf sauberem Audio sind die großen Cloud-Modelle nach wie vor etwas genauer, weil sie in einer Größe laufen, die kein Telefon und kein Laptop fassen kann, und sie können live mitschreiben, was Transkription auf dem Gerät noch nicht erreicht. Das sind echte Vorteile, und wir tun nicht so, als gäbe es sie nicht.

Wenn du Live-Untertitel brauchst, wenn mehrere Leute dasselbe Transkript bearbeiten müssen, während die Besprechung noch läuft, oder wenn dir der letzte Rest Genauigkeit wichtiger ist als der Ort, an dem das Audio liegt, dann ist ein Cloud-Dienst das bessere Werkzeug — und uns ist lieber, du nimmst ihn.

Widersprechen würden wir nur einem: dass dieser Abstand in der Genauigkeit die einzige Zahl in der Entscheidung ist. Bei Arbeit unter Schweigepflicht — Krankenakten, Mandantengeheimnisse, Gespräche mit Quellen — ist „Wo landet das Audio?“ eine Frage, die du beantworten können musst, und die kürzeste belastbare Antwort lautet: Es ist nirgendwo hingegangen.

Warum Architektur wichtig ist: Native Apps vs. Web Wrapper

Wenn du nach Whisper App suchst, findest du drei Kategorien: Web-basierte Tools, die in deinem Browser laufen, Cloud-APIs, die Internet erfordern, und native Apps, die speziell für dein Gerät kompiliert wurden. Der Architekturunterschied ist wichtig für Datenschutz und Performance.

Web Wrapper und Browser-basierte Tools

Viele Browser-basierte Whisper-Tools behaupten lokale Verarbeitung, was technisch korrekt ist. Dein Audio bleibt im Browser-Tab. Aber Browser-Umgebungen haben fundamentale Einschränkungen.

Speicherbeschränkungen erzwingen kleinere Modelle. Die meisten Browser begrenzen WebAssembly-Speicher auf etwa 4GB, was die Modellgröße einschränkt. JavaScript fügt Verarbeitungs-Overhead im Vergleich zu nativem Code hinzu. Ein Tab-Crash verliert deine Arbeit ohne Wiederherstellungsoption.

Browser-basierte Tools fehlt auch Systemintegration. Sie können nicht im Hintergrund laufen, während du andere Anwendungen nutzt. Sie können nicht effizient auf Hardware-Beschleunigung zugreifen. Sie sind Webseiten, die Transkription machen, keine Transkriptionssoftware.

VerarbeitungWebAssembly/TensorFlow.js im Browser
ModellgrößeBegrenzt durch Browser-Speicher (~4GB)
GeschwindigkeitLangsamer durch JavaScript-Overhead
DatenschutzBesser als Cloud, aber Browser hat Zugriff
ZuverlässigkeitTab kann crashen, keine Hintergrundverarbeitung

Native Apps: Direkter Hardware-Zugriff

Whisper Notes ist speziell für macOS und iOS kompiliert. Es greift direkt auf Apples Neural Engine zu — derselbe dedizierte Chip, der Face ID und Computational Photography antreibt.

Das ist keine in eine App-Shell eingewickelte Webseite. Es ist nativer Code, der für deine spezifische Hardware optimiert ist. Genau deshalb sind die Geschwindigkeiten auf dieser Seite überhaupt möglich: Auf einem M4 Pro schafft Parakeet V3 35 Minuten Audio in etwa 18 Sekunden.

Native Apps können im Hintergrund laufen, sich in Systemdienste integrieren und elegant aus Unterbrechungen wiederherstellen. Sie sind vom Betriebssystem sandboxed, was bedeutet, dass sie nicht auf Daten anderer Apps zugreifen können. Und weil Whisper Notes keine Netzwerkberechtigungen anfordert, kann es buchstäblich keine Daten übertragen, selbst wenn es kompromittiert würde.

VerarbeitungDirekter Apple Neural Engine Zugriff
ModellgrößeWhisper Large V3 Turbo, rund 1,5GB
GeschwindigkeitParakeet V3 mit rund 60x Echtzeit auf unserem M5 Air
DatenschutzSandboxed, keine Netzwerkberechtigungen
ZuverlässigkeitHintergrundverarbeitung, Systemintegration

Cloud APIs: Maximale Power, Maximale Exposition

Cloud-Dienste können die größten Whisper-Modelle ausführen, weil Server-Ressourcen praktisch unbegrenzt sind. Sie können marginal höhere Genauigkeit und Features wie Echtzeit-Transkription bieten, die erhebliche Rechenleistung erfordern.

Der Trade-off: Jede Aufnahme wird auf eine Infrastruktur hochgeladen, die du nicht kontrollierst. Dein Audio durchquert das Internet, wird auf Remote-Servern verarbeitet und kann gemäß Aufbewahrungsrichtlinien gespeichert werden, die du nicht gewählt hast.

Für Therapeuten mit Vertraulichkeitspflichten, Anwälte mit privilegierter Kommunikation, Journalisten, die Quellen schützen, oder jeden, der mit sensiblen Informationen arbeitet, ist Cloud-Verarbeitung oft ein disqualifizierender Faktor, unabhängig von Genauigkeitsvorteilen.

VerarbeitungRemote-Server (unbegrenzte Rechenleistung)
ModellgrößeGrößte verfügbare Modelle
GeschwindigkeitAbhängig von Internet und Server-Warteschlange
DatenschutzAudio hochgeladen und potenziell gespeichert
ZuverlässigkeitInternet erforderlich, Rate-Limits

Unsere Architektur-Entscheidung

Wir haben uns für native App-Architektur entschieden, weil es der einzige Weg ist, dafür zu sorgen, dass deine Stimmdaten auf deinem Gerät bleiben. Nicht lokal verarbeitet, dann synchronisiert. Nicht verschlüsselt während der Übertragung. Niemals hochgeladen, Punkt.

Diese Wahl hat Kosten. Wir können keine Echtzeit-Transkription während der Aufnahme anbieten. Wir können keine größeren Modelle ausführen als auf dein Gerät passen. Wir können keine kollaborativen Features anbieten, die einen Server erfordern.

Wir haben diesen Trade-off absichtlich gemacht. Für Anwendungsfälle, wo Datenschutz wichtig ist — und nach unserer Erfahrung umfasst das die meisten professionellen Transkriptionen — wiegt die lokale Verarbeitung schwerer als die Features, die Cloud-Infrastruktur erfordern.

Welches Modell macht hier die Arbeit?

Drei Engines, und wie du eine auswählst

Whisper Notes liefert drei Engines für Spracherkennung mit und führt alle drei auf dem Gerät aus. Parakeet V3 ist die Standardauswahl. Der Whisper-Weg ist Whisper Large V3 Turbo auf dem Mac und Whisper Small auf dem iPhone — dieselben 101 Sprachoptionen in einem Modell, das auf ein Telefon passt. SenseVoice ist die Engine, die du für Chinesisch, Kantonesisch, Japanisch und Koreanisch selbst auswählst. Automatisch wechselt nichts dorthin. Wer in diesen Sprachen arbeitet, stellt die Engine also am besten gleich nach der Installation um.
Wofür die einzelnen Engines gut sind: Parakeet V3 deckt 25 europäische Sprachen ab und erreicht auf dem Open ASR Leaderboard 6,32 % Wortfehlerrate im Englischen, den niedrigsten Wert der drei auf diesem Benchmark. In unseren eigenen Läufen kommt es rund fünfmal schneller durch eine Datei als Whisper Large V3 Turbo. Das Argument für Turbo ist die Breite: 101 Sprachoptionen, bei 7,83 % Wortfehlerrate im Englischen auf demselben Leaderboard. SenseVoice deckt sechs Optionen ab — Englisch, vereinfachtes und traditionelles Chinesisch, Kantonesisch, Japanisch und Koreanisch — und läuft in unseren Messungen mit rund 52-facher Echtzeit. Deshalb ist es die Wahl für CJK-Material.
Wie das auf dem Gerät läuft: Die Modelle werden in Apples Core ML Format konvertiert und laufen auf der Neural Engine, demselben Chip, der hinter Face ID und Computational Photography steckt. Es gibt keinen Transkriptionsserver im Weg, also auch keine Netzwerkanfrage, während eine Datei transkribiert wird. Das ist eine Behauptung, die du überprüfen kannst, statt sie zu glauben: Schalte vorher den Flugmodus ein.
Warum drei Engines statt einer: Kein offenes Modell ist derzeit in allem das beste. Das schnellste Modell für europäische Sprachen ist nicht das mit hundert Sprachen, und keines von beiden ist das, was für Chinesisch und Japanisch gebaut wurde. Drei Modelle auszuliefern und dich wählen zu lassen ist weniger elegant, als ein einziges bestes Modell zu nennen. Es ist aber der Grund, warum die App auch außerhalb einer einzelnen Sprachfamilie trägt.

Technische Spezifikationen

KI-ModelleParakeet V3 (Standard), Whisper Large V3 Turbo (Mac) oder Whisper Small (iPhone), SenseVoice
Sprachen101 Optionen über Whisper, 25 europäische über Parakeet V3, 6 über SenseVoice
Audio-FormateMP3, WAV, M4A, FLAC, AAC, OGG, WMA
VerarbeitungsgeschwindigkeitParakeet V3 rund 60x Echtzeit auf unserem M5 Air; der Whisper-Turbo-Weg rund 11x
Dateigröße-LimitKeines, das die App vorgibt
PlattformeniOS 18+, macOS 11+ (Apple Silicon optimiert)

Was kann die App tatsächlich?

Drei Dinge tragen den größten Teil der täglichen Nutzung: Audio hineinbekommen, Text herausbekommen, und die Einschränkung, die beides auf dem Gerät hält.

Offline Datei-Import

Importiere Audio-Dateien oder abgeschlossene Aufnahmen für hochpräzise Offline AI-Transkription. Diese Offline Sprache-zu-Text App verarbeitet Dateien mit Kontextanalyse für maximale Genauigkeit - überlegene Ergebnisse im Vergleich zu Online Sprache-zu-Text Diensten.

  • ✓Audio-Dateien aus verschiedenen Quellen importieren (Dateien, Sprachmemos, etc.)
  • ✓Audio erst aufnehmen, dann transkribieren für optimale Genauigkeit
  • ✓Hintergrund Offline Sprache-zu-Text Verarbeitung während Nutzung anderer Apps
  • ✓Automatische Dateiorganisation und Transkriptionsmanagement

Erweiterte Export-Optionen

Professionelle Ausgabeformate für verschiedene Anwendungsfälle - von einfachen Textdokumenten bis Untertiteldateien für Videoinhalte.

  • ✓Klartext mit anpassbarer Formatierung
  • ✓SRT und VTT Untertiteldateien für Video
  • ✓Zeitgestempelte Transkripte als Referenz
  • ✓Sprecher-Identifikation und -Kennzeichnung
  • ✓Benutzerdefinierte Absatz-Segmentierung

Datenschutz: Echte Offline Sprache-zu-Text Verarbeitung

Für dein Audio und dessen Transkript gibt es keinen Upload-Weg. Das kannst du im Flugmodus in einer halben Minute selbst nachprüfen.

  • ✓Offline Sprache-zu-Text Verarbeitung (keine Datenübertragung)
  • ✓Kein externer Auftragsverarbeiter: private Transkription für Gesundheitswesen, Recht und Wirtschaft
  • ✓Verschlüsselte lokale Speicherung für alle Offline AI-Transkription
  • ✓Keine Cloud-Abhängigkeiten - echte Offline Transkriptionssoftware
  • ✓Audit-Trail für Unternehmens Offline Sprache-zu-Text Umgebungen

Wie genau ist die App, und woher kommt diese Zahl?

Veröffentlichte Benchmarks, dazu unsere eigenen Messungen auf benannter Hardware

Wir führen keine eigene Genauigkeitsstudie durch: Ein Anbieter, der sich selbst benotet, ist wenig wert. Die Wortfehlerraten unten stammen vom Hugging Face Open ASR Leaderboard und vom FLEURS-Benchmark. Beide sind öffentlich und werden von Leuten betrieben, die nichts an dieser App verdienen. Die Geschwindigkeitswerte sind unsere eigenen, gemessen auf einem Gerät, das wir benennen.

Wortfehlerrate nach Modell

ModellQuelleFehlerrateAnmerkung
Parakeet V3 (Standard auf dem Mac)Open ASR Leaderboard6,32 % WER (Englisch)25 europäische Sprachen; 12,0 % Durchschnitt über alle bei FLEURS
Whisper Large V3 TurboOpen ASR Leaderboard7,83 % WER (Englisch)Die breiteste Abdeckung der drei: 101 Sprachoptionen
SenseVoice SmallEigener Test, M4 Pro27-Minuten-Podcast in 13,83 sFür Chinesisch, Japanisch, Koreanisch und Kantonesisch gebaut

Key Findings

  • •Parakeet V3 transkribiert 35 Minuten Audio in 18 Sekunden auf einem M4 Pro; Whisper Turbo braucht für dieselbe Datei rund drei Minuten
  • •Im Englischen liegen die drei Modelle weniger als zwei Punkte Wortfehlerrate auseinander
  • •Gemessen wird auf vorgelesener und vorbereiteter Sprache. Ihre eigenen Aufnahmen schneiden schlechter ab, und Mikrofon und Durcheinanderreden verschieben die Zahl stärker als die Wahl des Modells

Große Cloud-Modelle behalten bei sauberem Audio einen kleinen Vorsprung, weil sie in einer Größe laufen, die kein Telefon und kein Laptop halten kann. Dieser Abstand ist der Preis dafür, dass das Audio das Gerät nie verlässt. Wenn Ihre Arbeit nicht den letzten Genauigkeitspunkt braucht, lohnt sich der Tausch meistens. Wenn doch, ist ein Cloud-Dienst die ehrliche Empfehlung.

Wie schneidet die App gegen die Alternativen ab?

Gegen Cloud-Dienste, gegen die Bordmittel deines Geräts und gegen Unternehmenssoftware

Das meiste in dieser Tabelle kannst du in ein paar Minuten selbst nachprüfen. Genau lesen sollte man die Zeile zur Genauigkeit, denn die vier Kategorien werden nicht auf demselben Benchmark gemessen.

Funktionsvergleich

FunktionWhisper Notes AppCloud-DiensteEingebaute ToolsUnternehmens-Software
Genauigkeit (Wortfehlerrate Englisch)6,32-7,83 % (Open ASR Leaderboard)Herstellerangaben, meist nicht auf diesem LeaderboardNicht veröffentlichtNicht veröffentlicht
Wo das Audio verarbeitet wirdAuf deinem GerätServer des AnbietersJe nach AnbieterVor-Ort-Option
Kosten$7.99 iPhone, $14 Mac, einmalig$0.006-0.40/MinKostenlos (begrenzt)$500-2000/Lizenz
Sprachen101 Sprachoptionen50-100 Sprachen10-30 Sprachen20-50 Sprachen
Internet nötigNeinJaManchmalVor-Ort: Nein
Limit für die DateilängeKeines, das die App vorgibtMeist 1-2 Stunden5-10 MinutenVariiert

Market Position: Nebeneinander gestellt wird der Tausch lesbar. Eine Cloud-API auf dem neuesten Stand ist bei sauberem Audio immer noch etwas genauer, und sie kostet $0.006 bis $0.40 pro Minute, wobei deine Aufnahme auf einer fremden Festplatte liegt. Unternehmenstranskription vor Ort hält das Audio im eigenen Netz und beginnt bei rund $500 pro Arbeitsplatz. Whisper Notes lässt die offenen Modelle auf Hardware laufen, die dir schon gehört, für $7.99 auf dem iPhone oder $14 auf dem Mac, und gibt dafür Live-Untertitel, gemeinsames Bearbeiten und den letzten Rest Genauigkeit auf. Wenn eines dieser drei Dinge auf deiner Liste steht, ist eine der beiden anderen Optionen der bessere Kauf.

Für welche Arbeit passt die App?

Drei Arten von Arbeit, bei denen die Aufnahme nicht reisen darf

Gesundheitswesen

Ärztinnen und Ärzte nutzen Whisper Notes für Patientendokumentation, klinische Notizen und Forschungsinterviews. Weil das Audio nie auf einem Server von uns landet, gibt es keinen externen Auftragsverarbeiter, den ein BAA abdecken müsste. Ob der gesamte Ablauf HIPAA erfüllt, hängt weiterhin davon ab, wie das Gerät selbst gesichert ist — und wenn Kolleginnen und Kollegen dieselbe Notiz öffnen und kommentieren müssen, ist ein Cloud-Dienst mit unterschriebenem BAA die praktischere Antwort.

Use Cases
  • •Dokumentation von Patientengesprächen
  • •Notizen zu medizinischen Eingriffen
  • •Transkription von Forschungsinterviews
  • •Aufzeichnungen von Telemedizin-Sitzungen
  • •Inhalte für die klinische Ausbildung
Benefits
  • ✓Keine Datenschutzrichtlinie, der du vertrauen musst, weil nichts gesendet wird
  • ✓Eigenes Wörterbuch für Fachbegriffe und Medikamentennamen
  • ✓Keine Patientendaten verlassen das Gerät, weil es keinen Upload-Weg gibt
  • ✓Ein 20-minütiges Gespräch ist auf einem Mac mit Apple Silicon in deutlich unter einer Minute transkribiert

Recht

Anwältinnen und Anwälte nutzen Whisper Notes für Zeugenvernehmungen, Mandantengespräche und die Fallvorbereitung. Die Aufnahme bleibt auf dem Gerät, also hält kein Anbieter eine Kopie davon. Deine eigenen Pflichten sind damit nicht erledigt: Ob ein bestimmter Ablauf die Verschwiegenheitsregeln deiner Rechtsordnung erfüllt, hängt weiterhin daran, wie mit dem Gerät, seinen Backups und seinen Exporten umgegangen wird.

Use Cases
  • •Dokumentation von Mandantengesprächen
  • •Transkription von Zeugenvernehmungen
  • •Notizen zur Fallrecherche
  • •Protokolle von Gerichtsterminen
  • •Ermittlungsgespräche
Benefits
  • ✓Wir halten keine Kopie der Aufnahme und keine des Transkripts
  • ✓Eigenes Wörterbuch für Fallnamen und juristische Fachbegriffe
  • ✓Transkripte mit Zeitstempeln, exportiert als Text, SRT, VTT oder JSON
  • ✓$7.99 auf dem iPhone oder $14 auf dem Mac, einmalig, gegen ausgelagerte Transkription nach Minutenpreis

Journalismus

Reporterinnen und Reporter nutzen Whisper Notes für Quelleninterviews und Aufnahmen im Feld. Kein Server hält das Audio, also liegen die einzigen Kopien auf deinen eigenen Geräten. Damit wandert der Quellenschutz von unserer Aufbewahrungsrichtlinie, die du nicht überprüfen kannst, zur Sicherheit deines eigenen Geräts, die du überprüfen kannst. Wenn in der Redaktion mehrere Leute während einer laufenden Veranstaltung an einem Transkript arbeiten müssen, ist das die Aufgabe eines Cloud-Werkzeugs.

Use Cases
  • •Transkription von Quelleninterviews
  • •Dokumentation von Aufnahmen im Feld
  • •Notizen von Pressekonferenzen
  • •Archive von Forschungsinterviews
  • •Podcast-Produktion
Benefits
  • ✓Weder die Aufnahme noch das Transkript wird irgendwohin gesendet
  • ✓Funktioniert mit dem Gerät offline, was zugleich der Weg ist, die Behauptung zu prüfen
  • ✓Kein Konto, also kein Login-Verlauf, der ein Interview mit dir verbindet
  • ✓Export als Text, SRT, VTT oder JSON für die Werkzeuge, die in der Redaktion ohnehin laufen

Wie schnell ist die App, und wo stößt sie an Grenzen?

Die Zahlen, die wir gemessen haben, und die Dinge, die das Design ausschließt

Was wir gemessen haben, und worauf

Das Tempo hängt vom Rechner ab und von der Engine, die du wählst. Ein einzelner Multiplikator für „die App“ wäre deshalb irreführend. Die Zahlen unten sind unsere eigenen Läufe, Uhrzeit vom Start bis zum fertigen Text, auf Hardware, die wir benennen.

Parakeet V3, die Standard-Engine

Eine Meeting-Aufnahme von 17,5 Minuten war auf unserem M5 Air nach 16,7 Sekunden fertig — rund 60x Echtzeit

25 europäische Sprachen; eigener Lauf, ein Rechner

Der Whisper-Turbo-Weg

Whisper Large V3 Turbo liegt auf demselben Weg eher bei 11x Echtzeit. Das ist der Preis für seine 101 Sprachoptionen

Eigene Läufe; Turbo ist der Weg mit der breiten Abdeckung, nicht der schnelle

Ältere und kleinere Geräte

Ein iPhone arbeitet sich langsamer durch eine Datei als ein Mac mit Apple Silicon, und der Abstand wächst mit dem Alter des Chips. Lange Dateien laufen trotzdem durch, sie brauchen entsprechend länger

iPhone 12 oder neuer, oder ein Mac mit Apple Silicon

Speicherplatz

Transkripte sind winzig, rund 0,1MB pro Stunde Audio. Der eigentliche Platzbedarf sind die Modelle: Whisper Large V3 Turbo ist rund 1,5GB groß, die anderen beiden sind kleiner

Parakeet V3 steckt in der iPhone-App; die anderen Modelle lädt man in der App herunter

Bekannte Einschränkungen

Die Modelle auf dem Gerät laufen zu lassen setzt harte Grenzen, und die prüft man leichter vor dem Kauf als danach. Genau dafür gibt es auf dem Mac ein Gratiskontingent von 5.000 Wörtern pro Woche.

Geräteanforderungen

Erfordert ein iPhone 12 oder neuer oder einen Mac mit Apple Silicon. Älterer Hardware fehlt die Leistung der Neural Engine, um das praktikabel zu machen.

Impact: Nicht kompatibel mit Geräten, die älter als 4-5 Jahre sind

Verarbeitungszeit

Die Verarbeitungszeit wächst mit der Länge der Aufnahme. An der Physik der Berechnung auf dem Gerät führt kein Weg vorbei.

Impact: Bei den Raten oben ist eine vierstündige Datei auf dem Mac eine Sache von Minuten und auf dem iPhone länger

Abhängigkeit von der Audioqualität

Schlechtes Audio oder lauter Hintergrundlärm senkt die Genauigkeit, und das Modell kann keine Information zurückholen, die nicht im Signal steckt.

Impact: Mikrofonposition und Durcheinanderreden verschieben die Fehlerrate stärker als die Wahl des Modells

Keine Live-Untertitel

Die App transkribiert eine Aufnahme, nachdem sie beendet ist, statt beim Sprechen mitzuschreiben. Live-Untertitel in dieser Qualität brauchen eine Modellklasse, die nicht auf ein Telefon passt, und die Verarbeitung der ganzen Datei gibt dem Modell außerdem mehr Kontext.

Impact: Wenn du Untertitel während der Veranstaltung auf dem Bildschirm brauchst, ist das hier das falsche Werkzeug

Eine Sprache pro Aufnahme

Schneller Sprachwechsel innerhalb einer einzelnen Aufnahme senkt die Genauigkeit. Das Modell arbeitet am besten, wenn die Sprache durchgehend gleich bleibt.

Impact: Beste Ergebnisse mit einer Hauptsprache pro Datei

Fazit: Offline Sprache-zu-Text App für Professionelle Nutzung

Die Whisper Notes App ist ein Fortschritt in zugänglicher Offline Sprache-zu-Text Technologie. Sie führt drei Engines auf dem Gerät aus — Parakeet V3 als Standard, dazu Whisper Large V3 Turbo und SenseVoice — und adressiert damit Bedürfnisse datenschutzbewusster Branchen, mit einer Offline Transkriptionsgenauigkeit, die mit teuren Unternehmenslösungen konkurriert.
Hauptstärken: • Hohe Offline Sprache-zu-Text Genauigkeit (6.3-7.8% WER auf Englisch, Open ASR Leaderboard) • Datenschutz durch Offline AI-Transkriptionsverarbeitung • Offline Transkriptionsfunktionen zu Verbraucherpreisen (nur $7.99 einmalig vs $0.006-0.40/Min Cloud-Dienste) • Breite Sprachunterstützung mit technischer Terminologie-Erkennung in Offline Sprache-zu-Text • Keine laufenden Kosten, Abos oder Datenübertragung für Offline Transkription
Ideal für: • Gesundheitsprofis mit HIPAA-Anforderungen • Rechtspraktiker mit sensiblen Klienteninformationen • Geschäftsführer mit vertraulicher Kommunikation • Forscher und Journalisten mit Interviewdaten • Content-Ersteller mit Bedarf an genauer, kosteneffektiver Transkription
Das Einmalkauf-Modell der Whisper Notes App ($7.99) macht sie außergewöhnlich kosteneffektiv im Vergleich zu minutenbasierten Cloud Sprache-zu-Text Diensten oder teurer Unternehmens Offline Transkriptionssoftware. Für Profis, die regelmäßig mit Audio-Inhalten arbeiten und Datenschutz schätzen, bietet diese Offline Sprache-zu-Text Lösung eine überzeugende Kombination aus Leistung, Sicherheit und Wert.
Einschränkungen bei Geräteanforderungen und Verarbeitungszeit für sehr lange Aufnahmen sind angemessen angesichts der ausgeklügelten Offline AI-Transkriptionsverarbeitung komplett auf dem Gerät. Mit verbesserten Gerätefähigkeiten werden diese Offline Sprache-zu-Text Einschränkungen natürlich abnehmen.
Die Whisper Notes App setzt einen neuen Standard für Verbraucher Offline Transkriptionssoftware und zeigt, dass professionelle Offline AI-Transkriptionsfähigkeiten in zugänglichen, datenschutzrespektierenden Paketen geliefert werden können.

Erlebe die Offline Sprache-zu-Text App

Schließ dich Tausenden Profis an, die Whisper Notes für genaue, private Offline AI-Transkription vertrauen

Offline Sprache-zu-Text App verfügbar auf iOS und macOS • Nur $7.99 einmalig • Keine Abos oder laufende Gebühren für Offline AI-Transkription