Deine Stimme verlässt nie dein Gerät
Die meisten Whisper Apps laden deine Aufnahmen auf Cloud-Server hoch. Wir haben Whisper Notes so gebaut, dass es komplett auf dem Gerät läuft — kein Internet, keine Datensammlung, kein Kompromiss.
Warum wir eine Local-First Whisper App gebaut haben
Als wir mit der Entwicklung von Whisper Notes begannen, standen wir vor einer Wahl: Cloud-Infrastruktur für die Transkription nutzen (einfacher zu bauen, höhere Genauigkeit) oder alles auf dem Gerät ausführen (schwieriger zu bauen, vollständige Privatsphäre). Wir wählten die Geräte-Verarbeitung.
Der Grund ist einfach. Sprachaufnahmen enthalten biometrische Daten, die nach einer Offenlegung nicht geändert werden können. Anders als ein Passwort kannst du deine Stimme nicht zurücksetzen. Einmal zu einem Cloud-Dienst hochgeladen, existiert dein Audio auf einer Infrastruktur, die du nicht kontrollierst — unterworfen Datenlecks, Training-Data-Pipelines und Aufbewahrungsrichtlinien, die du vielleicht nie zu sehen bekommst.
Whisper Notes verwendet OpenAIs Whisper Large V3 Turbo Modell, das nativ auf Apple Silicon läuft. Dein Audio wird von der Neural Engine deines Geräts verarbeitet. Keine Internetverbindung erforderlich. Keine Datenübertragung. Die App kann buchstäblich keine Daten nach außen senden — sie hat keinen Server zum Anrufen.
Die versteckten Kosten von kostenlosen Whisper Apps
Nach unserer Erfahrung folgen kostenlose Transkriptions-Tools einem konsistenten Muster: Sie laden dein Audio auf Cloud-Server hoch, verarbeiten es remote und behalten Daten, um ihre Modelle zu verbessern. Das Produkt ist nicht die Software — es ist deine Stimme.
Stimmdaten sind permanent
Anders als Passwörter oder Kreditkartennummern kann Stimm-Biometrie nach einer Kompromittierung nicht geändert werden. Wenige Sekunden Aufnahme erfassen akustische Signaturen, die dich in verschiedenen Kontexten identifizieren.
Voice-Cloning-Technologie benötigt heute nur noch drei bis fünf Sekunden Sample-Audio. Die menschliche Erkennungsgenauigkeit für hochwertige Stimm-Deepfakes liegt bei nur 24,5%. 2025 wurde ein Stimmklon des italienischen Verteidigungsministers verwendet, um fast eine Million Euro zu erpressen. Das ist kein theoretisches Risiko.
Wenn du Audio zu einem Cloud-Transkriptionsdienst hochlädst, erstellst du eine permanente Aufzeichnung deiner biometrischen Identität auf einer Infrastruktur, die du nicht kontrollierst.
Die Cloud-Transkriptions-Datenleck-Landschaft
KI-bezogene Sicherheitsvorfälle stiegen 2024 um 56,4%. Zweiundachtzig Prozent der Datenlecks betreffen jetzt Cloud-Infrastruktur. Im Gesundheitswesen wurden geschützte Gesundheitsinformationen über Transkriptions-Agenten, EHR-Integrationen und falsch konfigurierte Data Lakes offengelegt.
Das Muster ist vorhersehbar: Sensible Daten fließen in KI-Systeme, die Sichtbarkeit sinkt, und Angreifer oder Unfälle legen offen, was privat bleiben sollte. Call-Center-Transkripte werden zu Modellen gestreamt, während Kontonummern ohne Maskierung in Debug-Logs landen.
Die erste Hälfte 2025 sah einen starken Anstieg großer Datenlecks mit sensibleren Datenkategorien. Statt nur Benutzernamen und Passwörtern legen Lecks jetzt genetische Profile, Sprachaufnahmen und biometrische Identifikatoren offen.
Die Richtung der Entwicklung
Im März 2025 kündigte Amazon an, die Einstellung Sprachaufnahmen nicht senden auf Echo-Geräten einzustellen. Alle Benutzerinteraktionen mit Alexa-Geräten werden jetzt standardmäßig aufgezeichnet und an Amazons Server gesendet, ohne Opt-out-Option.
Das ist keine isolierte Entscheidung. Große Plattformen bewegen sich in Richtung mehr Datensammlung, nicht weniger. Die wirtschaftlichen Anreize der KI-Entwicklung begünstigen die Ansammlung von Trainingsdaten. Datenschutzoptionen, die heute existieren, existieren morgen vielleicht nicht mehr.
Wir haben Whisper Notes mit der entgegengesetzten Architektur gebaut: Es gibt keinen Server, an den Daten gesendet werden könnten. Das ist keine Einstellung, die geändert werden kann. Es ist eine fundamentale Einschränkung, wie die App gebaut wurde.
Der wahre Preis von kostenlos
Kostenlose Whisper-Web-Tools verwenden oft dein Audio, um ihre Modelle zu verbessern. Das steht in Nutzungsbedingungen, die kaum ein Nutzer liest. Cloud-Dienste mit Minutenpreisen von $0,006 bis $0,40 pro Minute summieren sich bei regelmäßiger Nutzung auf Hunderte Dollar jährlich.
Abo-Dienste wie Otter.ai kosten etwa $99 pro Jahr. Über fünf Jahre sind das $495—für einen Dienst, der dein Audio auf Remote-Servern verarbeitet.
Whisper Notes kostet einmalig $7,99. Kein Abo. Keine Minutengebühren. Keine Datensammlung. Das Geschäftsmodell ist einfach: Du bezahlst für Software, du besitzt die Software.
Kosten pro Jahr
| Diensttyp | Jahr 1 | Jahr 2 | Jahr 3 | Datenhandhabung |
|---|---|---|---|---|
| Whisper Notes | $7,99 | $0 | $0 | Verlässt nie das Gerät |
| Abo-Dienst | $99 | $99 | $99 | Cloud-verarbeitet |
| Cloud-API pro Minute | $120-480 | $120-480 | $120-480 | Cloud-verarbeitet |
| Kostenlose Web-Tools | $0 | $0 | $0 | Für KI-Training verwendet |
Wann du besser einen Cloud-Dienst nimmst
Auf sauberem Audio sind die großen Cloud-Modelle nach wie vor etwas genauer, weil sie in einer Größe laufen, die kein Telefon und kein Laptop fassen kann, und sie können live mitschreiben, was Transkription auf dem Gerät noch nicht erreicht. Das sind echte Vorteile, und wir tun nicht so, als gäbe es sie nicht.
Wenn du Live-Untertitel brauchst, wenn mehrere Leute dasselbe Transkript bearbeiten müssen, während die Besprechung noch läuft, oder wenn dir der letzte Rest Genauigkeit wichtiger ist als der Ort, an dem das Audio liegt, dann ist ein Cloud-Dienst das bessere Werkzeug — und uns ist lieber, du nimmst ihn.
Widersprechen würden wir nur einem: dass dieser Abstand in der Genauigkeit die einzige Zahl in der Entscheidung ist. Bei Arbeit unter Schweigepflicht — Krankenakten, Mandantengeheimnisse, Gespräche mit Quellen — ist „Wo landet das Audio?“ eine Frage, die du beantworten können musst, und die kürzeste belastbare Antwort lautet: Es ist nirgendwo hingegangen.
Warum Architektur wichtig ist: Native Apps vs. Web Wrapper
Wenn du nach Whisper App suchst, findest du drei Kategorien: Web-basierte Tools, die in deinem Browser laufen, Cloud-APIs, die Internet erfordern, und native Apps, die speziell für dein Gerät kompiliert wurden. Der Architekturunterschied ist wichtig für Datenschutz und Performance.
Web Wrapper und Browser-basierte Tools
Viele Browser-basierte Whisper-Tools behaupten lokale Verarbeitung, was technisch korrekt ist. Dein Audio bleibt im Browser-Tab. Aber Browser-Umgebungen haben fundamentale Einschränkungen.
Speicherbeschränkungen erzwingen kleinere Modelle. Die meisten Browser begrenzen WebAssembly-Speicher auf etwa 4GB, was die Modellgröße einschränkt. JavaScript fügt Verarbeitungs-Overhead im Vergleich zu nativem Code hinzu. Ein Tab-Crash verliert deine Arbeit ohne Wiederherstellungsoption.
Browser-basierte Tools fehlt auch Systemintegration. Sie können nicht im Hintergrund laufen, während du andere Anwendungen nutzt. Sie können nicht effizient auf Hardware-Beschleunigung zugreifen. Sie sind Webseiten, die Transkription machen, keine Transkriptionssoftware.
| Verarbeitung | WebAssembly/TensorFlow.js im Browser |
| Modellgröße | Begrenzt durch Browser-Speicher (~4GB) |
| Geschwindigkeit | Langsamer durch JavaScript-Overhead |
| Datenschutz | Besser als Cloud, aber Browser hat Zugriff |
| Zuverlässigkeit | Tab kann crashen, keine Hintergrundverarbeitung |
Native Apps: Direkter Hardware-Zugriff
Whisper Notes ist speziell für macOS und iOS kompiliert. Es greift direkt auf Apples Neural Engine zu — derselbe dedizierte Chip, der Face ID und Computational Photography antreibt.
Das ist keine in eine App-Shell eingewickelte Webseite. Es ist nativer Code, der für deine spezifische Hardware optimiert ist. Genau deshalb sind die Geschwindigkeiten auf dieser Seite überhaupt möglich: Auf einem M4 Pro schafft Parakeet V3 35 Minuten Audio in etwa 18 Sekunden.
Native Apps können im Hintergrund laufen, sich in Systemdienste integrieren und elegant aus Unterbrechungen wiederherstellen. Sie sind vom Betriebssystem sandboxed, was bedeutet, dass sie nicht auf Daten anderer Apps zugreifen können. Und weil Whisper Notes keine Netzwerkberechtigungen anfordert, kann es buchstäblich keine Daten übertragen, selbst wenn es kompromittiert würde.
| Verarbeitung | Direkter Apple Neural Engine Zugriff |
| Modellgröße | Whisper Large V3 Turbo, rund 1,5GB |
| Geschwindigkeit | Parakeet V3 mit rund 60x Echtzeit auf unserem M5 Air |
| Datenschutz | Sandboxed, keine Netzwerkberechtigungen |
| Zuverlässigkeit | Hintergrundverarbeitung, Systemintegration |
Cloud APIs: Maximale Power, Maximale Exposition
Cloud-Dienste können die größten Whisper-Modelle ausführen, weil Server-Ressourcen praktisch unbegrenzt sind. Sie können marginal höhere Genauigkeit und Features wie Echtzeit-Transkription bieten, die erhebliche Rechenleistung erfordern.
Der Trade-off: Jede Aufnahme wird auf eine Infrastruktur hochgeladen, die du nicht kontrollierst. Dein Audio durchquert das Internet, wird auf Remote-Servern verarbeitet und kann gemäß Aufbewahrungsrichtlinien gespeichert werden, die du nicht gewählt hast.
Für Therapeuten mit Vertraulichkeitspflichten, Anwälte mit privilegierter Kommunikation, Journalisten, die Quellen schützen, oder jeden, der mit sensiblen Informationen arbeitet, ist Cloud-Verarbeitung oft ein disqualifizierender Faktor, unabhängig von Genauigkeitsvorteilen.
| Verarbeitung | Remote-Server (unbegrenzte Rechenleistung) |
| Modellgröße | Größte verfügbare Modelle |
| Geschwindigkeit | Abhängig von Internet und Server-Warteschlange |
| Datenschutz | Audio hochgeladen und potenziell gespeichert |
| Zuverlässigkeit | Internet erforderlich, Rate-Limits |
Unsere Architektur-Entscheidung
Wir haben uns für native App-Architektur entschieden, weil es der einzige Weg ist, dafür zu sorgen, dass deine Stimmdaten auf deinem Gerät bleiben. Nicht lokal verarbeitet, dann synchronisiert. Nicht verschlüsselt während der Übertragung. Niemals hochgeladen, Punkt.
Diese Wahl hat Kosten. Wir können keine Echtzeit-Transkription während der Aufnahme anbieten. Wir können keine größeren Modelle ausführen als auf dein Gerät passen. Wir können keine kollaborativen Features anbieten, die einen Server erfordern.
Wir haben diesen Trade-off absichtlich gemacht. Für Anwendungsfälle, wo Datenschutz wichtig ist — und nach unserer Erfahrung umfasst das die meisten professionellen Transkriptionen — wiegt die lokale Verarbeitung schwerer als die Features, die Cloud-Infrastruktur erfordern.
Welches Modell macht hier die Arbeit?
Drei Engines, und wie du eine auswählst
Technische Spezifikationen
| KI-Modelle | Parakeet V3 (Standard), Whisper Large V3 Turbo (Mac) oder Whisper Small (iPhone), SenseVoice |
| Sprachen | 101 Optionen über Whisper, 25 europäische über Parakeet V3, 6 über SenseVoice |
| Audio-Formate | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| Verarbeitungsgeschwindigkeit | Parakeet V3 rund 60x Echtzeit auf unserem M5 Air; der Whisper-Turbo-Weg rund 11x |
| Dateigröße-Limit | Keines, das die App vorgibt |
| Plattformen | iOS 18+, macOS 11+ (Apple Silicon optimiert) |
Was kann die App tatsächlich?
Drei Dinge tragen den größten Teil der täglichen Nutzung: Audio hineinbekommen, Text herausbekommen, und die Einschränkung, die beides auf dem Gerät hält.
Offline Datei-Import
Importiere Audio-Dateien oder abgeschlossene Aufnahmen für hochpräzise Offline AI-Transkription. Diese Offline Sprache-zu-Text App verarbeitet Dateien mit Kontextanalyse für maximale Genauigkeit - überlegene Ergebnisse im Vergleich zu Online Sprache-zu-Text Diensten.
- ✓Audio-Dateien aus verschiedenen Quellen importieren (Dateien, Sprachmemos, etc.)
- ✓Audio erst aufnehmen, dann transkribieren für optimale Genauigkeit
- ✓Hintergrund Offline Sprache-zu-Text Verarbeitung während Nutzung anderer Apps
- ✓Automatische Dateiorganisation und Transkriptionsmanagement
Erweiterte Export-Optionen
Professionelle Ausgabeformate für verschiedene Anwendungsfälle - von einfachen Textdokumenten bis Untertiteldateien für Videoinhalte.
- ✓Klartext mit anpassbarer Formatierung
- ✓SRT und VTT Untertiteldateien für Video
- ✓Zeitgestempelte Transkripte als Referenz
- ✓Sprecher-Identifikation und -Kennzeichnung
- ✓Benutzerdefinierte Absatz-Segmentierung
Datenschutz: Echte Offline Sprache-zu-Text Verarbeitung
Für dein Audio und dessen Transkript gibt es keinen Upload-Weg. Das kannst du im Flugmodus in einer halben Minute selbst nachprüfen.
- ✓Offline Sprache-zu-Text Verarbeitung (keine Datenübertragung)
- ✓Kein externer Auftragsverarbeiter: private Transkription für Gesundheitswesen, Recht und Wirtschaft
- ✓Verschlüsselte lokale Speicherung für alle Offline AI-Transkription
- ✓Keine Cloud-Abhängigkeiten - echte Offline Transkriptionssoftware
- ✓Audit-Trail für Unternehmens Offline Sprache-zu-Text Umgebungen
Wie genau ist die App, und woher kommt diese Zahl?
Veröffentlichte Benchmarks, dazu unsere eigenen Messungen auf benannter Hardware
Wir führen keine eigene Genauigkeitsstudie durch: Ein Anbieter, der sich selbst benotet, ist wenig wert. Die Wortfehlerraten unten stammen vom Hugging Face Open ASR Leaderboard und vom FLEURS-Benchmark. Beide sind öffentlich und werden von Leuten betrieben, die nichts an dieser App verdienen. Die Geschwindigkeitswerte sind unsere eigenen, gemessen auf einem Gerät, das wir benennen.
Wortfehlerrate nach Modell
| Modell | Quelle | Fehlerrate | Anmerkung |
|---|---|---|---|
| Parakeet V3 (Standard auf dem Mac) | Open ASR Leaderboard | 6,32 % WER (Englisch) | 25 europäische Sprachen; 12,0 % Durchschnitt über alle bei FLEURS |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 7,83 % WER (Englisch) | Die breiteste Abdeckung der drei: 101 Sprachoptionen |
| SenseVoice Small | Eigener Test, M4 Pro | 27-Minuten-Podcast in 13,83 s | Für Chinesisch, Japanisch, Koreanisch und Kantonesisch gebaut |
Key Findings
- •Parakeet V3 transkribiert 35 Minuten Audio in 18 Sekunden auf einem M4 Pro; Whisper Turbo braucht für dieselbe Datei rund drei Minuten
- •Im Englischen liegen die drei Modelle weniger als zwei Punkte Wortfehlerrate auseinander
- •Gemessen wird auf vorgelesener und vorbereiteter Sprache. Ihre eigenen Aufnahmen schneiden schlechter ab, und Mikrofon und Durcheinanderreden verschieben die Zahl stärker als die Wahl des Modells
Große Cloud-Modelle behalten bei sauberem Audio einen kleinen Vorsprung, weil sie in einer Größe laufen, die kein Telefon und kein Laptop halten kann. Dieser Abstand ist der Preis dafür, dass das Audio das Gerät nie verlässt. Wenn Ihre Arbeit nicht den letzten Genauigkeitspunkt braucht, lohnt sich der Tausch meistens. Wenn doch, ist ein Cloud-Dienst die ehrliche Empfehlung.
Wie schneidet die App gegen die Alternativen ab?
Gegen Cloud-Dienste, gegen die Bordmittel deines Geräts und gegen Unternehmenssoftware
Das meiste in dieser Tabelle kannst du in ein paar Minuten selbst nachprüfen. Genau lesen sollte man die Zeile zur Genauigkeit, denn die vier Kategorien werden nicht auf demselben Benchmark gemessen.
Funktionsvergleich
| Funktion | Whisper Notes App | Cloud-Dienste | Eingebaute Tools | Unternehmens-Software |
|---|---|---|---|---|
| Genauigkeit (Wortfehlerrate Englisch) | 6,32-7,83 % (Open ASR Leaderboard) | Herstellerangaben, meist nicht auf diesem Leaderboard | Nicht veröffentlicht | Nicht veröffentlicht |
| Wo das Audio verarbeitet wird | Auf deinem Gerät | Server des Anbieters | Je nach Anbieter | Vor-Ort-Option |
| Kosten | $7.99 iPhone, $14 Mac, einmalig | $0.006-0.40/Min | Kostenlos (begrenzt) | $500-2000/Lizenz |
| Sprachen | 101 Sprachoptionen | 50-100 Sprachen | 10-30 Sprachen | 20-50 Sprachen |
| Internet nötig | Nein | Ja | Manchmal | Vor-Ort: Nein |
| Limit für die Dateilänge | Keines, das die App vorgibt | Meist 1-2 Stunden | 5-10 Minuten | Variiert |
Market Position: Nebeneinander gestellt wird der Tausch lesbar. Eine Cloud-API auf dem neuesten Stand ist bei sauberem Audio immer noch etwas genauer, und sie kostet $0.006 bis $0.40 pro Minute, wobei deine Aufnahme auf einer fremden Festplatte liegt. Unternehmenstranskription vor Ort hält das Audio im eigenen Netz und beginnt bei rund $500 pro Arbeitsplatz. Whisper Notes lässt die offenen Modelle auf Hardware laufen, die dir schon gehört, für $7.99 auf dem iPhone oder $14 auf dem Mac, und gibt dafür Live-Untertitel, gemeinsames Bearbeiten und den letzten Rest Genauigkeit auf. Wenn eines dieser drei Dinge auf deiner Liste steht, ist eine der beiden anderen Optionen der bessere Kauf.
Für welche Arbeit passt die App?
Drei Arten von Arbeit, bei denen die Aufnahme nicht reisen darf
Gesundheitswesen
Ärztinnen und Ärzte nutzen Whisper Notes für Patientendokumentation, klinische Notizen und Forschungsinterviews. Weil das Audio nie auf einem Server von uns landet, gibt es keinen externen Auftragsverarbeiter, den ein BAA abdecken müsste. Ob der gesamte Ablauf HIPAA erfüllt, hängt weiterhin davon ab, wie das Gerät selbst gesichert ist — und wenn Kolleginnen und Kollegen dieselbe Notiz öffnen und kommentieren müssen, ist ein Cloud-Dienst mit unterschriebenem BAA die praktischere Antwort.
Use Cases
- •Dokumentation von Patientengesprächen
- •Notizen zu medizinischen Eingriffen
- •Transkription von Forschungsinterviews
- •Aufzeichnungen von Telemedizin-Sitzungen
- •Inhalte für die klinische Ausbildung
Benefits
- ✓Keine Datenschutzrichtlinie, der du vertrauen musst, weil nichts gesendet wird
- ✓Eigenes Wörterbuch für Fachbegriffe und Medikamentennamen
- ✓Keine Patientendaten verlassen das Gerät, weil es keinen Upload-Weg gibt
- ✓Ein 20-minütiges Gespräch ist auf einem Mac mit Apple Silicon in deutlich unter einer Minute transkribiert
Recht
Anwältinnen und Anwälte nutzen Whisper Notes für Zeugenvernehmungen, Mandantengespräche und die Fallvorbereitung. Die Aufnahme bleibt auf dem Gerät, also hält kein Anbieter eine Kopie davon. Deine eigenen Pflichten sind damit nicht erledigt: Ob ein bestimmter Ablauf die Verschwiegenheitsregeln deiner Rechtsordnung erfüllt, hängt weiterhin daran, wie mit dem Gerät, seinen Backups und seinen Exporten umgegangen wird.
Use Cases
- •Dokumentation von Mandantengesprächen
- •Transkription von Zeugenvernehmungen
- •Notizen zur Fallrecherche
- •Protokolle von Gerichtsterminen
- •Ermittlungsgespräche
Benefits
- ✓Wir halten keine Kopie der Aufnahme und keine des Transkripts
- ✓Eigenes Wörterbuch für Fallnamen und juristische Fachbegriffe
- ✓Transkripte mit Zeitstempeln, exportiert als Text, SRT, VTT oder JSON
- ✓$7.99 auf dem iPhone oder $14 auf dem Mac, einmalig, gegen ausgelagerte Transkription nach Minutenpreis
Journalismus
Reporterinnen und Reporter nutzen Whisper Notes für Quelleninterviews und Aufnahmen im Feld. Kein Server hält das Audio, also liegen die einzigen Kopien auf deinen eigenen Geräten. Damit wandert der Quellenschutz von unserer Aufbewahrungsrichtlinie, die du nicht überprüfen kannst, zur Sicherheit deines eigenen Geräts, die du überprüfen kannst. Wenn in der Redaktion mehrere Leute während einer laufenden Veranstaltung an einem Transkript arbeiten müssen, ist das die Aufgabe eines Cloud-Werkzeugs.
Use Cases
- •Transkription von Quelleninterviews
- •Dokumentation von Aufnahmen im Feld
- •Notizen von Pressekonferenzen
- •Archive von Forschungsinterviews
- •Podcast-Produktion
Benefits
- ✓Weder die Aufnahme noch das Transkript wird irgendwohin gesendet
- ✓Funktioniert mit dem Gerät offline, was zugleich der Weg ist, die Behauptung zu prüfen
- ✓Kein Konto, also kein Login-Verlauf, der ein Interview mit dir verbindet
- ✓Export als Text, SRT, VTT oder JSON für die Werkzeuge, die in der Redaktion ohnehin laufen
Wie schnell ist die App, und wo stößt sie an Grenzen?
Die Zahlen, die wir gemessen haben, und die Dinge, die das Design ausschließt
Was wir gemessen haben, und worauf
Das Tempo hängt vom Rechner ab und von der Engine, die du wählst. Ein einzelner Multiplikator für „die App“ wäre deshalb irreführend. Die Zahlen unten sind unsere eigenen Läufe, Uhrzeit vom Start bis zum fertigen Text, auf Hardware, die wir benennen.
Parakeet V3, die Standard-Engine
Eine Meeting-Aufnahme von 17,5 Minuten war auf unserem M5 Air nach 16,7 Sekunden fertig — rund 60x Echtzeit
25 europäische Sprachen; eigener Lauf, ein Rechner
Der Whisper-Turbo-Weg
Whisper Large V3 Turbo liegt auf demselben Weg eher bei 11x Echtzeit. Das ist der Preis für seine 101 Sprachoptionen
Eigene Läufe; Turbo ist der Weg mit der breiten Abdeckung, nicht der schnelle
Ältere und kleinere Geräte
Ein iPhone arbeitet sich langsamer durch eine Datei als ein Mac mit Apple Silicon, und der Abstand wächst mit dem Alter des Chips. Lange Dateien laufen trotzdem durch, sie brauchen entsprechend länger
iPhone 12 oder neuer, oder ein Mac mit Apple Silicon
Speicherplatz
Transkripte sind winzig, rund 0,1MB pro Stunde Audio. Der eigentliche Platzbedarf sind die Modelle: Whisper Large V3 Turbo ist rund 1,5GB groß, die anderen beiden sind kleiner
Parakeet V3 steckt in der iPhone-App; die anderen Modelle lädt man in der App herunter
Bekannte Einschränkungen
Die Modelle auf dem Gerät laufen zu lassen setzt harte Grenzen, und die prüft man leichter vor dem Kauf als danach. Genau dafür gibt es auf dem Mac ein Gratiskontingent von 5.000 Wörtern pro Woche.
Geräteanforderungen
Erfordert ein iPhone 12 oder neuer oder einen Mac mit Apple Silicon. Älterer Hardware fehlt die Leistung der Neural Engine, um das praktikabel zu machen.
Impact: Nicht kompatibel mit Geräten, die älter als 4-5 Jahre sind
Verarbeitungszeit
Die Verarbeitungszeit wächst mit der Länge der Aufnahme. An der Physik der Berechnung auf dem Gerät führt kein Weg vorbei.
Impact: Bei den Raten oben ist eine vierstündige Datei auf dem Mac eine Sache von Minuten und auf dem iPhone länger
Abhängigkeit von der Audioqualität
Schlechtes Audio oder lauter Hintergrundlärm senkt die Genauigkeit, und das Modell kann keine Information zurückholen, die nicht im Signal steckt.
Impact: Mikrofonposition und Durcheinanderreden verschieben die Fehlerrate stärker als die Wahl des Modells
Keine Live-Untertitel
Die App transkribiert eine Aufnahme, nachdem sie beendet ist, statt beim Sprechen mitzuschreiben. Live-Untertitel in dieser Qualität brauchen eine Modellklasse, die nicht auf ein Telefon passt, und die Verarbeitung der ganzen Datei gibt dem Modell außerdem mehr Kontext.
Impact: Wenn du Untertitel während der Veranstaltung auf dem Bildschirm brauchst, ist das hier das falsche Werkzeug
Eine Sprache pro Aufnahme
Schneller Sprachwechsel innerhalb einer einzelnen Aufnahme senkt die Genauigkeit. Das Modell arbeitet am besten, wenn die Sprache durchgehend gleich bleibt.
Impact: Beste Ergebnisse mit einer Hauptsprache pro Datei
Fazit: Offline Sprache-zu-Text App für Professionelle Nutzung
Erlebe die Offline Sprache-zu-Text App
Schließ dich Tausenden Profis an, die Whisper Notes für genaue, private Offline AI-Transkription vertrauen
Offline Sprache-zu-Text App verfügbar auf iOS und macOS • Nur $7.99 einmalig • Keine Abos oder laufende Gebühren für Offline AI-Transkription