Whisper Notes App: Offline Sprache-zu-Text Lösung
Analyse der OpenAI Whisper Large V3 Turbo-betriebenen App mit Offline AI-Transkription und Sprache-zu-Text Konvertierung
Was ist Whisper Notes?
Whisper Notes ist eine Offline Sprache-zu-Text App mit OpenAIs Whisper Large V3 Turbo Modell für Offline AI-Transkription. Anders als cloud-basierte Sprache-zu-Text Dienste verarbeitet diese Offline Transkriptionssoftware Audio komplett auf deinem Gerät - Datenschutz bei hoher Genauigkeit.
Die Whisper Notes App nutzen Profis aus verschiedenen Branchen - von Gesundheitsprofis mit HIPAA-Anforderungen bis Journalisten mit sensiblen Interviews. Mit über 10.000 aktiven Nutzern und 4,8-Sterne-Bewertung in App Stores ist diese Offline Sprache-zu-Text Lösung etabliert bei Offline Transkriptionssoftware und Offline AI-Transkriptionstechnologie.
Die Versteckten Kosten von "Kostenlosen" Whisper Apps
Nach unserer Erfahrung folgen "kostenlose" Transkriptionstools einem konsistenten Muster: Sie laden Ihr Audio auf Cloud-Server hoch, verarbeiten es remote und behalten Daten zur Verbesserung ihrer Modelle. Das Produkt ist nicht die Software — es ist Ihre Stimme.
Stimmdaten Sind Permanent
Anders als Passwörter oder Kreditkartennummern kann Stimmbiometrie nach einer Kompromittierung nicht geändert werden. Wenige Sekunden Aufnahme erfassen akustische Signaturen, die Sie in verschiedenen Kontexten identifizieren.
Stimmklonungstechnologie benötigt jetzt nur drei bis fünf Sekunden Beispielaudio. Die menschliche Erkennungsgenauigkeit für hochwertige Stimmen-Deepfakes liegt bei nur 24,5%. Im Jahr 2025 wurde ein Stimmklon des italienischen Verteidigungsministers verwendet, um fast eine Million Euro zu erbeuten. Dies ist kein theoretisches Risiko.
Wenn Sie Audio zu einem Cloud-Transkriptionsdienst hochladen, erstellen Sie einen permanenten Datensatz Ihrer biometrischen Identität auf Infrastruktur, die Sie nicht kontrollieren.
Die Sicherheitslage bei Cloud-Transkription
KI-bezogene Sicherheitsvorfälle stiegen 2024 um 56,4%. Zweiundachtzig Prozent der Datenlecks betreffen jetzt Cloud-Infrastruktur. Im Gesundheitswesen gab es Offenlegungen geschützter Gesundheitsinformationen durch Transkriptionsagenten, EHR-Integrationen und falsch konfigurierte Datenseen.
Das Muster ist vorhersehbar: Sensible Daten fließen in KI-Systeme, die Sichtbarkeit sinkt, und Angreifer oder Unfälle legen offen, was privat bleiben sollte. Kontaktcenter-Transkripte fließen zu Modellen, während Kontonummern unverschleiert in Debug-Logs landen.
Die erste Hälfte von 2025 sah einen starken Anstieg bei großen Datenlecks mit sensibleren Datenkategorien. Statt nur Benutzernamen und Passwörtern legen Datenlecks jetzt genetische Profile, Stimmaufnahmen und biometrische Identifikatoren offen.
Die Richtung der Entwicklung
Im März 2025 kündigte Amazon an, die Einstellung "Keine Sprachaufnahmen Senden" auf Echo-Geräten einzustellen. Alle Benutzerinteraktionen mit Alexa-Geräten werden jetzt standardmäßig aufgezeichnet und an Amazons Server gesendet, ohne Möglichkeit zur Abmeldung.
Dies ist keine isolierte Entscheidung. Große Plattformen bewegen sich zu mehr Datensammlung, nicht weniger. Die wirtschaftlichen Anreize der KI-Entwicklung begünstigen die Akkumulation von Trainingsdaten. Datenschutzoptionen, die heute existieren, existieren morgen vielleicht nicht mehr.
Wir haben Whisper Notes mit der entgegengesetzten Architektur gebaut: Es gibt keinen Server, an den Daten gesendet werden können. Dies ist keine Einstellung, die geändert werden kann. Es ist eine fundamentale Einschränkung, wie die App gebaut ist.
Der Wahre Preis von "Kostenlos"
Kostenlose Whisper Web-Tools verwenden Ihr Audio oft zur Verbesserung ihrer Modelle. Dies wird in Nutzungsbedingungen offengelegt, die wenige Benutzer lesen. Pro-Minute Cloud-Dienste von $0,006 bis $0,40 pro Minute summieren sich für regelmäßige Benutzer auf Hunderte Dollar jährlich.
Abo-basierte Dienste wie Otter.ai kosten etwa $99 pro Jahr. Über fünf Jahre sind das $495—für einen Dienst, der Ihr Audio auf Remote-Servern verarbeitet.
Whisper Notes kostet $7,99 einmalig. Kein Abo. Keine Pro-Minute-Gebühren. Keine Datensammlung. Das Geschäftsmodell ist einfach: Sie zahlen für Software, Sie besitzen die Software.
Kosten pro Jahr
| Dienstart | Jahr 1 | Jahr 2 | Jahr 3 | Datenverarbeitung |
|---|---|---|---|---|
| Whisper Notes | $7,99 | $0 | $0 | Verlässt niemals das Gerät |
| Abo-Dienst | $99 | $99 | $99 | Cloud-verarbeitet |
| Pro-Minute Cloud API | $120-480 | $120-480 | $120-480 | Cloud-verarbeitet |
| "Kostenlose" Web-Tools | $0 | $0 | $0 | Für KI-Training verwendet |
Wann Sie besser einen Cloud-Dienst nehmen
Auf sauberem Audio sind die großen Cloud-Modelle noch immer etwas genauer, weil sie in einer Größe laufen, die kein Telefon und kein Laptop fassen kann, und sie können live mitschreiben, was Transkription am Gerät noch nicht erreicht. Das sind echte Vorteile, und wir tun nicht so, als gäbe es sie nicht.
Wenn Sie Live-Untertitel brauchen, wenn mehrere Personen dasselbe Transkript bearbeiten müssen, während die Besprechung noch läuft, oder wenn Ihnen der letzte Rest Genauigkeit wichtiger ist als der Ort, an dem das Audio liegt, dann ist ein Cloud-Dienst das bessere Werkzeug — und uns ist lieber, Sie nehmen ihn.
Widersprechen würden wir nur einem: dass dieser Abstand in der Genauigkeit die einzige Zahl in der Entscheidung ist. Bei Arbeit unter Schweigepflicht — Krankenakten, Mandantengeheimnisse, Gespräche mit Quellen — ist „Wo landet das Audio?“ eine Frage, die Sie beantworten können müssen, und die kürzeste belastbare Antwort lautet: Es ist nirgendwo hingegangen.
Warum Architektur Wichtig Ist: Native Apps vs. Web Wrapper
Wenn Sie nach "Whisper App" suchen, finden Sie drei Kategorien: Web-basierte Tools, die in Ihrem Browser laufen, Cloud-APIs, die Internet erfordern, und native Apps, die speziell für Ihr Gerät kompiliert wurden. Der Architekturunterschied ist wichtig für Datenschutz und Leistung.
Web Wrapper und Browser-basierte Tools
Viele browser-basierte Whisper-Tools behaupten "lokale Verarbeitung," was technisch korrekt ist. Ihr Audio bleibt im Browser-Tab. Aber Browser-Umgebungen haben fundamentale Einschränkungen.
Speicherbeschränkungen erzwingen kleinere Modelle. Die meisten Browser begrenzen WebAssembly-Speicher auf etwa 4GB, was die ausführbare Modellgröße einschränkt. JavaScript fügt Verarbeitungs-Overhead im Vergleich zu nativem Code hinzu. Ein einzelner Tab-Absturz verliert Ihre Arbeit ohne Wiederherstellungsoption.
Browser-basierte Tools fehlt auch Systemintegration. Sie können nicht im Hintergrund laufen, während Sie andere Anwendungen nutzen. Sie können nicht effizient auf Hardware-Beschleunigung zugreifen. Es sind Webseiten, die zufällig Transkription machen, keine Transkriptionssoftware.
| Verarbeitung | WebAssembly/TensorFlow.js im Browser |
| Modellgröße | Begrenzt durch Browser-Speicher (~4GB) |
| Geschwindigkeit | Langsamer durch JavaScript-Overhead |
| Datenschutz | Besser als Cloud, aber Browser hat Zugriff |
| Zuverlässigkeit | Tab kann abstürzen, keine Hintergrundverarbeitung |
Native Apps: Direkter Hardware-Zugriff
Whisper Notes ist speziell für macOS und iOS kompiliert. Es greift direkt auf Apples Neural Engine zu — denselben dedizierten Chip, der Face ID und Computational Photography antreibt.
Dies ist keine Webseite in einer App-Hülle. Es ist nativer Code, optimiert für Ihre spezifische Hardware. Genau deshalb sind die Geschwindigkeiten auf dieser Seite überhaupt möglich: Auf einem M4 Pro schafft Parakeet V3 35 Minuten Audio in etwa 18 Sekunden.
Native Apps können im Hintergrund laufen, sich in Systemdienste integrieren und sich elegant von Unterbrechungen erholen. Sie sind vom Betriebssystem sandboxed, was bedeutet, dass sie nicht auf Daten anderer Apps zugreifen können. Und da Whisper Notes keine Netzwerkberechtigungen anfordert, kann es buchstäblich keine Daten übertragen, selbst wenn es kompromittiert würde.
| Verarbeitung | Direkter Apple Neural Engine Zugriff |
| Modellgröße | Whisper Large V3 Turbo, rund 1,5GB |
| Geschwindigkeit | Parakeet V3 mit rund 60x Echtzeit auf unserem M5 Air |
| Datenschutz | Sandboxed, keine Netzwerkberechtigungen |
| Zuverlässigkeit | Hintergrundverarbeitung, Systemintegration |
Cloud APIs: Maximale Leistung, Maximale Exposition
Cloud-Dienste können die größten Whisper-Modelle ausführen, weil Server-Ressourcen effektiv unbegrenzt sind. Sie können marginal höhere Genauigkeit und Funktionen wie Echtzeit-Transkription bieten, die erhebliche Rechenleistung erfordern.
Der Kompromiss: Jede Aufnahme wird auf Infrastruktur hochgeladen, die Sie nicht kontrollieren. Ihr Audio durchquert das Internet, wird auf Remote-Servern verarbeitet und kann gemäß Aufbewahrungsrichtlinien gespeichert werden, die Sie nicht gewählt haben.
Für Therapeuten mit Vertraulichkeitsanforderungen, Anwälte mit privilegierter Kommunikation, Journalisten, die Quellen schützen, oder jeden, der mit sensiblen Informationen arbeitet, ist Cloud-Verarbeitung oft ein disqualifizierender Faktor, unabhängig von Genauigkeitsvorteilen.
| Verarbeitung | Remote-Server (unbegrenzte Rechenleistung) |
| Modellgröße | Größte verfügbare Modelle |
| Geschwindigkeit | Abhängig von Internet und Server-Warteschlange |
| Datenschutz | Audio hochgeladen und potenziell gespeichert |
| Zuverlässigkeit | Erfordert Internet, unterliegt Rate-Limits |
Unsere Architektur-Entscheidung
Wir haben native App-Architektur gewählt, weil es die einzige Möglichkeit ist, dafür zu sorgen, dass Ihre Stimmdaten auf Ihrem Gerät bleiben. Nicht "lokal verarbeitet dann synchronisiert." Nicht "verschlüsselt im Transit." Niemals hochgeladen, Punkt.
Diese Wahl hat Kosten. Wir können keine Echtzeit-Transkription während der Aufnahme bieten. Wir können keine Modelle größer als das, was auf Ihr Gerät passt, ausführen. Wir können keine kollaborativen Funktionen bieten, die einen Server erfordern.
Wir haben diesen Kompromiss absichtlich gemacht. Für die Anwendungsfälle, wo Datenschutz wichtig ist — und nach unserer Erfahrung umfasst das die meiste professionelle Transkription — wiegt die lokale Verarbeitung schwerer als die Funktionen, die Cloud-Infrastruktur erfordern.
Welches Modell macht hier die Arbeit?
Drei Engines, und wie Sie eine auswählen
Technische Spezifikationen
| KI-Modelle | Parakeet V3 (Standard), Whisper Large V3 Turbo (Mac) oder Whisper Small (iPhone), SenseVoice |
| Sprachen | 101 Optionen über Whisper, 25 europäische über Parakeet V3, 6 über SenseVoice |
| Audio-Formate | MP3, WAV, M4A, FLAC, AAC, OGG, WMA |
| Verarbeitungsgeschwindigkeit | Parakeet V3 rund 60x Echtzeit auf unserem M5 Air; der Whisper-Turbo-Weg rund 11x |
| Dateigröße-Limit | Keines, das die App vorgibt |
| Plattformen | iOS 18+, macOS 11+ (Apple Silicon optimiert) |
Was kann die App tatsächlich?
Drei Dinge tragen den größten Teil der täglichen Nutzung: Audio hineinbekommen, Text herausbekommen, und die Einschränkung, die beides auf dem Gerät hält.
Offline Datei-Import
Importiere Audio-Dateien oder abgeschlossene Aufnahmen für hochpräzise Offline AI-Transkription. Diese Offline Sprache-zu-Text App verarbeitet Dateien mit Kontextanalyse für maximale Genauigkeit - überlegene Ergebnisse im Vergleich zu Online Sprache-zu-Text Diensten.
- ✓Audio-Dateien aus verschiedenen Quellen importieren (Dateien, Sprachmemos, etc.)
- ✓Audio erst aufnehmen, dann transkribieren für optimale Genauigkeit
- ✓Hintergrund Offline Sprache-zu-Text Verarbeitung während Nutzung anderer Apps
- ✓Automatische Dateiorganisation und Transkriptionsmanagement
Erweiterte Export-Optionen
Professionelle Ausgabeformate für verschiedene Anwendungsfälle - von einfachen Textdokumenten bis Untertiteldateien für Videoinhalte.
- ✓Klartext mit anpassbarer Formatierung
- ✓SRT und VTT Untertiteldateien für Video
- ✓Zeitgestempelte Transkripte als Referenz
- ✓Sprecher-Identifikation und -Kennzeichnung
- ✓Benutzerdefinierte Absatz-Segmentierung
Datenschutz: Echte Offline Sprache-zu-Text Verarbeitung
Für Ihr Audio und dessen Transkript gibt es keinen Upload-Weg. Das können Sie im Flugmodus in einer halben Minute selbst nachprüfen.
- ✓Offline Sprache-zu-Text Verarbeitung (keine Datenübertragung)
- ✓Kein externer Auftragsverarbeiter: private Transkription für Gesundheitswesen, Recht und Wirtschaft
- ✓Verschlüsselte lokale Speicherung für alle Offline AI-Transkription
- ✓Keine Cloud-Abhängigkeiten - echte Offline Transkriptionssoftware
- ✓Audit-Trail für Unternehmens Offline Sprache-zu-Text Umgebungen
Wie genau ist die App, und woher kommt diese Zahl?
Veröffentlichte Benchmarks, dazu unsere eigenen Messungen auf benannter Hardware
Wir führen keine eigene Genauigkeitsstudie durch: Ein Anbieter, der sich selbst benotet, ist wenig wert. Die Wortfehlerraten unten stammen vom Hugging Face Open ASR Leaderboard und vom FLEURS-Benchmark. Beide sind öffentlich und werden von Leuten betrieben, die nichts an dieser App verdienen. Die Geschwindigkeitswerte sind unsere eigenen, gemessen auf einem Gerät, das wir benennen.
Wortfehlerrate nach Modell
| Modell | Quelle | Fehlerrate | Anmerkung |
|---|---|---|---|
| Parakeet V3 (Standard auf dem Mac) | Open ASR Leaderboard | 6,32 % WER (Englisch) | 25 europäische Sprachen; 12,0 % Durchschnitt über alle bei FLEURS |
| Whisper Large V3 Turbo | Open ASR Leaderboard | 7,83 % WER (Englisch) | Die breiteste Abdeckung der drei: 101 Sprachoptionen |
| SenseVoice Small | Eigener Test, M4 Pro | 27-Minuten-Podcast in 13,83 s | Für Chinesisch, Japanisch, Koreanisch und Kantonesisch gebaut |
Key Findings
- •Parakeet V3 transkribiert 35 Minuten Audio in 18 Sekunden auf einem M4 Pro; Whisper Turbo braucht für dieselbe Datei rund drei Minuten
- •Im Englischen liegen die drei Modelle weniger als zwei Punkte Wortfehlerrate auseinander
- •Gemessen wird auf vorgelesener und vorbereiteter Sprache. Deine eigenen Aufnahmen schneiden schlechter ab, und Mikrofon und Durcheinanderreden verschieben die Zahl stärker als die Wahl des Modells
Große Cloud-Modelle behalten bei sauberem Audio einen kleinen Vorsprung, weil sie in einer Größe laufen, die kein Telefon und kein Laptop halten kann. Dieser Abstand ist der Preis dafür, dass das Audio das Gerät nie verlässt. Wenn deine Arbeit nicht den letzten Genauigkeitspunkt braucht, lohnt sich der Tausch meistens. Wenn doch, ist ein Cloud-Dienst die ehrliche Empfehlung.
Wie schneidet die App gegen die Alternativen ab?
Gegen Cloud-Dienste, gegen die Bordmittel Ihres Geräts und gegen Unternehmenssoftware
Das meiste in dieser Tabelle können Sie in ein paar Minuten selbst nachprüfen. Genau lesen sollte man die Zeile zur Genauigkeit, denn die vier Kategorien werden nicht auf demselben Benchmark gemessen.
Funktionsvergleich
| Funktion | Whisper Notes App | Cloud-Dienste | Eingebaute Tools | Unternehmens-Software |
|---|---|---|---|---|
| Genauigkeit (Wortfehlerrate Englisch) | 6,32-7,83 % (Open ASR Leaderboard) | Herstellerangaben, meist nicht auf diesem Leaderboard | Nicht veröffentlicht | Nicht veröffentlicht |
| Wo das Audio verarbeitet wird | Auf Ihrem Gerät | Server des Anbieters | Je nach Anbieter | Vor-Ort-Option |
| Kosten | $7.99 iPhone, $14 Mac, einmalig | $0.006-0.40/Min | Kostenlos (begrenzt) | $500-2000/Lizenz |
| Sprachen | 101 Sprachoptionen | 50-100 Sprachen | 10-30 Sprachen | 20-50 Sprachen |
| Internet nötig | Nein | Ja | Manchmal | Vor-Ort: Nein |
| Limit für die Dateilänge | Keines, das die App vorgibt | Meist 1-2 Stunden | 5-10 Minuten | Variiert |
Market Position: Nebeneinander gestellt wird der Tausch lesbar. Eine Cloud-API auf dem neuesten Stand ist bei sauberem Audio immer noch etwas genauer, und sie kostet $0.006 bis $0.40 pro Minute, wobei Ihre Aufnahme auf einer fremden Festplatte liegt. Unternehmenstranskription vor Ort hält das Audio im eigenen Netz und beginnt bei rund $500 pro Arbeitsplatz. Whisper Notes lässt die offenen Modelle auf Hardware laufen, die Ihnen schon gehört, für $7.99 auf dem iPhone oder $14 auf dem Mac, und gibt dafür Live-Untertitel, gemeinsames Bearbeiten und den letzten Rest Genauigkeit auf. Wenn eines dieser drei Dinge auf Ihrer Liste steht, ist eine der beiden anderen Optionen der bessere Kauf.
Für welche Arbeit passt die App?
Drei Arten von Arbeit, bei denen die Aufnahme nicht reisen darf
Gesundheitswesen
Ärztinnen und Ärzte nutzen Whisper Notes für Patientendokumentation, klinische Notizen und Forschungsinterviews. Weil das Audio nie auf einem Server von uns landet, gibt es keinen externen Auftragsverarbeiter, den ein BAA abdecken müsste. Ob der gesamte Ablauf HIPAA erfüllt, hängt weiterhin davon ab, wie das Gerät selbst gesichert ist — und wenn Kolleginnen und Kollegen dieselbe Notiz öffnen und kommentieren müssen, ist ein Cloud-Dienst mit unterschriebenem BAA die praktischere Antwort.
Use Cases
- •Dokumentation von Patientengesprächen
- •Notizen zu medizinischen Eingriffen
- •Transkription von Forschungsinterviews
- •Aufzeichnungen von Telemedizin-Sitzungen
- •Inhalte für die klinische Ausbildung
Benefits
- ✓Keine Datenschutzrichtlinie, der Sie vertrauen müssen, weil nichts gesendet wird
- ✓Eigenes Wörterbuch für Fachbegriffe und Medikamentennamen
- ✓Keine Patientendaten verlassen das Gerät, weil es keinen Upload-Weg gibt
- ✓Ein 20-minütiges Gespräch ist auf einem Mac mit Apple Silicon in deutlich unter einer Minute transkribiert
Recht
Anwältinnen und Anwälte nutzen Whisper Notes für Zeugenvernehmungen, Mandantengespräche und die Fallvorbereitung. Die Aufnahme bleibt auf dem Gerät, also hält kein Anbieter eine Kopie davon. Ihre eigenen Pflichten sind damit nicht erledigt: Ob ein bestimmter Ablauf die Verschwiegenheitsregeln Ihrer Rechtsordnung erfüllt, hängt weiterhin daran, wie mit dem Gerät, seinen Backups und seinen Exporten umgegangen wird.
Use Cases
- •Dokumentation von Mandantengesprächen
- •Transkription von Zeugenvernehmungen
- •Notizen zur Fallrecherche
- •Protokolle von Gerichtsterminen
- •Ermittlungsgespräche
Benefits
- ✓Wir halten keine Kopie der Aufnahme und keine des Transkripts
- ✓Eigenes Wörterbuch für Fallnamen und juristische Fachbegriffe
- ✓Transkripte mit Zeitstempeln, exportiert als Text, SRT, VTT oder JSON
- ✓$7.99 auf dem iPhone oder $14 auf dem Mac, einmalig, gegen ausgelagerte Transkription nach Minutenpreis
Journalismus
Reporterinnen und Reporter nutzen Whisper Notes für Quelleninterviews und Aufnahmen im Feld. Kein Server hält das Audio, also liegen die einzigen Kopien auf Ihren eigenen Geräten. Damit wandert der Quellenschutz von unserer Aufbewahrungsrichtlinie, die Sie nicht überprüfen können, zur Sicherheit Ihres eigenen Geräts, die Sie überprüfen können. Wenn in der Redaktion mehrere Leute während einer laufenden Veranstaltung an einem Transkript arbeiten müssen, ist das die Aufgabe eines Cloud-Werkzeugs.
Use Cases
- •Transkription von Quelleninterviews
- •Dokumentation von Aufnahmen im Feld
- •Notizen von Pressekonferenzen
- •Archive von Forschungsinterviews
- •Podcast-Produktion
Benefits
- ✓Weder die Aufnahme noch das Transkript wird irgendwohin gesendet
- ✓Funktioniert mit dem Gerät offline, was zugleich der Weg ist, die Behauptung zu prüfen
- ✓Kein Konto, also kein Login-Verlauf, der ein Interview mit Ihnen verbindet
- ✓Export als Text, SRT, VTT oder JSON für die Werkzeuge, die in der Redaktion ohnehin laufen
Wie schnell ist die App, und wo stößt sie an Grenzen?
Die Zahlen, die wir gemessen haben, und die Dinge, die das Design ausschließt
Was wir gemessen haben, und worauf
Das Tempo hängt vom Rechner ab und von der Engine, die Sie wählen. Ein einzelner Multiplikator für „die App“ wäre deshalb irreführend. Die Zahlen unten sind unsere eigenen Läufe, Uhrzeit vom Start bis zum fertigen Text, auf Hardware, die wir benennen.
Parakeet V3, die Standard-Engine
Eine Meeting-Aufnahme von 17,5 Minuten war auf unserem M5 Air nach 16,7 Sekunden fertig — rund 60x Echtzeit
25 europäische Sprachen; eigener Lauf, ein Rechner
Der Whisper-Turbo-Weg
Whisper Large V3 Turbo liegt auf demselben Weg eher bei 11x Echtzeit. Das ist der Preis für seine 101 Sprachoptionen
Eigene Läufe; Turbo ist der Weg mit der breiten Abdeckung, nicht der schnelle
Ältere und kleinere Geräte
Ein iPhone arbeitet sich langsamer durch eine Datei als ein Mac mit Apple Silicon, und der Abstand wächst mit dem Alter des Chips. Lange Dateien laufen trotzdem durch, sie brauchen entsprechend länger
iPhone 12 oder neuer, oder ein Mac mit Apple Silicon
Speicherplatz
Transkripte sind winzig, rund 0,1MB pro Stunde Audio. Der eigentliche Platzbedarf sind die Modelle: Whisper Large V3 Turbo ist rund 1,5GB groß, die anderen beiden sind kleiner
Parakeet V3 steckt in der iPhone-App; die anderen Modelle lädt man in der App herunter
Bekannte Einschränkungen
Die Modelle auf dem Gerät laufen zu lassen setzt harte Grenzen, und die prüft man leichter vor dem Kauf als danach. Genau dafür gibt es am Mac ein Gratiskontingent von 5.000 Wörtern pro Woche.
Geräteanforderungen
Erfordert ein iPhone 12 oder neuer oder einen Mac mit Apple Silicon. Älterer Hardware fehlt die Leistung der Neural Engine, um das praktikabel zu machen.
Impact: Nicht kompatibel mit Geräten, die älter als 4-5 Jahre sind
Verarbeitungszeit
Die Verarbeitungszeit wächst mit der Länge der Aufnahme. An der Physik der Berechnung auf dem Gerät führt kein Weg vorbei.
Impact: Bei den Raten oben ist eine vierstündige Datei auf dem Mac eine Sache von Minuten und auf dem iPhone länger
Abhängigkeit von der Audioqualität
Schlechtes Audio oder lauter Hintergrundlärm senkt die Genauigkeit, und das Modell kann keine Information zurückholen, die nicht im Signal steckt.
Impact: Mikrofonposition und Durcheinanderreden verschieben die Fehlerrate stärker als die Wahl des Modells
Keine Live-Untertitel
Die App transkribiert eine Aufnahme, nachdem sie beendet ist, statt beim Sprechen mitzuschreiben. Live-Untertitel in dieser Qualität brauchen eine Modellklasse, die nicht auf ein Telefon passt, und die Verarbeitung der ganzen Datei gibt dem Modell außerdem mehr Kontext.
Impact: Wenn Sie Untertitel während der Veranstaltung auf dem Bildschirm brauchen, ist das hier das falsche Werkzeug
Eine Sprache pro Aufnahme
Schneller Sprachwechsel innerhalb einer einzelnen Aufnahme senkt die Genauigkeit. Das Modell arbeitet am besten, wenn die Sprache durchgehend gleich bleibt.
Impact: Beste Ergebnisse mit einer Hauptsprache pro Datei
Fazit: Offline Sprache-zu-Text App für Professionelle Nutzung
Erlebe die Offline Sprache-zu-Text App
Schließ dich Tausenden Profis an, die Whisper Notes für genaue, private Offline AI-Transkription vertrauen
Offline Sprache-zu-Text App verfügbar auf iOS und macOS • Nur $7.99 einmalig • Keine Abos oder laufende Gebühren für Offline AI-Transkription