Whisper Notes App: ucapan ke teks offline

Ulasan aplikasi Whisper Notes menggunakan OpenAI Whisper Large V3 Turbo untuk transkripsi offline di iPhone dan Mac

Diperbarui Agustus 2025•8 menit baca

Apa itu Whisper Notes?

Whisper Notes adalah aplikasi ucapan-ke-teks offline yang menggunakan model OpenAI Whisper Large V3 Turbo. Memproses audio sepenuhnya di perangkat Anda — tanpa upload cloud. Digunakan oleh profesional kesehatan, hukum, dan jurnalisme untuk kepatuhan HIPAA dan privasi lengkap.

Aplikasi Whisper Notes memiliki 10.000+ pengguna di seluruh dunia. Penyedia layanan kesehatan menggunakannya untuk catatan pasien. Jurnalis menggunakannya untuk transkripsi wawancara. Pengacara menggunakannya untuk deposisi. Semua offline — audio Anda tidak pernah meninggalkan perangkat Anda.

Biaya tersembunyi dari aplikasi Whisper "gratis"

Berdasarkan pengalaman kami, alat transkripsi "gratis" mengikuti pola yang konsisten: mereka mengunggah audio Anda ke server cloud, memprosesnya dari jarak jauh, dan menyimpan data untuk meningkatkan model mereka. Produknya bukan perangkat lunak — melainkan suara Anda.

Data suara bersifat permanen

Tidak seperti kata sandi atau nomor kartu kredit, biometrik suara tidak dapat diubah setelah dikompromikan. Beberapa detik rekaman menangkap tanda tangan akustik yang mengidentifikasi Anda di berbagai konteks.

Teknologi kloning suara sekarang hanya membutuhkan tiga hingga lima detik sampel audio. Akurasi deteksi manusia untuk deepfake suara berkualitas tinggi hanya 24,5%. Pada tahun 2025, klon suara Menteri Pertahanan Italia digunakan untuk mengekstrak hampir satu juta euro. Ini bukan risiko teoretis.

Ketika Anda mengunggah audio ke layanan transkripsi cloud, Anda membuat catatan permanen identitas biometrik Anda pada infrastruktur yang tidak Anda kendalikan.

Lanskap pelanggaran transkripsi cloud

Insiden keamanan terkait AI meningkat 56,4% pada tahun 2024. Delapan puluh dua persen pelanggaran sekarang melibatkan infrastruktur cloud. Sektor kesehatan telah melihat paparan informasi kesehatan yang dilindungi melalui agen transkripsi, integrasi EHR, dan data lake yang salah dikonfigurasi.

Polanya dapat diprediksi: data sensitif mengalir ke sistem AI, visibilitas menurun, dan penyerang atau kecelakaan mengekspos apa yang seharusnya bersifat pribadi. Transkrip pusat kontak mengalir ke model sementara nomor rekening mendarat di log debug tanpa masking.

Paruh pertama 2025 melihat peningkatan tajam dalam pelanggaran data besar yang melibatkan kategori data yang lebih sensitif. Alih-alih hanya nama pengguna dan kata sandi, pelanggaran sekarang mengekspos profil genetik, rekaman suara, dan pengenal biometrik.

Arah perjalanan

Pada Maret 2025, Amazon mengumumkan penghentian pengaturan "Jangan Kirim Rekaman Suara" pada perangkat Echo. Semua interaksi pengguna dengan perangkat Alexa sekarang direkam dan dikirim ke server Amazon secara default, tanpa opsi untuk menolak.

Ini bukan keputusan yang terisolasi. Platform besar bergerak menuju lebih banyak pengumpulan data, bukan lebih sedikit. Insentif ekonomi pengembangan AI mendukung akumulasi data pelatihan. Opsi privasi yang ada hari ini mungkin tidak ada besok.

Kami membangun Whisper Notes dengan arsitektur yang berlawanan: tidak ada server untuk mengirim data. Ini bukan pengaturan yang dapat diubah. Ini adalah batasan mendasar dari cara aplikasi dibangun.

Harga sebenarnya dari "gratis"

Alat web Whisper gratis sering menggunakan audio Anda untuk meningkatkan model mereka. Ini diungkapkan dalam persyaratan layanan yang jarang dibaca pengguna. Layanan cloud per menit dengan harga $0.006 hingga $0.40 per menit terakumulasi menjadi ratusan dolar setiap tahun untuk pengguna reguler.

Layanan berbasis langganan seperti Otter.ai berharga sekitar $99 per tahun. Selama lima tahun, itu adalah $495—untuk layanan yang memproses audio Anda di server jarak jauh.

Whisper Notes berharga $7.99 sekali. Tanpa langganan. Tanpa biaya per menit. Tanpa pengumpulan data. Model bisnisnya sederhana: Anda membayar untuk perangkat lunak, Anda memiliki perangkat lunak.

Biaya per tahun

Jenis layananTahun 1Tahun 2Tahun 3Penanganan data
Whisper Notes$7.99$0$0Tidak pernah meninggalkan perangkat
Layanan langganan$99$99$99Diproses di cloud
Cloud API per menit$120-480$120-480$120-480Diproses di cloud
Alat web "gratis"$0$0$0Digunakan untuk pelatihan AI

Kapan sebaiknya Anda memakai layanan cloud

Pada audio yang bersih, model-model besar di cloud memang masih sedikit lebih akurat, karena mereka berjalan pada ukuran yang tak muat di ponsel maupun laptop mana pun, dan mereka bisa memberi teks langsung saat orang berbicara — transkripsi di perangkat belum menyamai itu. Itu keunggulan yang nyata dan kami tidak akan berpura-pura sebaliknya.

Kalau Anda butuh teks langsung, kalau beberapa orang harus menyunting transkrip yang sama sementara rapat masih berjalan, atau kalau pecahan akurasi terakhir lebih berarti bagi Anda daripada di mana audionya berakhir, layanan cloud adalah alat yang lebih tepat dan kami lebih suka Anda memakainya.

Yang kami bantah hanya satu: memperlakukan selisih akurasi itu sebagai satu-satunya angka dalam keputusan. Untuk pekerjaan yang terikat kewajiban kerahasiaan — catatan medis, materi yang dilindungi hak istimewa, wawancara dengan narasumber — "audionya pergi ke mana" adalah pertanyaan yang harus bisa Anda jawab, dan jawaban terpendek yang bertahan adalah bahwa audio itu tidak pergi ke mana-mana.

Mengapa arsitektur penting: aplikasi native vs. web wrapper

Ketika Anda mencari "Whisper app," Anda akan menemukan tiga kategori: alat berbasis web yang berjalan di browser Anda, API cloud yang membutuhkan internet, dan aplikasi native yang dikompilasi khusus untuk perangkat Anda. Perbedaan arsitektur penting untuk privasi dan performa.

Web wrapper dan alat berbasis browser

Banyak alat Whisper berbasis browser mengklaim "pemrosesan lokal," yang secara teknis akurat. Audio Anda tetap di tab browser. Tetapi lingkungan browser memiliki keterbatasan mendasar.

Batasan memori memaksa model yang lebih kecil. Sebagian besar browser membatasi memori WebAssembly sekitar 4GB, yang membatasi ukuran model yang dapat berjalan. JavaScript menambahkan overhead pemrosesan dibandingkan dengan kode native. Satu tab crash kehilangan pekerjaan Anda tanpa opsi pemulihan.

Alat berbasis browser juga kurang integrasi sistem. Mereka tidak dapat berjalan di latar belakang saat Anda menggunakan aplikasi lain. Mereka tidak dapat mengakses akselerasi hardware secara efisien. Mereka adalah halaman web yang kebetulan melakukan transkripsi, bukan perangkat lunak transkripsi.

PemrosesanWebAssembly/TensorFlow.js di browser
Ukuran modelDibatasi oleh memori browser (~4GB)
KecepatanLebih lambat karena overhead JavaScript
PrivasiLebih baik dari cloud, tapi browser memiliki akses
KeandalanTab bisa crash, tidak ada pemrosesan latar belakang

Aplikasi native: akses hardware langsung

Whisper Notes dikompilasi khusus untuk macOS dan iOS. Mengakses Apple Neural Engine secara langsung — chip khusus yang sama yang menggerakkan Face ID dan fotografi komputasional.

Ini bukan halaman web yang dibungkus dalam shell aplikasi. Ini adalah kode native yang dioptimalkan untuk hardware spesifik Anda. Itu juga sebabnya angka kecepatan di halaman ini mungkin: di M4 Pro, Parakeet V3 menuntaskan 35 menit audio dalam sekitar 18 detik.

Aplikasi native dapat berjalan di latar belakang, terintegrasi dengan layanan sistem, dan pulih dengan anggun dari gangguan. Mereka di-sandbox oleh sistem operasi, artinya mereka tidak dapat mengakses data dari aplikasi lain. Dan karena Whisper Notes tidak meminta izin jaringan, secara harfiah tidak dapat mengirimkan data bahkan jika dikompromikan.

PemrosesanAkses langsung Apple Neural Engine
Ukuran modelWhisper Large V3 Turbo, sekitar 1,5GB
KecepatanParakeet V3 sekitar 60x waktu nyata di M5 Air kami
PrivasiSandbox, tanpa izin jaringan
KeandalanPemrosesan latar belakang, integrasi sistem

API cloud: kekuatan maksimal, paparan maksimal

Layanan cloud dapat menjalankan model Whisper terbesar karena sumber daya server secara efektif tidak terbatas. Mereka dapat menawarkan akurasi sedikit lebih tinggi dan fitur seperti transkripsi real-time yang membutuhkan daya komputasi substansial.

Komprominya: setiap rekaman diunggah ke infrastruktur yang tidak Anda kendalikan. Audio Anda melintasi internet, diproses di server jarak jauh, dan mungkin disimpan sesuai dengan kebijakan retensi yang tidak Anda pilih.

Untuk terapis yang terikat persyaratan kerahasiaan, pengacara yang menangani komunikasi istimewa, jurnalis yang melindungi sumber, atau siapa pun yang bekerja dengan informasi sensitif, pemrosesan cloud sering menjadi faktor diskualifikasi terlepas dari manfaat akurasi.

PemrosesanServer jarak jauh (komputasi tidak terbatas)
Ukuran modelModel terbesar yang tersedia
KecepatanTergantung internet dan antrian server
PrivasiAudio diunggah dan berpotensi disimpan
KeandalanMembutuhkan internet, tunduk pada batas rate

Keputusan arsitektur kami

Kami memilih arsitektur aplikasi native karena hanya begitu data suara Anda tidak punya jalan keluar dari perangkat. Bukan "diproses secara lokal lalu disinkronkan." Bukan "dienkripsi dalam transit." Tidak ada jalur unggah, titik.

Pilihan ini memiliki biaya. Kami tidak dapat menawarkan transkripsi real-time selama perekaman. Kami tidak dapat menjalankan model yang lebih besar dari yang muat di perangkat Anda. Kami tidak dapat menyediakan fitur kolaboratif yang membutuhkan server.

Kami membuat kompromi ini dengan sengaja. Untuk kasus penggunaan di mana privasi penting — dan menurut pengalaman kami, itu termasuk sebagian besar transkripsi profesional — kenyataan bahwa jalur unggah tidak ada lebih berarti daripada fitur yang membutuhkan infrastruktur cloud.

Model mana yang mengerjakan pekerjaannya?

Tiga mesin, dan cara memilih satu

Whisper Notes membawa tiga mesin pengenalan suara dan menjalankan ketiganya di perangkat. Parakeet V3 adalah bawaannya. Jalur Whisper adalah Whisper Large V3 Turbo di Mac dan Whisper Small di iPhone — 101 pilihan bahasa yang sama, dalam model seukuran ponsel. SenseVoice adalah mesin yang Anda pilih sendiri untuk bahasa Mandarin, Kanton, Jepang, dan Korea. Tidak ada yang beralih ke sana secara otomatis, jadi kalau Anda bekerja dalam bahasa-bahasa itu, mengganti mesin adalah hal pertama yang perlu dilakukan setelah memasang aplikasi.
Masing-masing untuk apa: Parakeet V3 mencakup 25 bahasa Eropa dan mencatat tingkat kesalahan kata bahasa Inggris 6,32% di Open ASR Leaderboard, terendah di antara ketiganya pada tolok ukur itu. Dalam pengujian kami sendiri, ia menuntaskan sebuah berkas sekitar lima kali lebih cepat daripada Whisper Large V3 Turbo. Alasan memilih Turbo adalah keluasan: 101 pilihan bahasa, dengan WER bahasa Inggris 7,83% di leaderboard yang sama. SenseVoice mencakup enam pilihan — Inggris, Mandarin sederhana dan tradisional, Kanton, Jepang, dan Korea — dan dalam pengujian kami ia bergerak sekitar 52 kali waktu nyata. Itulah alasan memilihnya untuk materi CJK.
Bagaimana ia berjalan di perangkat: Model diubah ke format Core ML milik Apple dan dijalankan di Neural Engine, cip yang sama di balik Face ID dan fotografi komputasional. Tidak ada server transkripsi di jalurnya, jadi tidak ada permintaan jaringan selama sebuah berkas ditranskripsi. Ini klaim yang bisa Anda periksa alih-alih Anda percayai: nyalakan mode pesawat sebelum mulai.
Mengapa tiga mesin, bukan satu: Saat ini tidak ada model terbuka yang terbaik dalam segala hal. Yang tercepat untuk bahasa Eropa bukan yang mencakup seratus bahasa, dan keduanya bukan yang dibangun untuk bahasa Mandarin dan Jepang. Menyertakan tiga dan membiarkan Anda memilih memang kurang rapi dibanding menyebut satu model terbaik. Tapi justru itu sebabnya aplikasi ini tetap berguna di luar satu rumpun bahasa.

Spesifikasi

Model AIParakeet V3 (bawaan), Whisper Large V3 Turbo (Mac) atau Whisper Small (iPhone), SenseVoice
Bahasa101 pilihan lewat Whisper, 25 bahasa Eropa lewat Parakeet V3, 6 lewat SenseVoice
Format audioMP3, WAV, M4A, FLAC, AAC, OGG, WMA
Kecepatan pemrosesanParakeet V3 sekitar 60x waktu nyata di M5 Air kami; jalur Whisper Turbo sekitar 11x
Batas ukuran berkasTidak ada yang ditetapkan aplikasi
PlatformiOS 18+, macOS 11+ (dioptimalkan Apple Silicon)

Apa yang sebenarnya bisa dilakukan?

Tiga hal menanggung sebagian besar pemakaian sehari-hari: memasukkan audio, mengeluarkan teks, dan batasan yang menahan keduanya di perangkat.

Impor file

Impor file audio untuk transkripsi offline. Aplikasi Whisper Notes memproses file menggunakan konteks penuh untuk akurasi yang lebih baik.

  • ✓Impor dari Files, Voice Memos, di mana saja
  • ✓Rekam dulu, transkripsi nanti untuk akurasi terbaik
  • ✓Pemrosesan latar belakang saat menggunakan aplikasi lain
  • ✓Organisasi file otomatis

Opsi ekspor

Berbagai format output dari teks hingga subtitle.

  • ✓Teks biasa dengan format
  • ✓File subtitle SRT dan VTT
  • ✓Transkrip dengan stempel waktu
  • ✓Label pembicara
  • ✓Jeda paragraf khusus

Perlindungan privasi

Untuk audio Anda dan transkripnya tidak ada jalur unggah. Anda bisa memeriksanya sendiri dalam setengah menit dengan mode pesawat.

  • ✓Nol transmisi data — pemrosesan offline
  • ✓Tanpa pemroses pihak ketiga: transkripsi privat untuk kesehatan, hukum, dan bisnis
  • ✓Penyimpanan lokal terenkripsi
  • ✓Tanpa server cloud — berjalan sepenuhnya di perangkat Anda
  • ✓Jejak audit untuk penggunaan perusahaan

Seberapa akurat, dan angka itu dari mana?

Tolok ukur publik, ditambah pengukuran kami sendiri di mesin yang kami sebutkan

Kami tidak membuat studi akurasi sendiri, karena produsen yang menilai pekerjaannya sendiri tidak banyak artinya. Angka tingkat kesalahan di bawah berasal dari Hugging Face Open ASR Leaderboard dan tolok ukur FLEURS. Keduanya publik dan dikelola orang-orang yang tidak mendapat apa pun dari aplikasi ini. Angka kecepatan memang milik kami, diukur di satu mesin yang kami sebutkan.

Tingkat kesalahan kata per model

ModelSumberTingkat kesalahanCatatan
Parakeet V3 (bawaan di Mac)Open ASR LeaderboardWER Inggris 6,32%25 bahasa Eropa; rata-rata semuanya di FLEURS 12,0%
Whisper Large V3 TurboOpen ASR LeaderboardWER Inggris 7,83%Cakupan terluas dari ketiganya: 101 pilihan bahasa
SenseVoice SmallPengujian kami, M4 ProPodcast 27 menit dalam 13,83 detikDibuat untuk bahasa Mandarin, Jepang, Korea, dan Kanton

Key Findings

  • •Parakeet V3 menranskripsi 35 menit audio dalam 18 detik di M4 Pro; Whisper Turbo butuh sekitar tiga menit untuk berkas yang sama
  • •Dalam bahasa Inggris, jarak ketiga model kurang dari dua poin tingkat kesalahan
  • •Angka ini diukur pada ucapan yang dibaca dan disiapkan. Rekaman Anda sendiri akan lebih buruk, dan mikrofon atau orang yang saling menyela lebih memengaruhi hasil daripada pilihan model

Pada audio bersih, model besar di cloud masih sedikit unggul, karena berjalan pada ukuran yang tidak muat di ponsel atau laptop mana pun. Selisih itu adalah harga agar audio tidak pernah meninggalkan perangkat. Kalau pekerjaan Anda tidak menuntut poin terakhir itu, pertukarannya biasanya sepadan. Kalau menuntut, saran jujurnya adalah memakai layanan cloud.

Bagaimana dibandingkan dengan alternatifnya?

Melawan layanan cloud, alat yang sudah ada di perangkat Anda, dan perangkat lunak perusahaan

Sebagian besar isi tabel ini bisa Anda periksa dalam beberapa menit. Baris akurasi perlu dibaca dengan hati-hati, karena empat kategorinya tidak diukur pada tolok ukur yang sama.

Perbandingan fitur

FiturAplikasi Whisper NotesLayanan cloudAlat bawaanPerangkat lunak perusahaan
Akurasi (WER bahasa Inggris)6,32-7,83% (Open ASR Leaderboard)Klaim vendor, kebanyakan tidak ada di leaderboard ituTidak dipublikasikanTidak dipublikasikan
Tempat audio diprosesDi perangkat AndaServer vendorBerbeda-beda tiap vendorOpsi on-premise
Biaya$7.99 iPhone, $14 Mac, sekali bayar$0.006-0.40/menitGratis (terbatas)$500-2000/lisensi
Bahasa101 pilihan bahasa50-100 bahasa10-30 bahasa20-50 bahasa
InternetTidakYaKadang-kadangOn-premise: Tidak
Batas panjang berkasTidak ada yang ditetapkan aplikasiBiasanya 1-2 jam5-10 menitBervariasi

Market Position: Disandingkan, tiga pilihan itu membuat pertukarannya terbaca. API cloud terdepan masih sedikit lebih akurat pada audio bersih, dan biayanya $0.006 sampai $0.40 per menit, dengan rekaman Anda berada di disk orang lain. Transkripsi perusahaan on-premise menahan audio di dalam jaringan Anda dan mulai dari sekitar $500 per kursi. Whisper Notes menjalankan model terbuka di perangkat keras yang sudah Anda miliki, $7.99 di iPhone atau $14 di Mac, dan sebagai gantinya melepas takarir langsung, penyuntingan bersama, dan pecahan akurasi terakhir. Kalau salah satu dari tiga hal itu ada di daftar Anda, salah satu dari dua pilihan lain adalah pembelian yang lebih baik.

Cocok untuk pekerjaan apa?

Tiga jenis pekerjaan yang rekamannya tidak boleh bepergian

Kesehatan

Tenaga kesehatan memakai Whisper Notes untuk dokumentasi pasien, catatan klinis, dan wawancara penelitian. Karena audio tidak pernah sampai ke server kami, tidak ada pemroses pihak ketiga yang perlu ditutup oleh BAA. Apakah seluruh alur kerjanya memenuhi HIPAA tetap bergantung pada cara perangkat itu sendiri diamankan. Dan kalau rekan kerja harus membuka serta mengomentari catatan yang sama, layanan cloud dengan BAA yang ditandatangani adalah jawaban yang lebih praktis.

Use Cases
  • •Dokumentasi konsultasi pasien
  • •Catatan prosedur medis
  • •Transkripsi wawancara penelitian
  • •Rekaman sesi telemedicine
  • •Konten pelatihan klinis
Benefits
  • ✓Tidak ada kebijakan berbagi data yang perlu Anda percayai, karena tidak ada yang dikirim
  • ✓Kamus khusus untuk istilah klinis dan nama obat
  • ✓Tidak ada data kesehatan yang keluar dari perangkat, karena jalur unggah tidak ada
  • ✓Konsultasi 20 menit selesai ditranskripsi jauh di bawah satu menit di Mac Apple Silicon

Hukum

Pengacara memakai Whisper Notes untuk deposisi, wawancara klien, dan persiapan perkara. Rekaman tetap di perangkat, jadi tidak ada vendor yang memegang salinannya. Itu tidak menyelesaikan kewajiban Anda sendiri: apakah suatu alur kerja memenuhi aturan kerahasiaan di yurisdiksi Anda tetap bergantung pada cara perangkat, cadangannya, dan hasil ekspornya ditangani.

Use Cases
  • •Dokumentasi wawancara klien
  • •Transkripsi deposisi
  • •Catatan penelitian perkara
  • •Rekaman proses hukum
  • •Wawancara investigasi
Benefits
  • ✓Kami tidak menyimpan salinan rekaman maupun transkripnya
  • ✓Kamus khusus untuk nama perkara dan istilah hukum
  • ✓Transkrip berstempel waktu, diekspor sebagai teks, SRT, VTT, atau JSON
  • ✓$7.99 di iPhone atau $14 di Mac, sekali bayar, dibanding transkripsi alih daya per menit

Jurnalisme

Wartawan memakai Whisper Notes untuk wawancara narasumber dan rekaman lapangan. Tidak ada server yang memegang audionya, jadi satu-satunya salinan ada di perangkat Anda sendiri. Perlindungan narasumber pun berpindah dari kebijakan penyimpanan kami, yang tidak bisa Anda periksa, ke keamanan perangkat Anda sendiri, yang bisa. Kalau redaksi butuh beberapa orang menyunting satu transkrip selama acara berlangsung, itu pekerjaan alat cloud.

Use Cases
  • •Transkripsi wawancara narasumber
  • •Dokumentasi rekaman lapangan
  • •Catatan konferensi pers
  • •Arsip wawancara penelitian
  • •Produksi podcast
Benefits
  • ✓Tidak ada bagian dari rekaman atau transkrip yang dikirim ke mana pun
  • ✓Bekerja dengan perangkat offline, yang sekaligus jadi cara memeriksanya
  • ✓Tanpa akun, jadi tidak ada riwayat masuk yang mengaitkan sebuah wawancara dengan Anda
  • ✓Ekspor ke teks, SRT, VTT, atau JSON untuk alat yang sudah dipakai redaksi

Seberapa cepat, dan di mana kurangnya?

Angka yang kami ukur, dan hal-hal yang ditutup oleh rancangannya

Apa yang kami ukur, dan di mana

Kecepatan bergantung pada mesin komputernya dan pada mesin transkripsi yang Anda pilih, jadi satu pengali tunggal untuk "aplikasi" akan menyesatkan. Ini pengujian kami sendiri, waktu nyata dari mulai sampai teks akhir, di perangkat keras yang kami sebutkan.

Parakeet V3, mesin bawaan

Rekaman rapat 17,5 menit selesai dalam 16,7 detik di M5 Air kami — sekitar 60x waktu nyata

25 bahasa Eropa; pengujian kami sendiri, satu mesin

Jalur Whisper Turbo

Di jalur yang sama Whisper Large V3 Turbo lebih dekat ke 11x waktu nyata, dan itulah harga dari 101 pilihan bahasanya

Pengujian kami sendiri; Turbo adalah jalur cakupan luas, bukan jalur cepat

Perangkat lama dan kecil

iPhone menuntaskan sebuah berkas lebih lambat daripada Mac Apple Silicon, dan jaraknya melebar seiring umur cip. Berkas panjang tetap selesai, hanya butuh waktu proporsional lebih lama

iPhone 12 atau lebih baru, atau Mac Apple Silicon

Penyimpanan

Transkrip sangat kecil, sekitar 0,1MB per jam audio. Yang benar-benar memakan tempat adalah modelnya: Whisper Large V3 Turbo sekitar 1,5GB, dan dua lainnya lebih kecil

Parakeet V3 sudah tertanam di aplikasi iPhone; model lain diunduh di dalam aplikasi

Keterbatasan yang diketahui

Menjalankan model di perangkat menetapkan batas yang keras, dan batas itu lebih mudah diperiksa sebelum membeli daripada sesudah. Justru karena itu jatah gratis di Mac mencakup 5.000 kata per minggu.

Persyaratan perangkat

Memerlukan iPhone 12 atau lebih baru, atau Mac Apple Silicon. Perangkat keras yang lebih tua tidak punya performa Neural Engine yang membuat ini praktis.

Impact: Tidak kompatibel dengan perangkat berumur lebih dari 4-5 tahun

Waktu pemrosesan

Waktu pemrosesan tumbuh mengikuti panjang rekaman. Fisika komputasi di perangkat tidak bisa dihindari.

Impact: Pada laju di atas, berkas empat jam selesai dalam hitungan menit di Mac dan lebih lama di iPhone

Ketergantungan kualitas audio

Audio buruk atau kebisingan latar yang keras menurunkan akurasi, dan model tidak bisa memulihkan informasi yang memang tidak ada dalam sinyal.

Impact: Penempatan mikrofon dan suara yang saling menimpa menggeser tingkat kesalahan lebih besar daripada pilihan model

Tanpa takarir langsung

Aplikasi mentranskripsi rekaman setelah rekaman itu selesai, bukan menampilkan takarir sambil Anda berbicara. Takarir langsung dengan kualitas seperti itu butuh kelas model yang tidak muat di ponsel, dan memproses seluruh berkas juga memberi model lebih banyak konteks.

Impact: Kalau Anda butuh takarir di layar selama acara berlangsung, ini alat yang salah

Satu bahasa per rekaman

Berganti bahasa dengan cepat di dalam satu rekaman menurunkan akurasi. Model bekerja paling baik saat bahasanya konsisten dari awal sampai akhir.

Impact: Hasil terbaik dengan satu bahasa utama per berkas

Kesimpulan

Aplikasi Whisper Notes menjalankan tiga mesin di perangkat Anda — Parakeet V3 sebagai bawaan, ditambah Whisper Large V3 Turbo dan SenseVoice — untuk ucapan ke teks offline di iPhone dan Mac. Audio tetap di perangkat — tanpa upload cloud.
Kekuatan: • Akurasi 6.3-7.8% WER (Open ASR Leaderboard) • Privasi lengkap - hanya pemrosesan offline • $7.99 sekali vs $0.006-0.40/menit layanan cloud • 100+ bahasa dengan istilah teknis • Tanpa langganan atau biaya berkelanjutan
Cocok untuk: • Kesehatan (kepatuhan HIPAA) • Hukum (info klien sensitif) • Bisnis (komunikasi rahasia) • Peneliti dan jurnalis (data wawancara) • Pembuat konten (transkripsi hemat biaya)
Aplikasi Whisper Notes: $7.99 sekali vs layanan cloud per menit atau perangkat lunak perusahaan $500-2000. Untuk profesional yang memerlukan privasi dan transkripsi reguler, ini menawarkan nilai bagus.
Keterbatasan: Persyaratan perangkat, waktu pemrosesan untuk audio sangat panjang. Wajar mengingat pemrosesan AI di perangkat. Akan membaik seiring perangkat menjadi lebih cepat.
Aplikasi Whisper Notes menunjukkan transkripsi AI offline dapat bekerja dengan harga konsumen dengan perlindungan privasi.

Unduh aplikasi Whisper Notes

Ucapan-ke-teks offline untuk iPhone dan Mac. Transkripsi yang fokus privasi.

Aplikasi Whisper Notes di iOS dan macOS • $7.99 sekali • Tanpa langganan