Apple Speech vs Whisper: seberapa bagus SpeechAnalyzer baru?

1 September 2026
·
8 min read
·Whisper Notes Team

Sejak macOS 26 dan iOS 26, Apple telah menghadirkan generasi baru pengenalan ucapan di perangkat — SpeechAnalyzer dan SpeechTranscriber, yang selanjutnya kami singkat sebagai Apple Speech. Sistem ini jauh lebih akurat daripada mesin dikte lama. Jadi kami ingin tahu: apakah pengenalan ucapan bawaan Apple kini cukup bagus sehingga Anda bisa sepenuhnya melewatkan aplikasi transkripsi? Dan seberapa jauh hasilnya dari model terbuka di perangkat dalam Whisper Notes — Whisper, Parakeet, SenseVoice, dan Qwen3-ASR? Kami telah menjalankan pengujian yang ketat. Berikut hasilnya. Pada sepuluh bahasa yang kami uji, Apple Speech tidak pernah mencatat tingkat kesalahan terendah, terpaut tidak lebih dari 1,5 poin dari pemimpin pada bahasa Korea, Jepang, dan Mandarin, serta sama sekali tidak memiliki model untuk bahasa Belanda, Rusia, atau Polandia.

Seberapa jauh Apple Speech dari model yang Anda unduh?

Bahasa Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Inggris 8,80 4,49 5,49 7,04 6,89 8,46
Jerman 6,26 2,85 4,05 8,67 6,26
Belanda 7,36 5,69 16,75 8,58
Rusia 5,65 5,13 11,37 7,12
Polandia 12,59 5,45 15,81 8,30
Jepang 6,36 5,74 5,30 11,37 6,78
Korea 4,31 3,54 4,25 7,30 7,85
Prancis 7,61 4,57 5,97 13,24 5,83
Mandarin 7,97 6,49 7,97 20,50 7,69
Spanyol (Amerika Latin) 5,41 3,38 3,62 6,22 4,86

Sepuluh dari bahasa-bahasa yang paling banyak digunakan, satu mesin per kolom. Setiap sel adalah tingkat kesalahan mesin tersebut, makin rendah makin baik; hijau menandai nilai terendah pada baris, putih nilai terendah kedua. CER untuk bahasa Jepang, Korea, dan Mandarin, WER untuk sisanya; keduanya tidak pernah digabungkan menjadi satu angka. Pengujian FLEURS oleh tim Whisper Notes, satu M5 MacBook Air, tuturan yang dibacakan.

Nama singkat: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Tanda pisah berarti mesin tidak memiliki model untuk bahasa tersebut.

Qwen3-ASR 1.7B telah mencatat tingkat kesalahan terendah pada enam dari sepuluh bahasa, sedangkan Whisper Large V3 Turbo pada empat bahasa lainnya. Apple Speech telah tertinggal 0,77 poin dari pemimpin baris pada bahasa Korea, 1,06 pada bahasa Jepang, dan 1,48 pada bahasa Mandarin, tempat mesin ini setara dengan Whisper Large V3 Turbo di 7,97. Pada tujuh bahasa yang didukungnya, mesin ini telah tertinggal 0,8 hingga 4,3 poin dari pemimpin baris, paling jauh pada bahasa Inggris: 8,80 dibandingkan 4,49. Tidak ada hasil Apple Speech untuk bahasa Belanda, Polandia, dan Rusia.

Bahasa apa saja yang didukung Apple Speech?

Apple Speech telah memberikan hasil untuk 21 dari 83 konfigurasi bahasa dalam pengujian ini. Kedua model Whisper mencakup seluruh 83, Qwen3-ASR 1.7B mencakup 30, dan Parakeet V3 mencakup 25. Dari sepuluh bahasa di atas, mesin ini tidak memiliki model untuk bahasa Belanda, Polandia, atau Rusia. Tidak ada daftar tetap yang dapat dikutip: aset bahasa adalah milik macOS, sehingga aplikasi harus menanyakan saat dijalankan apa yang tersedia pada mesin tertentu.

Bahasa Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Italia 4,39 2,58 2,58 7,64 3,43
Kanton 8,69 6,44 36,75 119,01 37,23
Portugis (Brasil) 9,35 5,17 5,44 8,61 6,49
Hindi 101,50 13,19 29,64 61,26
Telugu 101,63 81,74 103,19
Urdu 101,69 23,39 38,83
Punjabi 101,75 92,05 103,40
Bengali 102,00 83,52 117,37
Nepal 102,13 88,59 118,84
Malayalam 102,18 107,34 167,16
Marathi 102,23 82,69 109,95
Kannada 103,83 72,07 116,10
Gujarati 104,52 75,31 108,91
Tamil 113,01 71,28 79,77

Empat belas bahasa lain yang hasilnya telah diberikan Apple Speech, diurutkan menurut tingkat kesalahannya sendiri. Kolom, warna, dan nama singkat sama seperti di atas; CER untuk bahasa Kanton, WER untuk sisanya. Tingkat kesalahan dapat melewati 100% karena penyisipan juga dihitung dalam pembilang.

Pada sebelas baris terakhir, dari bahasa Hindi hingga Tamil, Apple Speech telah menjawab dengan transliterasi Latin alih-alih aksara asli. Karena itu, tingkat kesalahannya di sana mengukur ketidakcocokan aksara, bukan akurasi pengenalan, dan sel-sel tersebut tidak dimasukkan ke peringkat baris; nilai mesin lain pada baris tersebut adalah pengukuran biasa.

Cara kerja SpeechAnalyzer

Apple telah memiliki API pengenalan ucapan sejak iOS 10. API tersebut, SFSpeechRecognizer, adalah mesin di balik jalur dikte lama. SpeechAnalyzer menggantikannya, diperkenalkan di macOS 26 dan iOS 26, serta tersedia di setiap platform Apple kecuali watchOS.

API ini dibangun di seputar sebuah sesi. Anda membuat SpeechAnalyzer, memberinya satu atau beberapa modul, lalu memasukkan audio; SpeechTranscriber adalah modul yang mengubah ucapan menjadi teks. Audio masuk sebagai urutan asinkron yang Anda isi sendiri, hasil kembali sebagai urutan kedua, dan keduanya biasanya berjalan pada tugas yang berbeda. Penganalisis menerima satu urutan input pada satu waktu. Setiap buffer dan setiap hasil diberi kode waktu terhadap lini masa audio itu sendiri, sehingga hasil dapat ditempatkan kembali di posisi asalnya.

Diagram WWDC25 Apple tentang pemrosesan serentak SpeechAnalyzer: tugas input memasukkan AsyncSequence input ke SpeechAnalyzer dan SpeechTranscriber pada tugas analisis, lalu mengirim AsyncSequence hasil ke tugas hasil dan antarmuka pengguna

Satu sesi, tiga tugas: audio masuk sebagai AsyncSequence, SpeechAnalyzer dan SpeechTranscriber menganalisisnya, lalu hasil kembali sebagai AsyncSequence kedua untuk dibaca antarmuka. Sumber: Apple, sesi 277 WWDC25.

Hasil tiba dua kali. Apa pun di dalam rentang yang disebut Apple sebagai rentang volatil masih dapat diganti oleh hasil yang lebih baik; apa pun di luarnya bersifat final. Dengan cara ini, aplikasi menampilkan transkrip kasar saat Anda masih berbicara lalu memperbaikinya setelah itu.

Apple menyatakan lima sasaran desain untuk model SpeechTranscriber: audio panjang, ucapan percakapan, pembicara yang jauh, latensi rendah, dan privasi, yang berarti model berjalan di perangkat. Catatan, Memo Suara, Jurnal, dan peringkasan panggilan dibangun di atasnya.

Slide WWDC25 Apple yang mencantumkan kemampuan model SpeechTranscriber: audio panjang, ucapan percakapan, pembicara jauh, latensi rendah, privat

Lima sasaran desain yang dinyatakan Apple untuk model SpeechTranscriber. Sumber: Apple, sesi 277 WWDC25.

Model-model tersebut bukan bagian dari aplikasi mana pun. Model diunduh dari server Apple melalui AssetInventory, disimpan dan diperbarui oleh sistem, serta dipakai bersama antar aplikasi. Model tidak menambah ukuran unduhan aplikasi maupun ruang memorinya, dan pendekodean berlangsung di luar proses pemanggil. Jika SpeechTranscriber tidak memiliki model untuk suatu bahasa atau perangkat, DictationTranscriber mengambil alih dengan model yang sama seperti dikte sistem.

Cara kami mengukurnya

Setiap mesin dalam artikel ini telah mentranskripsikan klip yang sama, dalam urutan yang sama, satu per satu, pada M5 MacBook Air (32 GB, macOS 27.0). Audionya berasal dari bagian uji Google FLEURS pada revisi 70bb2e84, sekitar 150 kalimat dan 30 menit per bahasa. Hash tetap dari ID item milik set data menentukan urutannya, dan kami mengambil rangkaian item utuh terpendek yang melampaui tiga puluh menit; keluaran model tidak berperan dalam pilihan itu. Setiap sel telah dibuat ulang dari catatan hasilnya masing-masing dan diperiksa lagi; seluruh 285 sel lulus.

Skornya adalah tingkat kesalahan kata jika kata dipisahkan oleh spasi, dan tingkat kesalahan karakter untuk bahasa Jepang, Korea, Mandarin, dan Kanton. FLEURS adalah tuturan yang dibacakan, bukan rapat maupun dikte. Tabel ini menunjukkan apakah sebuah mesin masuk akal untuk bahasa Anda, bukan hasil yang akan Anda dapatkan pada rekaman Anda sendiri.

Seberapa jauh lebih baik daripada Apple Dictation lama?

Apple menyediakan dua titik operasi transkripsi dan kami telah mengukur keduanya. SpeechTranscriber adalah yang baru, yang disebut artikel ini sebagai Apple Speech. DictationTranscriber adalah opsi kompatibilitas, yakni jalur dikte yang sebelumnya digunakan Mac.

Bahasa Apple Dictation Apple Speech
Korea 7,11 4,31
Italia 6,93 4,39
Spanyol (Amerika Latin) 8,43 5,41
Jerman 12,69 6,26
Jepang 9,37 6,36
Prancis 17,10 7,61
Mandarin 10,28 7,97
Kanton 10,18 8,69
Inggris 13,83 8,80
Portugis (Brasil) 10,85 9,35

Setiap bahasa yang telah diukur dengan baik oleh kedua titik operasi Apple, diurutkan menurut tingkat kesalahan Apple Speech; hijau menandai nilai yang lebih baik pada baris. Pengujian yang sama, klip yang sama, Mac yang sama. CER untuk bahasa Jepang, Korea, Mandarin, dan Kanton, WER untuk sisanya.

Apple Speech lebih akurat pada kesepuluh bahasa. Bahasa median kehilangan sekitar sepertiga kesalahannya, bahasa Prancis dan Jerman lebih dari separuh, serta Portugis Brasil dan Kanton sekitar satu dari tujuh kesalahan.

Itu adalah perbandingan dengan masa lalu Apple sendiri. Dibandingkan model yang Anda unduh, posisi terbaiknya pada bahasa yang diukur dengan baik adalah peringkat kedua, pada bahasa Kanton. Dictation mencakup lebih banyak bahasa: 33 konfigurasi dibandingkan 21 dalam pengujian ini, termasuk ketiga bahasa yang tidak dimiliki mesin baru di sini.

Apa yang Anda dapatkan dari mesin bawaan?

Mesin Kecepatan Memori puncak Unduhan
SenseVoice Small 162,3× realtime 0,95 GiB 827 MB
Parakeet V3 75,6× realtime 0,09 GiB 465 MB
Apple Speech 30,8× realtime tidak dilaporkan paket bahasa diunduh oleh macOS, bukan oleh aplikasi
Qwen3-ASR 1.7B 11,1× realtime 2,43 GiB sekitar 2,5 GB
Whisper Small 7,9× realtime 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× realtime 1,87 GiB sekitar 1,6 GB

Kecepatan adalah median setiap mesin di seluruh tiga belas bahasa yang diukur dengan baik dalam artikel ini, hanya menghitung bahasa yang telah dijalankannya — throughput pemrosesan item terisolasi, sebuah diagnostik, bukan latensi produk. Memori puncak adalah puncak kelompok proses dalam pengujian ini. Apple Speech melakukan pengodean balik di dalam layanan macOS yang tidak dimiliki aplikasi pemanggil, sehingga angka apa pun di sana tidak akan memiliki arti yang sama seperti pada lima mesin lainnya.

Aset bahasa Apple Speech diunduh sekali oleh sistem dan dipakai bersama oleh setiap aplikasi. Tidak ada yang disertakan di dalam aplikasi, dan tidak ada yang dialokasikan dalam proses milik aplikasi. Layanan sistem tetap menggunakan memori saat bekerja, tetapi kami tidak dapat mengaitkannya secara tepat, jadi kami tidak melaporkan angka apa pun, alih-alih menulis nol. Mesin ini telah berjalan pada 30,8× realtime, di belakang Parakeet V3 dan SenseVoice Small.

Whisper Large V3 Turbo memimpin empat dari sepuluh baris dan merupakan mesin paling lambat di sini, sekitar sepuluh kali lebih lambat daripada Apple Speech, dengan sekitar 1,6 GB di disk. Qwen3-ASR 1.7B memimpin enam baris lainnya, dengan sekitar 2,5 GB dan memori 2,43 GiB. Parakeet V3 membutuhkan 465 MB dan 0,09 GiB, mengungguli Turbo pada bahasa Prancis, tertinggal pada bahasa Polandia, serta tidak memiliki bahasa Jepang, Korea, Mandarin, atau Kanton. Whisper Small adalah pembanding terdekat dengan ukuran 600 MB, dan Apple Speech telah lebih akurat pada delapan dari sepuluh bahasa yang diukur dengan baik untuk keduanya.

Haruskah Anda menggunakan Apple Speech alih-alih model unduhan?

Bahasa per bahasa:

  • Inggris: tidak cocok. Apple Speech telah mencatat 8,80; Qwen3-ASR 1.7B (4,49) atau Whisper Large V3 Turbo (5,49) jelas lebih akurat.
  • Jerman: tidak cocok. Apple Speech telah mencatat 6,26; Qwen3-ASR 1.7B (2,85) atau Whisper Large V3 Turbo (4,05) jelas lebih akurat.
  • Belanda, Rusia, dan Polandia: Apple Speech tidak memiliki model untuk ketiganya. Whisper Large V3 Turbo telah menjadi yang paling akurat pada masing-masing bahasa, dengan 5,69, 5,13, dan 5,45.
  • Jepang: dapat digunakan. Apple Speech telah mencatat 6,36, di belakang Whisper Large V3 Turbo pada 5,30.
  • Korea: dapat digunakan. Apple Speech telah mencatat 4,31, di belakang Qwen3-ASR 1.7B pada 3,54.
  • Prancis: tidak cocok. Apple Speech telah mencatat 7,61; Qwen3-ASR 1.7B (4,57) atau Parakeet V3 (5,83) jelas lebih akurat.
  • Mandarin: dapat digunakan. Apple Speech telah mencatat 7,97, setara dengan Whisper Large V3 Turbo; yang paling akurat adalah Qwen3-ASR 1.7B pada 6,49.
  • Spanyol: tidak cocok. Apple Speech telah mencatat 5,41; Qwen3-ASR 1.7B (3,38) atau Whisper Large V3 Turbo (3,62) jelas lebih akurat.

Apple Speech adalah singkatan dalam artikel ini untuk SpeechTranscriber dari Apple, API di perangkat yang dapat dipanggil aplikasi Mac mana pun pada macOS 26 atau lebih baru. Ini bukan salah satu model yang diunduh oleh Whisper Notes untuk Mac: model tersebut adalah Whisper, Parakeet V3, SenseVoice, dan Qwen3-ASR pada versi Unduhan Langsung Mac (DMG), serta Whisper, Parakeet V3, dan SenseVoice pada iPhone dan versi Mac App Store. Tabel per mesin ada di halaman dukungan bahasa.

Tidak ada di sini yang mengubah cara kerja Whisper Notes untuk Mac saat ini: Parakeet V3 tetap menjadi model bawaan.

Pertanyaan yang Sering Diajukan

Apakah Apple Speech seakurat Whisper?

Tidak pada sebagian besar bahasa yang didukung keduanya. Dalam pengujian FLEURS kami sendiri, dari tujuh di antara sepuluh bahasa ini yang didukung Apple Speech, Whisper Large V3 Turbo telah lebih akurat pada enam bahasa dan keduanya sama persis pada bahasa Mandarin, masing-masing CER 7,97%. Dibandingkan Whisper Small, urutannya terbalik: Apple Speech telah unggul pada enam dari tujuh bahasa dan hanya kalah pada bahasa Inggris, WER 8,80% dibandingkan 7,04%. Mesin ini tidak memimpin bahasa mana pun yang diukur dengan baik dalam pengujian ini, dan paling dekat pada bahasa Korea, CER 4,31% dibandingkan 3,54% milik pemimpin baris. Kanton adalah satu-satunya bahasa yang diukur dengan baik tempat mesin ini telah mengalahkan Whisper Large V3 Turbo, CER 8,69% dibandingkan 36,75%. Gunakan mesin bawaan saat bahasa Anda didukung dan Anda lebih suka macOS mengelola paket bahasa; gunakan Whisper Large V3 Turbo untuk hasil paling akurat, atau jika bahasa Anda termasuk salah satu dari tiga bahasa yang tidak dimiliki Apple Speech di sini.

Bahasa apa saja yang didukung Apple Speech?

macOS menentukan daftarnya, bukan aplikasi. Dalam pengujian ini Apple Speech telah memberikan hasil pada 21 dari 83 konfigurasi bahasa yang kami uji, dibandingkan 83 untuk kedua versi Whisper, 30 untuk Qwen3-ASR 1.7B, dan 25 untuk Parakeet V3. Dari sepuluh bahasa yang termasuk di antara bahasa paling banyak digunakan dalam tabel utama, mesin ini mendukung bahasa Inggris, Jerman, Jepang, Korea, Prancis, Mandarin, dan Spanyol, tetapi tidak mendukung bahasa Belanda, Polandia, atau Rusia. Tabel kedua memuat empat belas konfigurasi lainnya: Italia, Kanton, Portugis Brasil, dan sebelas bahasa tempat mesin ini telah menjawab dengan transliterasi Latin alih-alih aksara asli. Aplikasi harus menanyakan kepada macOS saat dijalankan bahasa apa yang tersedia pada mesin tertentu. Jika bahasa Anda tidak ada, Whisper menjangkau setiap bahasa dalam daftar aplikasi pada setiap kanal.

Apple Speech atau Parakeet V3 — mana yang sebaiknya dipilih?

Parakeet V3, pada setiap bahasa Eropa yang didukung keduanya. Model ini telah mencatat 6,89 dibandingkan 8,80 pada bahasa Inggris, 5,83 dibandingkan 7,61 pada bahasa Prancis, 4,86 dibandingkan 5,41 pada bahasa Spanyol, 3,43 dibandingkan 4,39 pada bahasa Italia, dan 6,49 dibandingkan 9,35 pada Portugis Brasil; keduanya setara pada bahasa Jerman di 6,26. Parakeet V3 tidak memiliki bahasa Jepang, Korea, Mandarin, atau Kanton, sehingga pada bahasa-bahasa itu Apple Speech adalah satu-satunya dari keduanya yang tersedia, dengan jarak tidak lebih dari 1,5 poin dari pemimpin baris pada bahasa Jepang, Korea, dan Mandarin. Parakeet V3 adalah unduhan 465 MB dan telah berjalan pada 75,6× realtime dengan puncak 0,09 GiB; paket bahasa Apple Speech diunduh oleh macOS, dan mesin ini telah berjalan pada 30,8× dengan memori yang tidak kami laporkan.

Apa itu SpeechAnalyzer, dan apakah sama dengan Apple Dictation?

SpeechAnalyzer adalah API payung yang diperkenalkan Apple pada WWDC 2025 dan telah disertakan dalam macOS 26 serta iOS 26. SpeechTranscriber adalah titik operasi transkripsi di dalamnya, yang telah kami ukur dan disebut artikel ini sebagai Apple Speech. Dictation adalah titik operasi kompatibilitas dan juga telah kami jalankan: Apple Speech telah lebih akurat pada kesepuluh bahasa yang sama-sama ditangani dengan baik, menghilangkan sekitar sepertiga kesalahan pada bahasa median dan lebih dari separuh pada bahasa Prancis dan Jerman. Dictation mencakup lebih banyak bahasa, 33 konfigurasi dibandingkan 21, sehingga menjadi mesin sistem untuk bahasa Belanda, Polandia, atau Rusia jika Anda dapat menerima WER 17,34%, 13,50%, dan 13,13%. Whisper Large V3 Turbo telah mencatat 5,69%, 5,45%, dan 5,13% pada klip yang sama.

Apakah audio meninggalkan Mac saya saat menggunakan Apple Speech?

Apple mendokumentasikan SpeechTranscriber sebagai pengenalan ucapan di perangkat: macOS mengunduh aset bahasa sekali, lalu pengenalan berjalan secara lokal. Kami telah mengukur akurasi dan kecepatan, bukan perilaku jaringan, jadi kami menjelaskan bagian itu sebagaimana Apple menjelaskannya. Mesin yang diunduh sendiri oleh Whisper Notes — Whisper, Parakeet V3, SenseVoice, dan Qwen3-ASR — berjalan pada GPU atau Neural Engine Mac Anda sendiri tanpa akun dan tanpa API key, serta transkripsi bekerja saat jaringan mati pada setiap kanal.

Mengapa angka ini tidak sama dengan akurasi pada rekaman saya?

Karena FLEURS adalah tuturan pendek, bersih, dan dibacakan, sedangkan rekaman Anda tidak demikian. Pengujian kami adalah kalibrasi pada set data publik: sekitar 150 kalimat dan 30 menit audio per bahasa, satu M5 MacBook Air, klip yang sama untuk setiap mesin. Hasil ini menunjukkan apakah sebuah mesin masuk akal untuk suatu bahasa, bukan apa yang akan Anda dapatkan dalam rapat, pada audio bising, pada tuturan beraksen, atau pada berkas dua jam.

Mengapa pengujian lain menyebut Apple Speech mengungguli Whisper?

Karena pengujian itu membandingkannya dengan Whisper Small, dan hanya pada bahasa Inggris. Untuk Whisper Small, hasil kami sejalan: Apple Speech telah mengungguli mesin itu pada delapan dari sepuluh bahasa yang diukur dengan baik oleh keduanya. Bahasa Inggris adalah satu dari dua bahasa yang kalah, 8,80 dibandingkan 7,04. Hasil itu tidak berlaku untuk Whisper Large V3 Turbo: Apple Speech telah tertinggal pada delapan dari sepuluh bahasa yang sama, seri pada bahasa Mandarin di 7,97, dan hanya unggul pada bahasa Kanton. Whisper mana yang dipakai dalam perbandingan menentukan judulnya.

Coba Sekarang

Kelima model yang dapat diunduh di sini — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small, dan Qwen3-ASR 1.7B — semuanya tersedia di Whisper Notes untuk Mac versi Unduhan Langsung (DMG), pada Pengaturan, lalu Model Transkripsi.

Jika angka kami tidak sesuai dengan pengalaman Anda dalam suatu bahasa, kirim email ke mac@whispernotes.app. Catatan rilis lengkap: whispernotes.app/changelog.

Sumber: pengujian kami pada bagian uji Google FLEURS di revisi 70bb2e84, dokumentasi SpeechAnalyzer dari Apple, dan pengujian Qwen3-ASR tiga puluh bahasa sebelumnya.