Apple Speech बनाम Whisper: SpeechAnalyzer कितना अच्छा है?

1 सितंबर 2026
·
8 min read
·Whisper Notes Team

macOS 26 और iOS 26 से Apple ने डिवाइस पर चलने वाली स्पीच रिकग्निशन की नई पीढ़ी — SpeechAnalyzer और SpeechTranscriber — उपलब्ध कराई है, जिसे आगे संक्षेप में Apple Speech कहा गया है। यह पुराने डिक्टेशन इंजन से काफी अधिक सटीक है। इसलिए हम जानना चाहते थे: क्या Apple की बिल्ट-इन स्पीच रिकग्निशन अब इतनी अच्छी है कि आप ट्रांसक्रिप्शन ऐप को पूरी तरह छोड़ सकें? और यह Whisper Notes में मौजूद डिवाइस पर चलने वाले ओपन मॉडल — Whisper, Parakeet, SenseVoice और Qwen3-ASR — से कितनी पीछे है? हमने एक सख्त परीक्षण किया। ये रहे नतीजे। हमने जिन दस भाषाओं में परीक्षण किया उनमें से किसी में भी Apple Speech की त्रुटि दर सबसे कम नहीं रही; कोरियाई, जापानी और चीनी में यह अग्रणी से 1.5 अंक के भीतर रहा और डच, रूसी तथा पोलिश के लिए इसके पास कोई मॉडल ही नहीं है।

Apple Speech आपके डाउनलोड किए जाने वाले मॉडल से कितनी पीछे है?

भाषा Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
अंग्रेज़ी 8.80 4.49 5.49 7.04 6.89 8.46
जर्मन 6.26 2.85 4.05 8.67 6.26
डच 7.36 5.69 16.75 8.58
रूसी 5.65 5.13 11.37 7.12
पोलिश 12.59 5.45 15.81 8.30
जापानी 6.36 5.74 5.30 11.37 6.78
कोरियाई 4.31 3.54 4.25 7.30 7.85
फ़्रेंच 7.61 4.57 5.97 13.24 5.83
चीनी 7.97 6.49 7.97 20.50 7.69
स्पैनिश (लैटिन अमेरिका) 5.41 3.38 3.62 6.22 4.86

सबसे अधिक इस्तेमाल होने वाली भाषाओं में से दस, हर कॉलम में एक इंजन। हर सेल उस इंजन की त्रुटि दर है; कम बेहतर है। हरा रंग पंक्ति में सबसे कम और सफेद दूसरा सबसे कम मान दिखाता है। जापानी, कोरियाई और चीनी के लिए CER, बाकी के लिए WER; इन्हें कभी एक संख्या में नहीं मिलाया गया। Whisper Notes टीम का अपना FLEURS रन, एक M5 MacBook Air और पढ़कर बोली गई स्पीच।

छोटे नाम: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small। डैश का अर्थ है कि उस इंजन के पास उस भाषा का मॉडल नहीं है।

दस भाषाओं में से छह में Qwen3-ASR 1.7B की त्रुटि दर सबसे कम है और बाकी चार में Whisper Large V3 Turbo की। पंक्ति के अग्रणी से Apple Speech कोरियाई में 0.77 अंक, जापानी में 1.06 अंक और चीनी में 1.48 अंक पीछे है, और चीनी में 7.97 पर यह Whisper Large V3 Turbo के बराबर है। जिन सात भाषाओं का यह समर्थन करता है, उनमें यह अग्रणी से 0.8 से 4.3 अंक पीछे है; सबसे बड़ा अंतर अंग्रेज़ी में है, 4.49 के मुकाबले 8.80। डच, पोलिश और रूसी के लिए Apple Speech का नतीजा नहीं है।

Apple Speech किन भाषाओं का समर्थन करता है?

इस रन में Apple Speech ने 83 भाषा कॉन्फ़िगरेशन में से 21 के नतीजे लौटाए। दोनों Whisper मॉडल सभी 83 को कवर करते हैं, Qwen3-ASR 1.7B 30 को और Parakeet V3 25 को। ऊपर की दस भाषाओं में डच, पोलिश और रूसी के लिए इसका कोई मॉडल नहीं है। उद्धृत करने के लिए कोई स्थिर सूची नहीं है: भाषा एसेट macOS के होते हैं, इसलिए ऐप रनटाइम पर पूछता है कि किसी मशीन पर क्या उपलब्ध है।

भाषा Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
इतालवी 4.39 2.58 2.58 7.64 3.43
कैंटोनीज़ 8.69 6.44 36.75 119.01 37.23
पुर्तगाली (ब्राज़ील) 9.35 5.17 5.44 8.61 6.49
हिंदी 101.50 13.19 29.64 61.26
तेलुगु 101.63 81.74 103.19
उर्दू 101.69 23.39 38.83
पंजाबी 101.75 92.05 103.40
बंगाली 102.00 83.52 117.37
नेपाली 102.13 88.59 118.84
मलयालम 102.18 107.34 167.16
मराठी 102.23 82.69 109.95
कन्नड़ 103.83 72.07 116.10
गुजराती 104.52 75.31 108.91
तमिल 113.01 71.28 79.77

वे अन्य चौदह भाषाएं जिनके लिए Apple Speech ने नतीजा लौटाया, इसकी अपनी त्रुटि दर के क्रम में। कॉलम, रंग और छोटे नाम ऊपर जैसे ही हैं; कैंटोनीज़ के लिए CER और बाकी के लिए WER। त्रुटि दर 100% से अधिक हो सकती है क्योंकि जोड़े गए इंसर्शन भी अंश में गिने जाते हैं।

अंतिम ग्यारह पंक्तियों में, हिंदी से तमिल तक, Apple Speech ने मूल लिपि के बजाय लैटिन लिप्यंतरण में उत्तर दिया। इसलिए वहां इसकी त्रुटि दर पहचान की सटीकता के बजाय लिपि का मेल न होना मापती है और उन सेल को पंक्ति की रैंकिंग से बाहर रखा गया है; उन पंक्तियों में अन्य इंजनों के मान सामान्य माप हैं।

SpeechAnalyzer कैसे काम करता है

Apple के पास iOS 10 से स्पीच रिकग्निशन API है। वह SFSpeechRecognizer है, जो पुराने डिक्टेशन पाथ के पीछे का इंजन है। macOS 26 और iOS 26 में पेश किया गया SpeechAnalyzer इसकी जगह लेता है और watchOS को छोड़कर हर Apple प्लेटफ़ॉर्म पर उपलब्ध है।

यह API एक सेशन के इर्द-गिर्द बना है। आप SpeechAnalyzer बनाते हैं, उसे एक या अधिक मॉड्यूल देते हैं और ऑडियो भेजते हैं; SpeechTranscriber वह मॉड्यूल है जो स्पीच को टेक्स्ट में बदलता है। ऑडियो आपके भरे हुए एसिंक्रोनस सीक्वेंस के रूप में जाता है, नतीजे दूसरे सीक्वेंस में लौटते हैं, और दोनों आम तौर पर अलग-अलग टास्क पर चलते हैं। एनालाइज़र एक समय में एक इनपुट सीक्वेंस लेता है। हर बफ़र और नतीजे को ऑडियो की अपनी टाइमलाइन के अनुसार टाइमकोड मिलता है, इसलिए नतीजे को उसके मूल स्थान पर रखा जा सकता है।

SpeechAnalyzer में समानांतर काम का Apple WWDC25 आरेख: एक इनपुट टास्क इनपुट AsyncSequence को विश्लेषण टास्क पर SpeechAnalyzer और SpeechTranscriber में भेजता है, जो नतीजों का AsyncSequence रिज़ल्ट टास्क और यूज़र इंटरफ़ेस को देते हैं

एक सेशन, तीन टास्क: ऑडियो AsyncSequence के रूप में जाता है, SpeechAnalyzer और SpeechTranscriber उसका विश्लेषण करते हैं, और इंटरफ़ेस के पढ़ने के लिए नतीजे दूसरे AsyncSequence में लौटते हैं। स्रोत: Apple, WWDC25 सेशन 277

नतीजे दो बार आते हैं। Apple जिसे volatile range कहता है उसके भीतर की कोई भी चीज़ अभी बेहतर नतीजे से बदली जा सकती है; उसके बाहर की हर चीज़ अंतिम है। इस तरह ऐप आपके बोलते समय एक शुरुआती ट्रांसक्रिप्ट दिखाता है और बाद में उसे सुधारता है।

Apple ने SpeechTranscriber मॉडल के पांच डिज़ाइन लक्ष्य बताए हैं: लंबा ऑडियो, बातचीत की स्पीच, दूर के वक्ता, कम विलंब और गोपनीयता, यानी यह डिवाइस पर चलता है। Notes, Voice Memos, Journal और कॉल सारांश इसी पर बने हैं।

SpeechTranscriber मॉडल की क्षमताएं दिखाती Apple WWDC25 स्लाइड: लंबा ऑडियो, बातचीत की स्पीच, दूर के वक्ता, कम विलंब और गोपनीयता

SpeechTranscriber मॉडल के लिए Apple के बताए पांच डिज़ाइन लक्ष्य। स्रोत: Apple, WWDC25 सेशन 277

ये मॉडल किसी भी ऐप का हिस्सा नहीं हैं। इन्हें AssetInventory के ज़रिए Apple के सर्वर से डाउनलोड किया जाता है, सिस्टम इन्हें स्टोर और अपडेट करता है, और ये ऐप के बीच साझा होते हैं। ये ऐप के डाउनलोड साइज़ या उसकी मेमोरी स्पेस में कुछ नहीं जोड़ते और डिकोडिंग कॉल करने वाली प्रोसेस के बाहर होती है। जहां किसी भाषा या डिवाइस के लिए SpeechTranscriber का मॉडल नहीं है, वहां DictationTranscriber सिस्टम डिक्टेशन वाले मॉडल के साथ काम संभालता है।

हमने इसे कैसे मापा

इस पोस्ट के हर इंजन ने एक M5 MacBook Air (32 GB, macOS 27.0) पर उन्हीं क्लिप को उसी क्रम में, एक बार में एक क्लिप ट्रांसक्राइब किया। ऑडियो Google FLEURS का रिविज़न 70bb2e84 वाला टेस्ट स्प्लिट है, जिसमें हर भाषा में लगभग 150 वाक्य और 30 मिनट का ऑडियो है। डेटासेट की अपनी आइटम आईडी का स्थिर हैश आइटम को क्रम में रखता है और हम पूरे आइटम का वह सबसे छोटा रन लेते हैं जो तीस मिनट पार करता है; इस चयन में किसी मॉडल आउटपुट की कोई भूमिका नहीं थी। हर सेल को उसकी अपनी रसीद से दोबारा बनाया और जांचा गया, और सभी 285 पास हुए।

जहां शब्द स्पेस से अलग होते हैं वहां स्कोर शब्द त्रुटि दर है, और जापानी, कोरियाई, चीनी तथा कैंटोनीज़ के लिए अक्षर त्रुटि दर है। FLEURS पढ़कर बोली गई स्पीच है, मीटिंग या डिक्टेशन नहीं। ये टेबल बताती हैं कि कोई इंजन आपकी भाषा के लिए संभावित विकल्प है या नहीं, आपकी अपनी रिकॉर्डिंग पर आपको क्या मिलेगा यह नहीं।

यह पुराने Apple Dictation से कितना बेहतर है?

Apple ट्रांसक्रिप्शन के दो ऑपरेटिंग पॉइंट देता है और हमने दोनों को मापा। SpeechTranscriber नया वाला है, जिसे इस पोस्ट में Apple Speech कहा गया है। DictationTranscriber कम्पैटिबिलिटी वाला ऑपरेटिंग पॉइंट है, यानी Mac का पिछला डिक्टेशन पाथ।

भाषा Apple Dictation Apple Speech
कोरियाई 7.11 4.31
इतालवी 6.93 4.39
स्पैनिश (लैटिन अमेरिका) 8.43 5.41
जर्मन 12.69 6.26
जापानी 9.37 6.36
फ़्रेंच 17.10 7.61
चीनी 10.28 7.97
कैंटोनीज़ 10.18 8.69
अंग्रेज़ी 13.83 8.80
पुर्तगाली (ब्राज़ील) 10.85 9.35

वे सभी भाषाएं जिन्हें दोनों Apple ऑपरेटिंग पॉइंट ने साफ़ तौर पर मापा, Apple Speech की त्रुटि दर के क्रम में; हरा रंग पंक्ति का बेहतर मान दिखाता है। वही रन, वही क्लिप और वही Mac। जापानी, कोरियाई, चीनी और कैंटोनीज़ के लिए CER, बाकी के लिए WER।

Apple Speech सभी दस में अधिक सटीक है। मध्य वाली भाषा में लगभग एक-तिहाई त्रुटियां कम होती हैं, फ़्रेंच और जर्मन में आधे से अधिक, और ब्राज़ीली पुर्तगाली तथा कैंटोनीज़ में लगभग हर सात में से एक त्रुटि कम होती है।

यह Apple के अपने पुराने इंजन से तुलना है। आपके डाउनलोड किए जाने वाले मॉडल के मुकाबले साफ़ तौर पर मापी गई भाषा में इसका सर्वश्रेष्ठ स्थान कैंटोनीज़ में दूसरा है। Dictation अधिक भाषाएं कवर करता है: इस रन में 21 के मुकाबले 33 कॉन्फ़िगरेशन, जिनमें वे तीनों भी शामिल हैं जो नए इंजन में यहां नहीं हैं।

बिल्ट-इन इंजन से आपको क्या मिलता है?

इंजन गति पीक मेमोरी डाउनलोड
SenseVoice Small 162.3× रियल-टाइम 0.95 GiB 827 MB
Parakeet V3 75.6× रियल-टाइम 0.09 GiB 465 MB
Apple Speech 30.8× रियल-टाइम रिपोर्ट नहीं किया गया भाषा पैक macOS डाउनलोड करता है, ऐप नहीं
Qwen3-ASR 1.7B 11.1× रियल-टाइम 2.43 GiB लगभग 2.5 GB
Whisper Small 7.9× रियल-टाइम 0.87 GiB 600 MB
Whisper Large V3 Turbo 3.0× रियल-टाइम 1.87 GiB लगभग 1.6 GB

गति उन तेरह भाषाओं में हर इंजन की माध्यिका है जिन्हें यह पोस्ट साफ़ तौर पर मापती है, और केवल वही भाषाएं गिनी गई हैं जिन पर वह चला — यह अलग-अलग आइटम की प्रोसेसिंग थ्रूपुट है, एक डायग्नोस्टिक, उत्पाद की लेटेंसी नहीं। पीक मेमोरी इस रन में प्रोसेस-ग्रुप का अधिकतम मान है। Apple Speech ऐसी macOS सेवा के भीतर डिकोड करता है जिसकी मालिक कॉल करने वाली ऐप नहीं है, इसलिए वहां कोई भी आंकड़ा बाकी पांच के समान अर्थ नहीं रखेगा।

Apple Speech के भाषा एसेट सिस्टम एक बार डाउनलोड करता है और हर ऐप उन्हें साझा करती है। ऐप के भीतर कुछ नहीं आता और ऐप की अपनी प्रोसेस में कुछ आवंटित नहीं होता। सिस्टम सेवा काम करते समय फिर भी मेमोरी इस्तेमाल करती है और हम उसे ठीक-ठीक निर्धारित नहीं कर सकते, इसलिए शून्य लिखने के बजाय वहां कोई संख्या रिपोर्ट नहीं करते। यह 30.8× रियल-टाइम पर चला, Parakeet V3 और SenseVoice Small से पीछे।

Whisper Large V3 Turbo दस में से चार पंक्तियों में आगे है और यहां सबसे धीमा इंजन है, डिस्क पर लगभग 1.6 GB लेते हुए Apple Speech से करीब दस गुना धीमा। Qwen3-ASR 1.7B बाकी छह में आगे है और लगभग 2.5 GB तथा 2.43 GiB मेमोरी लेता है। Parakeet V3 का आकार 465 MB और पीक 0.09 GiB है; यह फ़्रेंच में Turbo से आगे, पोलिश में पीछे है और इसके पास जापानी, कोरियाई, चीनी या कैंटोनीज़ नहीं है। 600 MB वाला Whisper Small सबसे करीबी तुलना है, और दोनों के लिए साफ़ तौर पर मापी गई दस में से आठ भाषाओं में Apple Speech अधिक सटीक था।

क्या आपको डाउनलोड किए गए मॉडल के बजाय Apple Speech इस्तेमाल करना चाहिए?

भाषा के अनुसार:

  • अंग्रेज़ी: अच्छा विकल्प नहीं। Apple Speech का स्कोर 8.80 था; Qwen3-ASR 1.7B (4.49) या Whisper Large V3 Turbo (5.49) स्पष्ट रूप से अधिक सटीक है।
  • जर्मन: अच्छा विकल्प नहीं। Apple Speech का स्कोर 6.26 था; Qwen3-ASR 1.7B (2.85) या Whisper Large V3 Turbo (4.05) स्पष्ट रूप से अधिक सटीक है।
  • डच, रूसी और पोलिश: इन तीनों के लिए Apple Speech का कोई मॉडल नहीं है। Whisper Large V3 Turbo इनमें से हर भाषा में क्रमशः 5.69, 5.13 और 5.45 के साथ सबसे सटीक था।
  • जापानी: उपयोग योग्य। Apple Speech का स्कोर 6.36 था और यह Whisper Large V3 Turbo के 5.30 से पीछे है।
  • कोरियाई: उपयोग योग्य। Apple Speech का स्कोर 4.31 था और यह Qwen3-ASR 1.7B के 3.54 से पीछे है।
  • फ़्रेंच: अच्छा विकल्प नहीं। Apple Speech का स्कोर 7.61 था; Qwen3-ASR 1.7B (4.57) या Parakeet V3 (5.83) स्पष्ट रूप से अधिक सटीक है।
  • चीनी: उपयोग योग्य। Apple Speech का स्कोर 7.97 था, जो Whisper Large V3 Turbo के बराबर है; सबसे सटीक Qwen3-ASR 1.7B था, जिसका स्कोर 6.49 था।
  • स्पैनिश: अच्छा विकल्प नहीं। Apple Speech का स्कोर 5.41 था; Qwen3-ASR 1.7B (3.38) या Whisper Large V3 Turbo (3.62) स्पष्ट रूप से अधिक सटीक है।

Apple Speech इस पोस्ट में Apple के बनाए SpeechTranscriber का छोटा नाम है, जो डिवाइस पर चलने वाला API है और जिसे कोई भी Mac ऐप macOS 26 या बाद के संस्करण में कॉल कर सकती है। यह उन मॉडलों में से नहीं है जिन्हें Mac के लिए Whisper Notes डाउनलोड करता है: Mac Direct Download (DMG) बिल्ड पर वे Whisper, Parakeet V3, SenseVoice और Qwen3-ASR हैं, और iPhone तथा Mac App Store बिल्ड पर Whisper, Parakeet V3 और SenseVoice हैं। हर इंजन की टेबल हमारे भाषा समर्थन पेज पर है।

यहां कुछ भी Mac के लिए Whisper Notes के आज के व्यवहार को नहीं बदलता: Parakeet V3 अब भी डिफ़ॉल्ट है

अक्सर पूछे जाने वाले सवाल

क्या Apple Speech, Whisper जितना सटीक है?

दोनों जिन अधिकांश भाषाओं को कवर करते हैं, उनमें नहीं। हमारे अपने FLEURS रन में इन दस में Apple Speech द्वारा समर्थित सात भाषाओं में Whisper Large V3 Turbo छह में अधिक सटीक था और चीनी में दोनों ठीक बराबर, 7.97% CER थे। Whisper Small के मुकाबले क्रम उलट जाता है: Apple Speech सात में से छह में आगे था और केवल अंग्रेज़ी में 7.04% के मुकाबले 8.80% WER से पीछे रहा। इस रन में साफ़ तौर पर मापी गई किसी भाषा में यह अग्रणी नहीं है; कोरियाई में यह सबसे करीब है, पंक्ति के अग्रणी के 3.54% के मुकाबले 4.31% CER। कैंटोनीज़ वह एक साफ़ तौर पर मापी गई भाषा है जहां इसने Whisper Large V3 Turbo को हराया, 36.75% के मुकाबले 8.69% CER। जब आपकी भाषा समर्थित हो और आप भाषा पैक का प्रबंधन macOS पर छोड़ना चाहें तब बिल्ट-इन इंजन इस्तेमाल करें; सबसे सटीक नतीजे के लिए या यहां Apple Speech में न मिलने वाली तीन भाषाओं में से एक के लिए Whisper Large V3 Turbo इस्तेमाल करें।

Apple Speech किन भाषाओं का समर्थन करता है?

सूची macOS तय करता है, कोई ऐप नहीं। इस रन में Apple Speech ने हमारे जांचे गए 83 भाषा कॉन्फ़िगरेशन में से 21 में नतीजे दिए; दोनों Whisper बिल्ड ने 83, Qwen3-ASR 1.7B ने 30 और Parakeet V3 ने 25 में। मुख्य टेबल की दस अधिक इस्तेमाल होने वाली भाषाओं में इसके पास अंग्रेज़ी, जर्मन, जापानी, कोरियाई, फ़्रेंच, चीनी और स्पैनिश हैं, लेकिन डच, पोलिश या रूसी नहीं। दूसरी टेबल में बाकी चौदह कॉन्फ़िगरेशन हैं: इतालवी, कैंटोनीज़, ब्राज़ीली पुर्तगाली और ग्यारह भाषाएं जिनमें इसने मूल लिपि के बजाय लैटिन लिप्यंतरण में जवाब दिया। ऐप को रनटाइम पर macOS से पूछना पड़ता है कि किसी मशीन पर कौन सी भाषाएं हैं। अगर आपकी भाषा नहीं है, तो Whisper हर चैनल पर ऐप की सूची की हर भाषा तक पहुंचता है।

Apple Speech या Parakeet V3 — कौन सा?

दोनों द्वारा कवर की गई हर यूरोपीय भाषा में Parakeet V3। अंग्रेज़ी में इसने 8.80 के मुकाबले 6.89, फ़्रेंच में 7.61 के मुकाबले 5.83, स्पैनिश में 5.41 के मुकाबले 4.86, इतालवी में 4.39 के मुकाबले 3.43 और ब्राज़ीली पुर्तगाली में 9.35 के मुकाबले 6.49 स्कोर किया; जर्मन में दोनों 6.26 पर बराबर हैं। Parakeet V3 के पास जापानी, कोरियाई, चीनी या कैंटोनीज़ नहीं है, इसलिए वहां दोनों में केवल Apple Speech मौजूद है, जो जापानी, कोरियाई और चीनी में पंक्ति के अग्रणी से 1.5 अंक के भीतर है। Parakeet V3 का डाउनलोड 465 MB है और यह 0.09 GiB पीक के साथ 75.6× रियल-टाइम पर चला; Apple Speech का भाषा पैक macOS डाउनलोड करता है और यह ऐसी मेमोरी के साथ 30.8× पर चला जिसे हम रिपोर्ट नहीं करते।

SpeechAnalyzer क्या है, और क्या यह Apple Dictation जैसा ही है?

SpeechAnalyzer वह व्यापक API है जिसे Apple ने WWDC 2025 में पेश किया और macOS 26 तथा iOS 26 में उपलब्ध कराया। SpeechTranscriber इसके भीतर ट्रांसक्रिप्शन ऑपरेटिंग पॉइंट है; हमने उसी को मापा और यह पोस्ट उसे Apple Speech कहती है। Dictation कम्पैटिबिलिटी ऑपरेटिंग पॉइंट है और हमने उसे भी चलाया: दोनों द्वारा साफ़ तौर पर संभाली गई सभी दस भाषाओं में Apple Speech अधिक सटीक था, जिससे मध्य वाली भाषा में लगभग एक-तिहाई और फ़्रेंच तथा जर्मन में आधे से अधिक त्रुटियां हटीं। Dictation अधिक भाषाएं कवर करता है, 21 के मुकाबले 33 कॉन्फ़िगरेशन, इसलिए अगर आप 17.34%, 13.50% और 13.13% WER स्वीकार कर सकते हैं तो डच, पोलिश या रूसी के लिए वही सिस्टम इंजन है। उन्हीं क्लिप पर Whisper Large V3 Turbo ने 5.69%, 5.45% और 5.13% स्कोर किया।

Apple Speech इस्तेमाल करने पर क्या ऑडियो मेरे Mac से बाहर जाता है?

Apple के दस्तावेज़ SpeechTranscriber को डिवाइस पर चलने वाली स्पीच रिकग्निशन बताते हैं: macOS भाषा एसेट एक बार डाउनलोड करता है और पहचान स्थानीय रूप से चलती है। हमने सटीकता और गति मापी, नेटवर्क का व्यवहार नहीं, इसलिए उस हिस्से का वर्णन Apple के अनुसार ही करते हैं। Whisper Notes द्वारा खुद डाउनलोड किए जाने वाले इंजन — Whisper, Parakeet V3, SenseVoice और Qwen3-ASR — आपके अपने Mac के GPU या Neural Engine पर बिना अकाउंट और बिना API key के चलते हैं, और हर चैनल पर नेटवर्क बंद होने पर भी ट्रांसक्रिप्शन काम करता है।

ये आंकड़े मेरी रिकॉर्डिंग की सटीकता से मेल क्यों नहीं खाते?

क्योंकि FLEURS छोटा, साफ़ और पढ़कर बोला गया ऑडियो है, जबकि आपकी रिकॉर्डिंग ऐसी नहीं हैं। हमारा रन एक सार्वजनिक डेटासेट पर कैलिब्रेशन है: हर भाषा में लगभग 150 वाक्य और 30 मिनट का ऑडियो, एक M5 MacBook Air और हर इंजन के लिए वही क्लिप। यह बताता है कि कोई इंजन किसी भाषा के लिए संभावित विकल्प है या नहीं, न कि मीटिंग, शोर वाले ऑडियो, अलग उच्चारण या दो घंटे की फ़ाइल पर आपको क्या मिलेगा।

दूसरे बेंचमार्क यह क्यों कहते हैं कि Apple Speech, Whisper से बेहतर है?

क्योंकि वे तुलना Whisper Small से करते हैं और केवल अंग्रेज़ी में। Whisper Small के मामले में हमारा नतीजा भी वही है: दोनों के लिए साफ़ तौर पर मापी गई दस भाषाओं में से आठ में Apple Speech आगे रहा। जिन दो भाषाओं में यह हारा उनमें से एक अंग्रेज़ी है, 7.04 के मुकाबले 8.80। यह नतीजा Whisper Large V3 Turbo पर लागू नहीं होता: उन्हीं दस भाषाओं में से आठ में Apple Speech पीछे रहा, चीनी में 7.97 पर बराबरी रही और यह केवल कैंटोनीज़ में आगे रहा। तुलना में कौन सा Whisper है, यही तय करता है कि सुर्खी क्या बनेगी।

इसे आज़माएं

यहां के पांच डाउनलोड किए जा सकने वाले मॉडल — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small और Qwen3-ASR 1.7B — सभी Mac के लिए Whisper Notes के Direct Download (DMG) बिल्ड में सेटिंग्स, फिर ट्रांसक्रिप्शन मॉडल के अंतर्गत हैं।

अगर हमारे आंकड़े किसी भाषा में आपके अनुभव से मेल नहीं खाते, तो ईमेल करें mac@whispernotes.app। पूरे रिलीज़ नोट्स: whispernotes.app/changelog

स्रोत: Google FLEURS के रिविज़न 70bb2e84 वाले टेस्ट स्प्लिट पर हमारा रन, Apple का SpeechAnalyzer दस्तावेज़ और उससे पहले का तीस भाषाओं वाला Qwen3-ASR रन