Apple Speech مقابل Whisper: ما مدى جودة SpeechAnalyzer؟

١ سبتمبر ٢٠٢٦
·
8 min read
·Whisper Notes Team

منذ macOS 26 وiOS 26، توفر Apple جيلاً جديداً من التعرف على الكلام على الجهاز — SpeechAnalyzer وSpeechTranscriber، وسنسميه اختصاراً Apple Speech أدناه. وهو أدق بوضوح من محرك الإملاء القديم. لذلك أردنا أن نعرف: هل أصبح التعرف على الكلام المدمج من Apple جيداً بما يكفي للاستغناء تماماً عن تطبيق للتفريغ؟ وكم يفصله عن النماذج المفتوحة التي تعمل على الجهاز في Whisper Notes — وهي Whisper وParakeet وSenseVoice وQwen3-ASR؟ أجرينا اختباراً صارماً. وهذه هي النتائج. وفي اللغات العشر التي اختبرناها لم يسجل Apple Speech أدنى معدل خطأ في أي منها، وجاء ضمن 1.5 نقطة من المتصدر في الكورية واليابانية والصينية، ولا يملك نموذجاً على الإطلاق للهولندية والروسية والبولندية.

ما مدى ابتعاد Apple Speech عن النماذج التي تنزّلها؟

اللغة Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
الإنجليزية 8.80 4.49 5.49 7.04 6.89 8.46
الألمانية 6.26 2.85 4.05 8.67 6.26
الهولندية 7.36 5.69 16.75 8.58
الروسية 5.65 5.13 11.37 7.12
البولندية 12.59 5.45 15.81 8.30
اليابانية 6.36 5.74 5.30 11.37 6.78
الكورية 4.31 3.54 4.25 7.30 7.85
الفرنسية 7.61 4.57 5.97 13.24 5.83
الصينية 7.97 6.49 7.97 20.50 7.69
الإسبانية (أمريكا اللاتينية) 5.41 3.38 3.62 6.22 4.86

عشر من أكثر اللغات استخداماً، ومحرك واحد في كل عمود. تعرض كل خلية معدل خطأ ذلك المحرك، والأقل أفضل؛ ويشير الأخضر إلى أدنى قيمة في الصف، والأبيض إلى ثاني أدنى قيمة. استخدمنا CER لليابانية والكورية والصينية، وWER للبقية، ولم ندمجهما قط في رقم واحد. جولة FLEURS الخاصة بنا، أجراها فريق Whisper Notes، على جهاز M5 MacBook Air واحد، وكلام مقروء.

الأسماء المختصرة: Qwen3-ASR = Qwen3-ASR 1.7B، وWhisper Large = Whisper Large V3 Turbo، وParakeet = Parakeet V3، وSenseVoice = SenseVoice Small. وتعني الشرطة أن المحرك لا يملك نموذجاً لتلك اللغة.

حقق Qwen3-ASR 1.7B أدنى معدل خطأ في ست من اللغات العشر، وحقق Whisper Large V3 Turbo ذلك في اللغات الأربع الأخرى. يتأخر Apple Speech عن متصدر الصف بمقدار 0.77 نقطة في الكورية، و1.06 في اليابانية، و1.48 في الصينية، حيث يتساوى مع Whisper Large V3 Turbo عند 7.97. وفي اللغات السبع التي يدعمها يتأخر عن متصدر الصف بمقدار 0.8 إلى 4.3 نقطة؛ وأكبر فارق في الإنجليزية، إذ سجل 8.80 مقابل 4.49. لا توجد نتيجة لـ Apple Speech في الهولندية أو البولندية أو الروسية.

ما اللغات التي يدعمها Apple Speech؟

أعاد Apple Speech نتائج لـ 21 من إعدادات اللغات البالغ عددها 83 في هذه الجولة. يغطي نموذجا Whisper جميع الإعدادات الـ83، ويغطي Qwen3-ASR 1.7B منها 30، وParakeet V3 منها 25. ومن اللغات العشر أعلاه لا يملك نموذجاً للهولندية أو البولندية أو الروسية. لا توجد قائمة ثابتة يمكن اقتباسها: أصول اللغات تخص macOS، لذا يسأل التطبيق وقت التشغيل عما يتوفر على جهاز بعينه.

اللغة Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
الإيطالية 4.39 2.58 2.58 7.64 3.43
الكانتونية 8.69 6.44 36.75 119.01 37.23
البرتغالية (البرازيل) 9.35 5.17 5.44 8.61 6.49
الهندية 101.50 13.19 29.64 61.26
التيلوغوية 101.63 81.74 103.19
الأردية 101.69 23.39 38.83
البنجابية 101.75 92.05 103.40
البنغالية 102.00 83.52 117.37
النيبالية 102.13 88.59 118.84
الماليالامية 102.18 107.34 167.16
الماراثية 102.23 82.69 109.95
الكنادية 103.83 72.07 116.10
الغوجاراتية 104.52 75.31 108.91
التاميلية 113.01 71.28 79.77

اللغات الأربع عشرة الأخرى التي أعاد Apple Speech نتيجة لها، مرتبة حسب معدل خطئه. الأعمدة والألوان والأسماء المختصرة هي نفسها أعلاه؛ CER للكانتونية وWER للبقية. قد يتجاوز معدل الخطأ 100% لأن الإضافات تُحسب في البسط أيضاً.

في الصفوف الأحد عشر الأخيرة، من الهندية حتى التاميلية، أجاب Apple Speech بنقل صوتي لاتيني بدلاً من الخط الأصلي؛ لذلك يقيس معدل خطئه هناك عدم تطابق الخط لا دقة التعرف، واستُبعدت تلك الخلايا من ترتيب الصف. أما قيم المحركات الأخرى في تلك الصفوف فهي قياسات عادية.

كيف يعمل SpeechAnalyzer

لدى Apple واجهة API للتعرف على الكلام منذ iOS 10. وتلك الواجهة، SFSpeechRecognizer، هي المحرك وراء مسار الإملاء القديم. يحل SpeechAnalyzer محلها؛ وقد قُدم في macOS 26 وiOS 26 ويتوفر على كل منصات Apple عدا watchOS.

تتمحور واجهة API حول جلسة. تنشئ SpeechAnalyzer، وتزوده بوحدة واحدة أو أكثر، ثم تمرر إليه الصوت؛ وSpeechTranscriber هو الوحدة التي تحول الكلام إلى نص. يدخل الصوت كتسلسل غير متزامن تملؤه بنفسك، وتعود النتائج في تسلسل ثانٍ، ويعمل الاثنان عادةً في مهمتين مختلفتين. يقبل المحلل تسلسلاً واحداً للإدخال في كل مرة. يحمل كل مخزن مؤقت وكل نتيجة رمزاً زمنياً مرتبطاً بالخط الزمني للصوت نفسه، ولذلك يمكن وضع النتيجة في موضعها الأصلي.

رسم Apple في WWDC25 لتزامن SpeechAnalyzer: تمرر مهمة إدخال AsyncSequence للإدخال إلى SpeechAnalyzer وSpeechTranscriber في مهمة تحليل، ثم يرسلان AsyncSequence للنتائج إلى مهمة النتائج وواجهة المستخدم

جلسة واحدة وثلاث مهام: يدخل الصوت في AsyncSequence، ويحلله SpeechAnalyzer وSpeechTranscriber، ثم تعود النتائج في AsyncSequence ثانٍ لتقرأه الواجهة. المصدر: Apple، الجلسة 277 في WWDC25.

تصل النتائج مرتين. يمكن استبدال أي شيء داخل ما تسميه Apple النطاق المتغير بنتيجة أفضل؛ أما ما يقع خارجه فهو نهائي. وبهذا يعرض التطبيق نصاً أولياً أثناء حديثك ثم يصححه بعد ذلك.

تذكر Apple خمسة أهداف لتصميم نموذج SpeechTranscriber: الصوت الطويل، والكلام الحواري، والمتحدثون البعيدون، وزمن الاستجابة المنخفض، والخصوصية، أي إنه يعمل على الجهاز. وتعتمد عليه الملاحظات والمذكرات الصوتية واليوميات وتلخيص المكالمات.

شريحة Apple في WWDC25 تعرض قدرات نموذج SpeechTranscriber: الصوت الطويل، والكلام الحواري، والمتحدثون البعيدون، وزمن الاستجابة المنخفض، والخصوصية

أهداف التصميم الخمسة التي تذكرها Apple لنموذج SpeechTranscriber. المصدر: Apple، الجلسة 277 في WWDC25.

النماذج ليست جزءاً من أي تطبيق. ينزلها النظام من خوادم Apple عبر AssetInventory، ويخزنها ويحدثها، وتتشاركها التطبيقات. لا تضيف شيئاً إلى حجم تنزيل التطبيق أو مساحة ذاكرته، وتجري عملية فك الترميز خارج العملية المستدعية. وحين لا يتوفر نموذج SpeechTranscriber للغة أو جهاز، يتولى DictationTranscriber المهمة مستخدماً النماذج نفسها التي يستخدمها إملاء النظام.

كيف أجرينا القياس

فرّغ كل محرك في هذا المقال المقاطع نفسها وبالترتيب نفسه، مقطعاً واحداً كل مرة، على جهاز M5 MacBook Air (32 GB، macOS 27.0). الصوت هو قسم الاختبار من Google FLEURS عند المراجعة 70bb2e84، بنحو 150 جملة و30 دقيقة لكل لغة. يرتب تجزؤ ثابت لمعرّفات العناصر الخاصة بمجموعة البيانات العناصر، ونأخذ أقصر جولة من العناصر الكاملة تتجاوز ثلاثين دقيقة؛ ولم يكن لأي مخرج من النماذج دور في هذا الاختيار. أُعيد بناء كل خلية من سجلها الخاص وفُحصت مجدداً، واجتازت الخلايا الـ285 كلها.

الدرجات هي معدل خطأ الكلمات حين تفصل المسافات بين الكلمات، ومعدل خطأ المحارف لليابانية والكورية والصينية والكانتونية. FLEURS كلام مقروء، لا اجتماع ولا إملاء. تبين هذه الجداول ما إذا كان المحرك خياراً معقولاً للغتك، لا ما ستحصل عليه في تسجيلاتك الخاصة.

ما مقدار تفوقه على Apple Dictation القديم؟

توفر Apple نقطتي تشغيل للتفريغ وقد قسناهما كلتيهما. SpeechTranscriber هو الجديد، وهو ما يسميه هذا المقال Apple Speech. DictationTranscriber هو نقطة التوافق، أي مسار الإملاء الذي كان لدى Mac قبله.

اللغة Apple Dictation Apple Speech
الكورية 7.11 4.31
الإيطالية 6.93 4.39
الإسبانية (أمريكا اللاتينية) 8.43 5.41
الألمانية 12.69 6.26
اليابانية 9.37 6.36
الفرنسية 17.10 7.61
الصينية 10.28 7.97
الكانتونية 10.18 8.69
الإنجليزية 13.83 8.80
البرتغالية (البرازيل) 10.85 9.35

كل لغة قاستها نقطتا التشغيل من Apple قياساً سليماً، مرتبة حسب معدل خطأ Apple Speech؛ يشير الأخضر إلى القيمة الأفضل في الصف. الجولة نفسها والمقاطع نفسها وجهاز Mac نفسه. CER لليابانية والكورية والصينية والكانتونية، وWER للبقية.

Apple Speech أدق في اللغات العشر كلها. تفقد اللغة الوسيطة نحو ثلث أخطائها، وتفقد الفرنسية والألمانية أكثر من النصف، وتفقد البرتغالية البرازيلية والكانتونية نحو خطأ واحد من كل سبعة.

هذه مقارنة مع ماضي Apple نفسه. وأمام النماذج التي تنزلها، فإن أفضل ترتيب له في لغة مقاسة قياساً سليماً هو المركز الثاني في الكانتونية. يغطي Dictation لغات أكثر: 33 إعداداً مقابل 21 في هذه الجولة، بما فيها اللغات الثلاث التي يفتقدها المحرك الجديد هنا.

ما الذي يمنحك إياه المحرك المدمج؟

المحرك السرعة ذروة الذاكرة التنزيل
SenseVoice Small 162.3× من الزمن الحقيقي 0.95 GiB 827 MB
Parakeet V3 75.6× من الزمن الحقيقي 0.09 GiB 465 MB
Apple Speech 30.8× من الزمن الحقيقي غير مبلّغ عنها ينزّل macOS حزمة اللغة، لا التطبيق
Qwen3-ASR 1.7B 11.1× من الزمن الحقيقي 2.43 GiB نحو 2.5 GB
Whisper Small 7.9× من الزمن الحقيقي 0.87 GiB 600 MB
Whisper Large V3 Turbo 3.0× من الزمن الحقيقي 1.87 GiB نحو 1.6 GB

السرعة هي وسيط كل محرك عبر اللغات الثلاث عشرة التي يقيسها هذا المقال قياساً سليماً، مع احتساب ما شغله فقط — وهي إنتاجية معالجة عناصر منفصلة، أي تشخيص وليست زمن استجابة المنتج. ذروة الذاكرة هي ذروة مجموعة العمليات في هذه الجولة. يفك Apple Speech الترميز داخل خدمة macOS لا يملكها التطبيق المستدعي، ولذلك لن يحمل أي رقم هناك المعنى نفسه الذي تحمله أرقام المحركات الخمسة الأخرى.

ينزّل النظام أصول لغات Apple Speech مرة واحدة وتتشاركها كل التطبيقات. لا يأتي شيء داخل التطبيق ولا يُخصص شيء في عمليته الخاصة. تظل خدمة النظام تستخدم الذاكرة أثناء العمل، ولا يمكننا نسب ذلك بدقة؛ ولذلك، وبدلاً من كتابة صفر، لا نذكر أي رقم هناك. عمل بسرعة 30.8× من الزمن الحقيقي، خلف Parakeet V3 وSenseVoice Small.

يتصدر Whisper Large V3 Turbo أربعة من الصفوف العشرة وهو أبطأ محرك هنا، إذ يقل في السرعة عن Apple Speech بنحو عشر مرات ويشغل نحو 1.6 GB على القرص. يتصدر Qwen3-ASR 1.7B الصفوف الستة الأخرى، ويشغل نحو 2.5 GB و2.43 GiB من الذاكرة. يشغل Parakeet V3 مساحة 465 MB وذروته 0.09 GiB؛ ويتقدم على Turbo في الفرنسية ويتأخر عنه في البولندية، ولا يدعم اليابانية أو الكورية أو الصينية أو الكانتونية. Whisper Small هو أقرب مقارنة بحجم 600 MB، وكان Apple Speech أدق في ثماني من اللغات العشر التي قيس فيها كلاهما قياساً سليماً.

هل تستخدم Apple Speech بدلاً من نموذج تنزّله؟

لغةً بلغة:

  • الإنجليزية: ليس خياراً مناسباً. سجل Apple Speech 8.80؛ Qwen3-ASR 1.7B (4.49) أو Whisper Large V3 Turbo (5.49) أدق بوضوح.
  • الألمانية: ليس خياراً مناسباً. سجل Apple Speech 6.26؛ Qwen3-ASR 1.7B (2.85) أو Whisper Large V3 Turbo (4.05) أدق بوضوح.
  • الهولندية والروسية والبولندية: لا يملك Apple Speech نموذجاً لهذه اللغات الثلاث. Whisper Large V3 Turbo كان الأدق في كل منها، عند 5.69 و5.13 و5.45.
  • اليابانية: قابل للاستخدام. سجل Apple Speech 6.36، خلف Whisper Large V3 Turbo عند 5.30.
  • الكورية: قابل للاستخدام. سجل Apple Speech 4.31، خلف Qwen3-ASR 1.7B عند 3.54.
  • الفرنسية: ليس خياراً مناسباً. سجل Apple Speech 7.61؛ Qwen3-ASR 1.7B (4.57) أو Parakeet V3 (5.83) أدق بوضوح.
  • الصينية: قابل للاستخدام. سجل Apple Speech 7.97، مساوياً لـ Whisper Large V3 Turbo؛ وكان الأدق هو Qwen3-ASR 1.7B عند 6.49.
  • الإسبانية: ليس خياراً مناسباً. سجل Apple Speech 5.41؛ Qwen3-ASR 1.7B (3.38) أو Whisper Large V3 Turbo (3.62) أدق بوضوح.

Apple Speech هو اختصار هذا المقال لـ SpeechTranscriber من Apple، وهي واجهة API تعمل على الجهاز ويمكن لأي تطبيق Mac استدعاؤها على macOS 26 أو أحدث. وهو ليس أحد النماذج التي Whisper Notes لـ Mac ينزلها: وهي Whisper وParakeet V3 وSenseVoice وQwen3-ASR في نسخة Mac للتحميل المباشر (DMG)، وWhisper وParakeet V3 وSenseVoice على iPhone وفي إصدار Mac App Store. يوجد جدول كل محرك في صفحة دعم اللغات.

لا يغير شيء هنا ما يفعله Whisper Notes لـ Mac اليوم: لا يزال Parakeet V3 هو الافتراضي.

الأسئلة الشائعة

هل Apple Speech بدقة Whisper نفسها؟

ليس في معظم اللغات التي يغطيانها معاً. في جولة FLEURS الخاصة بنا، وعبر اللغات السبع من هذه العشر التي يدعمها Apple Speech، كان Whisper Large V3 Turbo أدق في ست، وتعادل الاثنان تماماً في الصينية عند 7.97% CER لكل منهما. وينعكس الترتيب أمام Whisper Small: تقدم Apple Speech في ست من السبع ولم يخسر إلا الإنجليزية، إذ سجل 8.80% مقابل 7.04% WER. لا يتصدر أي لغة مقاسة قياساً سليماً في هذه الجولة، ويقترب أكثر ما يكون في الكورية، عند 4.31% CER مقابل 3.54% لمتصدر الصف. الكانتونية هي اللغة الوحيدة المقاسة سليماً التي تفوق فيها على Whisper Large V3 Turbo، عند 8.69% مقابل 36.75% CER. استخدم المحرك المدمج إذا كان يدعم لغتك وكنت تفضل أن يدير macOS حزمة اللغة؛ واستخدم Whisper Large V3 Turbo للحصول على أدق نتيجة، أو إذا كانت لغتك إحدى اللغات الثلاث التي يفتقدها Apple Speech هنا.

ما اللغات التي يدعمها Apple Speech؟

يحدد macOS القائمة، لا أي تطبيق. في هذه الجولة أعاد Apple Speech نتائج في 21 من إعدادات اللغات الـ83 التي اختبرناها، مقابل 83 لإصداري Whisper كليهما، و30 لـ Qwen3-ASR 1.7B، و25 لـ Parakeet V3. ومن اللغات العشر الواردة في الجدول الرئيسي، يدعم الإنجليزية والألمانية واليابانية والكورية والفرنسية والصينية والإسبانية، ولا يدعم الهولندية أو البولندية أو الروسية. يضم الجدول الثاني الإعدادات الأربعة عشر الأخرى: الإيطالية والكانتونية والبرتغالية البرازيلية، وإحدى عشرة لغة أجاب فيها بنقل صوتي لاتيني بدلاً من الخط الأصلي. يجب على التطبيق أن يسأل macOS وقت التشغيل عن اللغات المتوفرة على جهاز بعينه. إن كانت لغتك مفقودة، يصل Whisper إلى كل لغة في قائمة التطبيق وعبر كل القنوات.

Apple Speech أم Parakeet V3 — أيهما؟

Parakeet V3، في كل لغة أوروبية يغطيها الاثنان. سجل 6.89 مقابل 8.80 في الإنجليزية، و5.83 مقابل 7.61 في الفرنسية، و4.86 مقابل 5.41 في الإسبانية، و3.43 مقابل 4.39 في الإيطالية، و6.49 مقابل 9.35 في البرتغالية البرازيلية؛ وتعادل الاثنان في الألمانية عند 6.26. لا يدعم Parakeet V3 اليابانية أو الكورية أو الصينية أو الكانتونية، لذا يكون Apple Speech هو الوحيد المتوفر من الاثنين هناك، وضمن 1.5 نقطة من متصدر الصف في اليابانية والكورية والصينية. يبلغ تنزيل Parakeet V3 465 MB، وقد عمل بسرعة 75.6× من الزمن الحقيقي وذروة 0.09 GiB؛ أما حزمة لغة Apple Speech فينزلها macOS، وعمل بسرعة 30.8× مع ذاكرة لا نبلغ عنها.

ما SpeechAnalyzer، وهل هو نفسه Apple Dictation؟

SpeechAnalyzer هو واجهة API الشاملة التي قدمتها Apple في WWDC 2025 ووفرتها في macOS 26 وiOS 26. وSpeechTranscriber هو نقطة تشغيل التفريغ داخلها؛ وهو ما قسناه وما يسميه هذا المقال Apple Speech. أما Dictation فهو نقطة التوافق، وقد شغلناه أيضاً: كان Apple Speech أدق في اللغات العشر كلها التي قاسها كلا المحركين قياساً سليماً، فحذف نحو ثلث أخطاء اللغة الوسيطة وأكثر من نصف أخطاء الفرنسية والألمانية. يغطي Dictation لغات أكثر، 33 إعداداً مقابل 21، لذا فهو محرك النظام للهولندية أو البولندية أو الروسية إن أمكنك قبول WER بنسبة 17.34% و13.50% و13.13%. سجل Whisper Large V3 Turbo على المقاطع نفسها 5.69% و5.45% و5.13%.

هل يغادر الصوت جهاز Mac عند استخدام Apple Speech؟

توثق Apple نموذج SpeechTranscriber بوصفه تعرفاً على الكلام على الجهاز: ينزل macOS أصول اللغة مرة واحدة، ويعمل التعرف محلياً. قسنا الدقة والسرعة، لا سلوك الشبكة، ولذلك نصف ذلك الجزء كما تصفه Apple. تعمل المحركات التي ينزلها Whisper Notes بنفسه — Whisper وParakeet V3 وSenseVoice وQwen3-ASR — على GPU أو Neural Engine في جهاز Mac الخاص بك، بلا حساب أو API key، ويعمل التفريغ مع إيقاف الشبكة عبر كل القنوات.

لماذا لا تطابق هذه الأرقام الدقة التي أحصل عليها في تسجيلاتي؟

لأن FLEURS كلام مقروء قصير ونظيف، أما تسجيلاتك فليست كذلك. جولتنا معايرة على مجموعة بيانات عامة: نحو 150 جملة و30 دقيقة من الصوت لكل لغة، وجهاز M5 MacBook Air واحد، والمقاطع نفسها لكل محرك. وهي تبين ما إذا كان المحرك مناسباً للغة، لا ما ستحصل عليه في اجتماع أو صوت صاخب أو كلام بلكنة أو ملف مدته ساعتان.

لماذا تقول اختبارات أخرى إن Apple Speech يتفوق على Whisper؟

تقارنه بـ Whisper Small، وفي الإنجليزية وحدها. وجولتنا تتفق معها في حالة Whisper Small: تفوق Apple Speech عليه في ثماني لغات من العشر التي قاسها الاثنان قياساً سليماً. والإنجليزية إحدى اللغتين اللتين خسرهما، إذ سجل 8.80 مقابل 7.04. ولا ينتقل هذا إلى Whisper Large V3 Turbo، فقد تأخر عنه Apple Speech في ثماني لغات من تلك العشر، وتعادل معه في الصينية عند 7.97، وتقدم عليه في الكانتونية وحدها. وأيّ إصدار من Whisper يدخل المقارنة هو ما يحدد العنوان.

جرّبه

النماذج الخمسة القابلة للتنزيل هنا — Whisper Small وWhisper Large V3 Turbo وParakeet V3 وSenseVoice Small وQwen3-ASR 1.7B — موجودة كلها في Whisper Notes لـ Mac، نسخة التحميل المباشر (DMG)، ضمن الإعدادات ثم نموذج التفريغ.

إذا لم تطابق أرقامنا تجربتك في لغة ما، فراسل mac@whispernotes.app. ملاحظات الإصدار الكاملة: whispernotes.app/changelog.

المصادر: جولتنا على قسم الاختبار من Google FLEURS عند المراجعة 70bb2e84، ووثائق Apple عن SpeechAnalyzer، وجولة Qwen3-ASR ذات الثلاثين لغة السابقة.