أردنا الإجابة عن سؤال واحد: هل هناك نموذج محلي يفرّغ لغتك بدقة أعلى من Whisper Large V3؟ فاختبرنا هذه النماذج على مجموعة بيانات FLEURS.
FLEURS مجموعة بيانات من Google لكلام مقروء بـ 102 لغة. أخذنا نحو 75 جملة من كل لغة، وشغّلنا المقاطع نفسها، بالترتيب نفسه، على خمسة نماذج:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
النتائج تبدو هكذا.
Qwen3-ASR 1.7B مقابل Whisper Large V3 Turbo — جولتنا الخاصة على FLEURS، جهاز MacBook Air M5 واحد، كلام مقروء، مقاطع قصيرة.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| اللغات المدعومة | 30 | 101 |
| تفوّق واضح | الكانتونية، الهندية، التايلاندية، الفيتنامية، الفرنسية (5) | الفنلندية والمجرية واليونانية و8 لغات أخرى (11) |
| السرعة | 8.7× من الزمن الحقيقي | 2.4× من الزمن الحقيقي |
| ذروة الذاكرة | 2.43 GiB | 1.87 GiB |
| حجم التنزيل | نحو 2.5 GB | نحو 1.6 GB |
خارج اللغات القوية لكل نموذج، الفارق في الدقة صغير.
Whisper Large V3 مقابل Qwen3-ASR: المقارنة التفصيلية
اللغات الـ 30 كلها، مرتبة من أكبر فوز لـ Qwen إلى أكبر خسارة له. الأقل أفضل في العمودين.
جولتنا الخاصة على FLEURS، جهاز MacBook Air M5 واحد، كلام مقروء. CER للصينية والكانتونية واليابانية والكورية والتايلاندية، وWER لبقية اللغات؛ الأخضر يعني فارقاً يتجاوز نطاقات الخطأ المزدوجة عند 95%.
| اللغة | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| الكانتونية | 6.00 | 37.97 |
| الهندية | 13.67 | 30.42 |
| التايلاندية | 5.92 | 12.95 |
| الفيتنامية | 5.07 | 9.79 |
| الفارسية | 26.98 | 30.03 |
| العربية | 14.14 | 15.75 |
| الإندونيسية | 4.97 | 6.50 |
| الفرنسية | 3.98 | 5.39 |
| الصينية | 5.69 | 6.88 |
| الإنجليزية | 5.07 | 5.92 |
| الألمانية | 3.51 | 4.10 |
| اليابانية | 5.39 | 5.71 |
| الكورية | 3.51 | 3.70 |
| الإسبانية | 3.60 | 3.76 |
| الإيطالية | 2.98 | 3.05 |
| الروسية | 5.98 | 5.51 |
| البرتغالية | 5.64 | 4.91 |
| المقدونية | 17.81 | 16.64 |
| الماليزية | 11.60 | 10.18 |
| الهولندية | 7.65 | 5.63 |
| التركية | 8.34 | 5.53 |
| الدنماركية | 20.12 | 14.92 |
| البولندية | 12.78 | 5.32 |
| الرومانية | 18.97 | 8.22 |
| الفلبينية | 20.44 | 9.37 |
| السويدية | 20.04 | 8.72 |
| التشيكية | 23.92 | 11.15 |
| اليونانية | 30.20 | 12.97 |
| الفنلندية | 26.08 | 6.54 |
| المجرية | 36.35 | 13.66 |
جولتنا المزدوجة الخاصة على قسم اختبار FLEURS، المراجعة 70bb2e84، نحو 75 جملة لكل لغة، جهاز MacBook Air M5 واحد.
اللغات الخمس التي يفوز فيها Qwen3-ASR 1.7B بوضوح. معدل الخطأ بالنسبة المئوية، Qwen مقابل Turbo: الكانتونية (6.0 مقابل 38.0)، الهندية (13.7 مقابل 30.4)، التايلاندية (5.9 مقابل 13.0)، الفيتنامية (5.1 مقابل 9.8)، الفرنسية (4.0 مقابل 5.4). الكانتونية والتايلاندية تُحتسبان بالحرف، والبقية بالكلمة. ميزته تتركز في اللغات المحتسبة بالحرف: عبر الصينية والكانتونية واليابانية والكورية والتايلاندية بلغ متوسطه 5.3% مقابل 13.4% لـ Turbo، بينما في الخمس والعشرين الأخرى المحتسبة بالكلمة بلغ متوسطه 14.0% مقابل 10.2% لـ Turbo.
اللغات الإحدى عشرة التي يفوز فيها Whisper Large V3 Turbo بوضوح. معدل الخطأ بالنسبة المئوية، Qwen مقابل Turbo، وكلها محتسبة بالكلمة: المجرية (36.4 مقابل 13.7)، اليونانية (30.2 مقابل 13.0)، الفنلندية (26.1 مقابل 6.5)، التشيكية (23.9 مقابل 11.2)، الفلبينية (20.4 مقابل 9.4)، الدنماركية (20.1 مقابل 14.9)، السويدية (20.0 مقابل 8.7)، الرومانية (19.0 مقابل 8.2)، البولندية (12.8 مقابل 5.3)، التركية (8.3 مقابل 5.5)، الهولندية (7.7 مقابل 5.6).
اللغات الأربع عشرة المتقاربة أو المتعادلة. الإنجليزية (5.1 مقابل 5.9)، الألمانية (3.5 مقابل 4.1)، الإسبانية (3.6 مقابل 3.8)، الإيطالية (3.0 مقابل 3.1)، الروسية (6.0 مقابل 5.5)، البرتغالية (5.6 مقابل 4.9)؛ والصينية (5.7 مقابل 6.9) واليابانية (5.4 مقابل 5.7) والكورية (3.5 مقابل 3.7) محتسبة بالحرف. ثم العربية والإندونيسية والفارسية والماليزية والمقدونية. كل فارق هنا صغير ويقع داخل نطاق 95%، لذا لا تستطيع هذه الجولة الفصل بين النموذجين.
الكانتونية هي الصف الوحيد الذي يغيّر قراراً: 6.00% مقابل 37.97%، وSenseVoice Small — الذي نشرناه بوصفه الحل للكانتونية — سجّل 36.71% CER على المقاطع نفسها. على مجموعة الكلام المقروء هذه لا يجتاز أي منهما الحد، لذا صارت التوصية القديمة مقيّدة بهذا الشرط.
ما مدى سرعة Qwen3-ASR 1.7B؟
المحركات الخمسة كلها مقاسة في المنظومة نفسها وعلى جهاز واحد (MacBook Air M5)، فهي على الأقل قابلة للمقارنة فيما بينها.
وسيط معامل الزمن الحقيقي لكل محرك عبر لغاته في جولة FLEURS نفسها، جهاز MacBook Air M5 واحد، كلام مقروء.
| المحرك | اللغات | وسيط السرعة في هذه الجولة (مقاطع قصيرة) |
|---|---|---|
| SenseVoice Small | 6 خيارات | 161.0× |
| Parakeet TDT 0.6B v3 | 25 | 82.9× |
| Qwen3-ASR 1.7B | 30 مُسمّاة | 8.7× |
| Whisper Small | 101 | 6.4× |
| Whisper Large V3 Turbo | 101 | 2.4× |
هذه أرقام منظومة المقاطع القصيرة، وهي أقل مما تحققه المحركات نفسها على تسجيل طويل. اقرأ هذا العمود لمقارنة المحركات ببعضها داخل هذه الجولة وحدها، لا لشيء آخر.
في المنظومة نفسها كان Parakeet V3 وSenseVoice Small أسرع من Qwen3-ASR بنحو رتبة مقدارية كاملة. وعلى الملفات الطويلة بدل المقاطع القصيرة، عمل Parakeet بسرعة 103× من الزمن الحقيقي على M4 Pro، وSenseVoice بسرعة 52× أو أعلى — قياس مختلف على صوت مختلف، لكنه يشير إلى الاتجاه نفسه.
Qwen3-ASR يقع في المنتصف. لم يكن أبطأ محرك في جولة المقاطع القصيرة هذه — كان Whisper Large V3 Turbo — لكنه يتفاوت بين اللغات أكثر من غيره، من 2.7× في اليونانية إلى 12.4× في اليابانية.
كم يكلّف Qwen3-ASR من الذاكرة والقرص؟
ذروة الذاكرة هي أقصى استهلاك للعملية رُصد عبر عناصر جولة FLEURS نفسها، جهاز MacBook Air M5 واحد، كلام مقروء، مقاطع قصيرة.
| المحرك | حجم التنزيل | ذروة الذاكرة في هذه الجولة |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | نحو 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | نحو 2.5 GB | 2.43 GiB |
على المحورين معاً، Qwen3-ASR هو الأثقل بين الخمسة: نحو 2.5 GB للتنزيل، و2.43 GiB ذروة ذاكرة للعملية في هذه الجولة، مقابل نحو 1.6 GB و1.87 GiB لـ Whisper Large V3 Turbo.
على جهاز بذاكرة 8 GB هناك مسار أخف. يغطي Parakeet V3 25 لغة في 465 MB و0.09 GiB، ويغطي Whisper Small 101 لغة في 600 MB و0.87 GiB.
كيف قِسنا: FLEURS، 30 لغة، جهاز Mac واحد
عمل Qwen3-ASR 1.7B كنسخة MLX 8-bit، وعمل Whisper Large V3 Turbo كنسخة ggml من whisper.cpp على Metal. البيانات هي قسم اختبار Google FLEURS عند المراجعة 70bb2e84 (CC-BY-4.0): 83 لغة من أصل 102، نحو 75 جملة و15 دقيقة لكل لغة، والمقاطع نفسها بالترتيب نفسه لكل نموذج؛ والمقارنة المزدوجة على لغات Qwen الـ 30. استخدمنا WER للغات المفصولة بمسافات، وCER للصينية والكانتونية واليابانية والكورية والتايلاندية، دون دمجهما في رقم واحد أبداً؛ ونطاقات الخطأ من إعادة معاينة على مستوى العناصر بـ 10,000 تكرار. جهاز MacBook Air M5 واحد، 32 GB، macOS 26.5، بلا مخرجات فارغة أو إخفاقات من أي من النموذجين.
FLEURS كلام مقروء، لا اجتماع ولا إملاء. ترتيب الكلام المقروء لم يصمد أمام الصوت الحقيقي مرتين في اختباراتنا، لذا لا نعمّمه على التسجيلات الطويلة: هذه الجداول تقول إن كان النموذج معقولاً للغتك، لا الدقة التي ستحصل عليها. أما تقييم Qwen3-ASR 1.7B على اجتماع حقيقي فسيكون موضوع مقال منفصل.
هل تستخدم Qwen3-ASR بدل Whisper Large V3؟
لغةً بلغة، هكذا نجيب عن هذا السؤال داخل Whisper Notes لنظام Mac.
- إذا كنت تفرّغ الكانتونية أو الهندية أو التايلاندية أو الفيتنامية أو الفرنسية: اختر Qwen3-ASR 1.7B.
- إذا كنت تفرّغ الصينية أو اليابانية أو الكورية أو الإنجليزية أو الألمانية أو الإسبانية أو الإيطالية: تقدّم بفارق شعرة، والشعرة وحدها هي ما ندّعيه. أي من النموذجين يفي بالغرض، وكذلك الحال في الفارسية والعربية والإندونيسية والروسية والبرتغالية والمقدونية والماليزية.
- إذا كنت تفرّغ الفنلندية أو المجرية أو اليونانية أو التشيكية أو السويدية أو الدنماركية أو البولندية أو الرومانية أو الفلبينية أو التركية أو الهولندية: ابقَ على Whisper Large V3 Turbo. فقد فاز في الإحدى عشرة كلها بوضوح.
- إذا كان ما يهمك هو السرعة أو مساحة القرص: ليس هذا المحرك. كان Parakeet V3 وSenseVoice Small أسرع برتبة مقدارية وبجزء يسير من حجم التنزيل، ويغطي Whisper Small 101 لغة في 600 MB بسرعة 6.4×.
- إذا كنت على iPhone أو على نسخة Mac App Store: المحرك لم يصل إلى هناك بعد. وSenseVoice هو خيار الكانتونية على هاتين القناتين.
هذه هي نسخة Whisper Notes لنظام Mac التي تشغّل Qwen3-ASR المفتوح من علي بابا على الجهاز: الأوزان المفتوحة محوَّلة إلى Apple MLX بدقة 8-bit، وتعمل على معالج الرسوميات في جهاز Mac الخاص بك، دون أن يذهب أي صوت إلى خوادم علي بابا. وهو ليس النموذج نفسه ذا الـ 0.6B الذي حلّ SenseVoice محله في نسخة التحميل المباشر (DMG) 1.5.0.
كيفية الاستخدام (نسخة Mac للتحميل المباشر، DMG 1.6.0 وما بعدها): الإعدادات ثم نموذج التفريغ ثم Qwen3-ASR 1.7B. يُنزَّل النموذج داخل التطبيق عند أول استخدام وحجمه نحو 2.5 GB. يحتاج إلى macOS 15 أو أحدث على Apple silicon، ويُنصح بذاكرة 16 GB؛ أما بقية التطبيق فتعمل على macOS 14. قائمة اللغات لكل محرك موجودة في صفحة دعم اللغات لدينا. وتقبل واجهة CLI المحلية وخادم MCP المحلي الأسماء qwen وqwen3 وqwen3-asr.
وإذا كنت تفضّل عدم التبديل، فلا شيء عليك تغييره: Parakeet V3 لا يزال الافتراضي.
الأسئلة الشائعة
هل Qwen3-ASR أدق من Whisper Large V3 Turbo؟
يعتمد على اللغة، والقسمة تكاد تكون متساوية. في جولة FLEURS الخاصة بنا داخل Whisper Notes لنظام Mac، وعبر اللغات الـ 30 التي يغطيها النموذجان، تقدّم Qwen3-ASR 1.7B في 15 لغة وتقدّم Whisper Large V3 Turbo في 15. تقدّم Qwen بوضوح في الكانتونية (6.00% مقابل 37.97% CER) والهندية (13.67% مقابل 30.42% WER) والتايلاندية والفيتنامية والفرنسية. وتقدّم Turbo بوضوح في الفنلندية (6.54% مقابل 26.08% WER) والمجرية واليونانية والتشيكية والسويدية والدنماركية والبولندية والرومانية والفلبينية والتركية والهولندية. أربعة عشر فارقاً من الثلاثين تقع داخل نطاقات الخطأ وينبغي قراءتها تعادلاً. اختر Qwen3-ASR إذا كانت لغتك في عمود فوزه وكنت على نسخة Whisper Notes للتحميل المباشر على Mac (DMG)؛ واختر Whisper Large V3 Turbo فيما عدا ذلك، ولكل لغة خارج لغات Qwen الـ 30، لأن Whisper يصل إلى الخيارات الـ 101 كلها.
هل يمكنني استخدام Qwen3-ASR على iPhone أو من Mac App Store؟
اليوم هو موجود في نسخة Whisper Notes للتحميل المباشر على Mac (DMG) ابتداءً من الإصدار 1.6.0. ومن المخطط أن تحصل نسخة Mac App Store على المحركات الأحدث في إصدارات لاحقة، وليس لدينا تاريخ لذلك. في هذه الأثناء يضم تطبيق iPhone ونسخة Mac App Store ثلاث عائلات محركات — Whisper وParakeet V3 وSenseVoice — وكل لغة يتعرف عليها Qwen يغطيها Whisper هناك أيضاً. وبالعدّ على أساس النماذج، تقدّم نسخة Mac App Store اليوم أربعة نماذج، ونسخة التحميل المباشر خمسة، لأن Whisper يأتي بنسختي Small وLarge V3 Turbo. وإذا كنت تحتاج الكانتونية على iPhone، فـ SenseVoice هو المحرك المناسب هناك.
Qwen3-ASR أم SenseVoice للصينية واليابانية والكورية؟
النموذجان متقاربان في الدقة ومتباعدان جداً في السرعة. في جولة FLEURS لدينا، سجّل Qwen3-ASR 5.69% CER في الصينية، و5.39% في اليابانية، و3.51% في الكورية؛ وسجّل SenseVoice Small 7.06% و6.85% و7.82% على المقاطع نفسها. وفي تلك الجولة عمل SenseVoice بوسيط 161× من الزمن الحقيقي مقابل 8.7× لـ Qwen، وحجم تنزيله 827 MB مقابل نحو 2.5 GB، وهو متاح على iPhone وعلى نسختي Mac كلتيهما. اختر SenseVoice إلا إذا كنت تفرّغ الكانتونية، حيث سجّل Qwen3-ASR 6.00% CER مقابل 36.71% لـ SenseVoice، والفارق كبير بما يكفي ليستحق الانتظار.
ما متطلبات تشغيل Qwen3-ASR 1.7B؟
جهاز Mac بمعالج Apple silicon يعمل بـ macOS 15 أو أحدث، مع التوصية بذاكرة 16 GB، إضافة إلى نحو 2.5 GB من مساحة القرص للنموذج. وهذا أعلى من متطلبات بقية Whisper Notes لنظام Mac، الذي يعمل على macOS 14 وما بعده. في جولة القياس لدينا بلغ النموذج ذروة 2.43 GiB من ذاكرة العملية، وهي الأعلى بين المحركات الخمسة. وعلى جهاز Mac بذاكرة 8 GB، يغطي Whisper Small قائمة الـ 101 لغة نفسها في 600 MB، ويغطي Parakeet V3 25 لغة أوروبية في 465 MB.
هل يغادر الصوت جهاز Mac عند استخدام Qwen3-ASR؟
لا. تقدّم علي بابا أيضاً Qwen3-ASR كخدمة سحابية عبر واجهتي DashScope للبث الفوري وتفريغ الملفات، حيث يُرفع الصوت إلى خوادمها. وWhisper Notes لا يستخدم هاتين الواجهتين. فهو يشغّل الأوزان المفتوحة محلياً كنموذج MLX 8-bit على معالج الرسوميات في جهاز Mac لديك، بلا حساب وبلا مفتاح API، والتفريغ يعمل والشبكة مغلقة. وهذا ينطبق على جميع عائلات المحركات في التطبيق، وعلى جميع القنوات.
لماذا لا تطابق هذه الأرقام الدقة التي أحصل عليها في تسجيلاتي؟
لأن FLEURS كلام مقروء قصير ونظيف، وتسجيلاتك ليست كذلك. جولتنا معايرة على مجموعة بيانات عامة: نحو 75 جملة لكل لغة، جهاز MacBook Air M5 واحد، والمقاطع نفسها لكل نموذج. وهي تفيد في السؤال عمّا إذا كان نموذج ما معقولاً للغة ما، وليست تنبؤاً بدقتك في اجتماع، أو على صوت فيه ضجيج، أو كلام بلكنة، أو ملف من ساعتين.
جرّبه
Qwen3-ASR 1.7B موجود في Whisper Notes لنظام Mac 1.6.0 وما بعدها، في نسخة التحميل المباشر (DMG) وحدها. الإعدادات ثم نموذج التفريغ. تغطي التجربة المجانية 10,000 كلمة، وهي تكفي لتشغيل لغتك أنت ثم الاختلاف مع الجداول أعلاه.
إذا وجدت لغة لا تطابق فيها أرقامنا تجربتك، راسلنا على mac@whispernotes.app. ملاحظات الإصدار كاملة: whispernotes.app/changelog.
مصادر كل ما سبق: جولتنا على قسم اختبار Google FLEURS عند المراجعة 70bb2e84، وبطاقة نموذج Qwen3-ASR 1.7B، وجدول اللغات لكل محرك في صفحة دعم اللغات لدينا، وهو مُولَّد من المصدر البرمجي للتطبيق نفسه.