macOS 26 ও iOS 26 থেকে Apple ডিভাইসে চলা স্পিচ রিকগনিশনের নতুন প্রজন্ম — SpeechAnalyzer ও SpeechTranscriber — সরবরাহ করছে, যাকে নিচে সংক্ষেপে Apple Speech বলা হয়েছে। এটি পুরোনো ডিকটেশন ইঞ্জিনের চেয়ে অনেক বেশি নির্ভুল। তাই আমরা জানতে চেয়েছিলাম: Apple-এর বিল্ট-ইন স্পিচ রিকগনিশন কি এখন এতটাই ভালো যে আপনি ট্রান্সক্রিপশন অ্যাপ পুরোপুরি বাদ দিতে পারেন? আর Whisper Notes-এর ডিভাইসে চলা ওপেন মডেল — Whisper, Parakeet, SenseVoice ও Qwen3-ASR — থেকে এটি কতটা পিছিয়ে? আমরা কঠোরভাবে পরীক্ষা করেছি। ফলাফল এখানে। আমরা যে দশটি ভাষায় পরীক্ষা করেছি তার কোনোটিতেই Apple Speech-এর ত্রুটির হার সর্বনিম্ন হয়নি; কোরীয়, জাপানি ও চীনা ভাষায় এটি সেরা ফলের 1.5 পয়েন্টের মধ্যে ছিল, আর ডাচ, রুশ ও পোলিশ ভাষার জন্য এর কোনো মডেলই নেই।
Apple Speech আপনার ডাউনলোড করা মডেলগুলো থেকে কতটা পিছিয়ে?
| ভাষা | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| ইংরেজি | 8.80 | 4.49 | 5.49 | 7.04 | 6.89 | 8.46 |
| জার্মান | 6.26 | 2.85 | 4.05 | 8.67 | 6.26 | — |
| ডাচ | — | 7.36 | 5.69 | 16.75 | 8.58 | — |
| রুশ | — | 5.65 | 5.13 | 11.37 | 7.12 | — |
| পোলিশ | — | 12.59 | 5.45 | 15.81 | 8.30 | — |
| জাপানি | 6.36 | 5.74 | 5.30 | 11.37 | — | 6.78 |
| কোরীয় | 4.31 | 3.54 | 4.25 | 7.30 | — | 7.85 |
| ফরাসি | 7.61 | 4.57 | 5.97 | 13.24 | 5.83 | — |
| চীনা | 7.97 | 6.49 | 7.97 | 20.50 | — | 7.69 |
| স্প্যানিশ (লাতিন আমেরিকা) | 5.41 | 3.38 | 3.62 | 6.22 | 4.86 | — |
সবচেয়ে বেশি ব্যবহৃত ভাষাগুলোর মধ্যে দশটি, প্রতি কলামে একটি ইঞ্জিন। প্রতিটি সেলে সেই ইঞ্জিনের ত্রুটির হার; কম মান ভালো। সবুজ সারির সর্বনিম্ন এবং সাদা দ্বিতীয় সর্বনিম্ন মান দেখায়। জাপানি, কোরীয় ও চীনার জন্য CER, বাকিগুলোর জন্য WER; কখনো এক সংখ্যায় মেশানো হয়নি। Whisper Notes দলের নিজেদের চালানো FLEURS রান, একটি M5 MacBook Air এবং পড়ে শোনানো স্পিচ।
সংক্ষিপ্ত নাম: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small। ড্যাশ মানে ওই ভাষার জন্য ইঞ্জিনটির কোনো মডেল নেই।
দশটি ভাষার ছয়টিতে Qwen3-ASR 1.7B-এর ত্রুটির হার সর্বনিম্ন, বাকি চারটিতে Whisper Large V3 Turbo-এর। সারির সেরা মান থেকে Apple Speech কোরীয়তে 0.77 পয়েন্ট, জাপানিতে 1.06 পয়েন্ট এবং চীনায় 1.48 পয়েন্ট পিছিয়ে; চীনা ভাষাতেই এটি 7.97 নিয়ে Whisper Large V3 Turbo-এর সমান। সমর্থিত সাত ভাষায় এটি সারির সেরা মান থেকে 0.8 থেকে 4.3 পয়েন্ট পিছিয়ে; সবচেয়ে বড় ব্যবধান ইংরেজিতে, 4.49-এর বিপরীতে 8.80। ডাচ, পোলিশ ও রুশ ভাষায় Apple Speech-এর ফল নেই।
Apple Speech কোন কোন ভাষা সমর্থন করে?
এই রানে Apple Speech 83টি ভাষা কনফিগারেশনের মধ্যে 21টির ফল দিয়েছে। উভয় Whisper মডেল সব 83টি, Qwen3-ASR 1.7B 30টি এবং Parakeet V3 25টি কভার করে। ওপরের দশ ভাষার মধ্যে ডাচ, পোলিশ বা রুশ ভাষার জন্য এর কোনো মডেল নেই। উদ্ধৃত করার মতো স্থায়ী তালিকা নেই: ভাষার অ্যাসেট macOS-এর, তাই কোনো অ্যাপ রানটাইমে জিজ্ঞেস করে নির্দিষ্ট মেশিনে কী আছে।
| ভাষা | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| ইতালীয় | 4.39 | 2.58 | 2.58 | 7.64 | 3.43 | — |
| ক্যান্টনিজ | 8.69 | 6.44 | 36.75 | 119.01 | — | 37.23 |
| পর্তুগিজ (ব্রাজিল) | 9.35 | 5.17 | 5.44 | 8.61 | 6.49 | — |
| হিন্দি | 101.50 | 13.19 | 29.64 | 61.26 | — | — |
| তেলুগু | 101.63 | — | 81.74 | 103.19 | — | — |
| উর্দু | 101.69 | — | 23.39 | 38.83 | — | — |
| পাঞ্জাবি | 101.75 | — | 92.05 | 103.40 | — | — |
| বাংলা | 102.00 | — | 83.52 | 117.37 | — | — |
| নেপালি | 102.13 | — | 88.59 | 118.84 | — | — |
| মালয়ালম | 102.18 | — | 107.34 | 167.16 | — | — |
| মারাঠি | 102.23 | — | 82.69 | 109.95 | — | — |
| কন্নড় | 103.83 | — | 72.07 | 116.10 | — | — |
| গুজরাটি | 104.52 | — | 75.31 | 108.91 | — | — |
| তামিল | 113.01 | — | 71.28 | 79.77 | — | — |
Apple Speech যে অন্য চৌদ্দটি ভাষায় ফল দিয়েছে, তার নিজস্ব ত্রুটির হারের ক্রমে। কলাম, রং ও সংক্ষিপ্ত নাম ওপরের মতোই; ক্যান্টনিজের জন্য CER, বাকিগুলোর জন্য WER। যোগ করা অংশও লবের মধ্যে গণনা হয় বলে ত্রুটির হার 100% ছাড়াতে পারে।
শেষ এগারোটি সারিতে, হিন্দি থেকে তামিল পর্যন্ত, Apple Speech নিজস্ব লিপির বদলে ল্যাটিন লিপ্যন্তরণে উত্তর দিয়েছে। তাই সেখানে এর ত্রুটির হার শনাক্তকরণের নির্ভুলতার বদলে লিপির অমিল মাপে এবং ওই সেলগুলো সারির র্যাঙ্কিং থেকে বাদ দেওয়া হয়েছে; ওই সারিতে অন্য ইঞ্জিনগুলোর মান সাধারণ পরিমাপ।
SpeechAnalyzer কীভাবে কাজ করে
iOS 10 থেকে Apple-এর স্পিচ রিকগনিশন API আছে। সেটি SFSpeechRecognizer, যা পুরোনো ডিকটেশন পাথের ইঞ্জিন। macOS 26 ও iOS 26-এ চালু হওয়া SpeechAnalyzer এর জায়গা নিয়েছে এবং watchOS ছাড়া প্রতিটি Apple প্ল্যাটফর্মে পাওয়া যায়।
API-টি একটি সেশনকে কেন্দ্র করে তৈরি। আপনি একটি SpeechAnalyzer বানান, তাতে এক বা একাধিক মডিউল দেন এবং অডিও পাঠান; SpeechTranscriber হলো সেই মডিউল যা স্পিচকে টেক্সটে বদলায়। অডিও আপনার পূরণ করা অ্যাসিঙ্ক্রোনাস সিকোয়েন্স হিসেবে যায়, ফল দ্বিতীয় একটি সিকোয়েন্সে ফেরে এবং দুটো সাধারণত আলাদা টাস্কে চলে। অ্যানালাইজার একবারে একটি ইনপুট সিকোয়েন্স নেয়। প্রতিটি বাফার ও ফল অডিওর নিজস্ব টাইমলাইনে টাইমকোড করা, তাই কোনো ফলকে তার উৎসস্থানে ফিরিয়ে রাখা যায়।
একটি সেশন, তিনটি টাস্ক: অডিও AsyncSequence হিসেবে যায়, SpeechAnalyzer ও SpeechTranscriber সেটি বিশ্লেষণ করে এবং ইন্টারফেসের পড়ার জন্য ফল দ্বিতীয় AsyncSequence হিসেবে ফেরে। উৎস: Apple, WWDC25 সেশন 277।
ফল দুইবার আসে। Apple যাকে volatile range বলে তার ভেতরের যেকোনো কিছু আরও ভালো ফল দিয়ে বদলানো যেতে পারে; বাইরের সবকিছু চূড়ান্ত। এভাবেই অ্যাপ আপনি কথা বলার সময় প্রাথমিক ট্রান্সক্রিপ্ট দেখায় এবং পরে তা সংশোধন করে।
SpeechTranscriber মডেলের জন্য Apple পাঁচটি ডিজাইন লক্ষ্য জানায়: দীর্ঘ অডিও, কথোপকথনের স্পিচ, দূরের বক্তা, কম বিলম্ব এবং গোপনীয়তা, অর্থাৎ এটি ডিভাইসে চলে। Notes, Voice Memos, Journal ও কল সারাংশ এর ওপর তৈরি।
SpeechTranscriber মডেলের জন্য Apple-এর ঘোষিত পাঁচটি ডিজাইন লক্ষ্য। উৎস: Apple, WWDC25 সেশন 277।
মডেলগুলো কোনো অ্যাপের অংশ নয়। AssetInventory-এর মাধ্যমে Apple-এর সার্ভার থেকে এগুলো ডাউনলোড হয়, সিস্টেম সংরক্ষণ ও আপডেট করে এবং অ্যাপগুলোর মধ্যে ভাগ করে। এগুলো অ্যাপের ডাউনলোড সাইজ বা মেমরি স্পেসে কিছু যোগ করে না, আর ডিকোডিং কল করা প্রসেসের বাইরে হয়। কোনো ভাষা বা ডিভাইসের জন্য SpeechTranscriber-এর মডেল না থাকলে DictationTranscriber সিস্টেম ডিকটেশনের একই মডেল দিয়ে কাজটি নেয়।
আমরা যেভাবে এটি মেপেছি
এই পোস্টের প্রতিটি ইঞ্জিন একটি M5 MacBook Air-এ (32 GB, macOS 27.0) একই ক্লিপ একই ক্রমে, একবারে একটি করে ট্রান্সক্রাইব করেছে। অডিওটি Google FLEURS-এর রিভিশন 70bb2e84-এর টেস্ট স্প্লিট, প্রতি ভাষায় প্রায় 150টি বাক্য ও 30 মিনিট। ডেটাসেটের নিজস্ব আইটেম আইডির স্থির হ্যাশ আইটেমগুলোকে ক্রমে রাখে এবং আমরা সম্পূর্ণ আইটেমের সবচেয়ে ছোট রান নিই যা ত্রিশ মিনিট ছাড়ায়; এই বাছাইয়ে কোনো মডেল আউটপুটের ভূমিকা ছিল না। প্রতিটি সেল তার নিজস্ব রসিদ থেকে আবার তৈরি ও পরীক্ষা করা হয়েছে, এবং সব 285টি পাস করেছে।
যেসব ভাষায় শব্দ স্পেস দিয়ে আলাদা, সেখানে স্কোর শব্দ ত্রুটির হার; জাপানি, কোরীয়, চীনা ও ক্যান্টনিজের জন্য অক্ষর ত্রুটির হার। FLEURS পড়ে শোনানো স্পিচ, মিটিং বা ডিকটেশন নয়। এই টেবিলগুলো বলে কোনো ইঞ্জিন আপনার ভাষার জন্য সম্ভাব্য বিকল্প কি না, আপনার নিজের রেকর্ডিংয়ে কী পাবেন তা নয়।
পুরোনো Apple Dictation-এর চেয়ে এটি কতটা ভালো?
Apple দুটি ট্রান্সক্রিপশন অপারেটিং পয়েন্ট দেয় এবং আমরা দুটিই মেপেছি। SpeechTranscriber নতুনটি, যাকে এই পোস্টে Apple Speech বলা হয়েছে। DictationTranscriber হলো কম্প্যাটিবিলিটি অপারেটিং পয়েন্ট, অর্থাৎ Mac-এর আগের ডিকটেশন পাথ।
| ভাষা | Apple Dictation | Apple Speech |
|---|---|---|
| কোরীয় | 7.11 | 4.31 |
| ইতালীয় | 6.93 | 4.39 |
| স্প্যানিশ (লাতিন আমেরিকা) | 8.43 | 5.41 |
| জার্মান | 12.69 | 6.26 |
| জাপানি | 9.37 | 6.36 |
| ফরাসি | 17.10 | 7.61 |
| চীনা | 10.28 | 7.97 |
| ক্যান্টনিজ | 10.18 | 8.69 |
| ইংরেজি | 13.83 | 8.80 |
| পর্তুগিজ (ব্রাজিল) | 10.85 | 9.35 |
যেসব ভাষা Apple-এর উভয় অপারেটিং পয়েন্ট পরিষ্কারভাবে মেপেছে, Apple Speech-এর ত্রুটির হারের ক্রমে; সবুজ সারির ভালো মানটি দেখায়। একই রান, একই ক্লিপ, একই Mac। জাপানি, কোরীয়, চীনা ও ক্যান্টনিজের জন্য CER, বাকিগুলোর জন্য WER।
Apple Speech দশটির সবকটিতে বেশি নির্ভুল। মাঝের ভাষায় প্রায় এক-তৃতীয়াংশ ত্রুটি কমে, ফরাসি ও জার্মানে অর্ধেকের বেশি এবং ব্রাজিলীয় পর্তুগিজ ও ক্যান্টনিজে প্রায় প্রতি সাতটির একটি ত্রুটি কমে।
এটি Apple-এর নিজের পুরোনো ইঞ্জিনের সঙ্গে তুলনা। আপনার ডাউনলোড করা মডেলগুলোর বিপরীতে পরিষ্কারভাবে মাপা ভাষায় এর সেরা স্থান ক্যান্টনিজে দ্বিতীয়। Dictation আরও বেশি ভাষা কভার করে: এই রানে 21টির বিপরীতে 33টি কনফিগারেশন, যার মধ্যে নতুন ইঞ্জিনে এখানে না থাকা তিনটিই আছে।
বিল্ট-ইন ইঞ্জিন আপনাকে কী সুবিধা দেয়?
| ইঞ্জিন | গতি | সর্বোচ্চ মেমরি | ডাউনলোড |
|---|---|---|---|
| SenseVoice Small | 162.3× রিয়েল-টাইম | 0.95 GiB | 827 MB |
| Parakeet V3 | 75.6× রিয়েল-টাইম | 0.09 GiB | 465 MB |
| Apple Speech | 30.8× রিয়েল-টাইম | জানানো হয়নি | ভাষার প্যাক macOS ডাউনলোড করে, অ্যাপ নয় |
| Qwen3-ASR 1.7B | 11.1× রিয়েল-টাইম | 2.43 GiB | প্রায় 2.5 GB |
| Whisper Small | 7.9× রিয়েল-টাইম | 0.87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3.0× রিয়েল-টাইম | 1.87 GiB | প্রায় 1.6 GB |
এই পোস্ট যে তেরোটি ভাষা পরিষ্কারভাবে মাপে সেগুলোর মধ্যে প্রতিটি ইঞ্জিনের মধ্যম মানই গতি, শুধু যেগুলোতে সেটি চলেছে সেগুলো গণনা করে — এটি আলাদা আইটেম প্রক্রিয়াকরণের থ্রুপুট, একটি ডায়াগনস্টিক, পণ্যের লেটেন্সি নয়। সর্বোচ্চ মেমরি এই রানে প্রসেস-গ্রুপের সর্বোচ্চ মান। Apple Speech এমন macOS সার্ভিসে ডিকোড করে যার মালিক কল করা অ্যাপ নয়, তাই সেখানকার কোনো সংখ্যা অন্য পাঁচটির মতো একই অর্থ দেবে না।
Apple Speech-এর ভাষার অ্যাসেট সিস্টেম একবার ডাউনলোড করে এবং সব অ্যাপ ভাগ করে। অ্যাপের ভেতর কিছু সরবরাহ হয় না এবং অ্যাপের নিজস্ব প্রসেসে কিছু বরাদ্দ হয় না। কাজের সময় সিস্টেম সার্ভিস তবু মেমরি ব্যবহার করে, আর আমরা সেটি ঠিকভাবে আলাদা করতে পারি না; তাই শূন্য লেখার বদলে সেখানে কোনো সংখ্যা জানাই না। এটি 30.8× রিয়েল-টাইমে চলেছে, Parakeet V3 ও SenseVoice Small-এর পেছনে।
Whisper Large V3 Turbo দশটি সারির চারটিতে এগিয়ে এবং এখানে সবচেয়ে ধীর ইঞ্জিন; ডিস্কে প্রায় 1.6 GB নিয়ে এটি Apple Speech-এর চেয়ে প্রায় দশ গুণ ধীর। Qwen3-ASR 1.7B বাকি ছয়টিতে এগিয়ে, প্রায় 2.5 GB এবং 2.43 GiB মেমরি নিয়ে। Parakeet V3-এর আকার 465 MB ও পিক 0.09 GiB; ফরাসিতে Turbo-এর আগে, পোলিশে পেছনে এবং এতে জাপানি, কোরীয়, চীনা বা ক্যান্টনিজ নেই। 600 MB-এর Whisper Small সবচেয়ে কাছের তুলনা, আর উভয়ের জন্য পরিষ্কারভাবে মাপা দশ ভাষার আটটিতে Apple Speech বেশি নির্ভুল ছিল।
ডাউনলোড করা মডেলের বদলে কি Apple Speech ব্যবহার করবেন?
ভাষা অনুযায়ী:
- ইংরেজি: ভালো বিকল্প নয়। Apple Speech-এর স্কোর 8.80; Qwen3-ASR 1.7B (4.49) বা Whisper Large V3 Turbo (5.49) স্পষ্টতই বেশি নির্ভুল।
- জার্মান: ভালো বিকল্প নয়। Apple Speech-এর স্কোর 6.26; Qwen3-ASR 1.7B (2.85) বা Whisper Large V3 Turbo (4.05) স্পষ্টতই বেশি নির্ভুল।
- ডাচ, রুশ ও পোলিশ: এই তিন ভাষায় Apple Speech-এর কোনো মডেল নেই। Whisper Large V3 Turbo যথাক্রমে 5.69, 5.13 ও 5.45 নিয়ে প্রতিটিতে সবচেয়ে নির্ভুল ছিল।
- জাপানি: ব্যবহারযোগ্য। Apple Speech-এর স্কোর 6.36, যা Whisper Large V3 Turbo-এর 5.30-এর পেছনে।
- কোরীয়: ব্যবহারযোগ্য। Apple Speech-এর স্কোর 4.31, যা Qwen3-ASR 1.7B-এর 3.54-এর পেছনে।
- ফরাসি: ভালো বিকল্প নয়। Apple Speech-এর স্কোর 7.61; Qwen3-ASR 1.7B (4.57) বা Parakeet V3 (5.83) স্পষ্টতই বেশি নির্ভুল।
- চীনা: ব্যবহারযোগ্য। Apple Speech-এর স্কোর 7.97, যা Whisper Large V3 Turbo-এর সমান; সবচেয়ে নির্ভুল ছিল Qwen3-ASR 1.7B 6.49 স্কোর নিয়ে।
- স্প্যানিশ: ভালো বিকল্প নয়। Apple Speech-এর স্কোর 5.41; Qwen3-ASR 1.7B (3.38) বা Whisper Large V3 Turbo (3.62) স্পষ্টতই বেশি নির্ভুল।
Apple Speech এই পোস্টে Apple-এর তৈরি SpeechTranscriber-এর সংক্ষিপ্ত নাম, ডিভাইসে চলা API-টি যেকোনো Mac অ্যাপ macOS 26 বা পরের সংস্করণে কল করতে পারে। এটি সেই মডেলগুলোর একটি নয় যেগুলো Mac-এর জন্য Whisper Notes ডাউনলোড করে: Mac Direct Download (DMG) বিল্ডে সেগুলো Whisper, Parakeet V3, SenseVoice ও Qwen3-ASR, আর iPhone ও Mac App Store বিল্ডে Whisper, Parakeet V3 ও SenseVoice। প্রতি ইঞ্জিনের টেবিল আমাদের ভাষা সমর্থন পৃষ্ঠায় আছে।
এখানকার কিছুই আজ Mac-এর জন্য Whisper Notes যা করে তা বদলায় না: Parakeet V3 এখনও ডিফল্ট।
সাধারণ জিজ্ঞাসা
Apple Speech কি Whisper-এর মতো নির্ভুল?
দুটির সমর্থিত বেশির ভাগ ভাষায় নয়। আমাদের নিজেদের FLEURS রানে এই দশটির মধ্যে Apple Speech-এর সমর্থিত সাত ভাষার ছয়টিতে Whisper Large V3 Turbo বেশি নির্ভুল, আর চীনা ভাষায় দুটো ঠিক সমান, প্রতিটির 7.97% CER। Whisper Small-এর বিপরীতে ক্রম উল্টে যায়: Apple Speech সাতটির ছয়টিতে এগিয়ে এবং শুধু ইংরেজিতে 7.04%-এর বিপরীতে 8.80% WER নিয়ে পিছিয়ে। এই রানে পরিষ্কারভাবে মাপা কোনো ভাষায় এটি সেরা নয়; কোরীয় ভাষায় সবচেয়ে কাছে, সারির সেরা 3.54%-এর বিপরীতে 4.31% CER। ক্যান্টনিজ একমাত্র পরিষ্কারভাবে মাপা ভাষা যেখানে এটি Whisper Large V3 Turbo-কে হারিয়েছে, 36.75%-এর বিপরীতে 8.69% CER। আপনার ভাষা সমর্থিত এবং ভাষার প্যাকটি macOS-কে পরিচালনা করতে দিতে চাইলে বিল্ট-ইন ইঞ্জিন ব্যবহার করুন; সবচেয়ে নির্ভুল ফলের জন্য, অথবা এখানে Apple Speech-এ না থাকা তিন ভাষার একটির জন্য Whisper Large V3 Turbo ব্যবহার করুন।
Apple Speech কোন কোন ভাষা সমর্থন করে?
তালিকাটি macOS ঠিক করে, কোনো অ্যাপ নয়। এই রানে Apple Speech আমাদের পরীক্ষা করা 83টি ভাষা কনফিগারেশনের 21টিতে ফল দিয়েছে; উভয় Whisper বিল্ড 83টি, Qwen3-ASR 1.7B 30টি এবং Parakeet V3 25টিতে। মূল টেবিলের এই দশ ভাষার মধ্যে এতে ইংরেজি, জার্মান, জাপানি, কোরীয়, ফরাসি, চীনা ও স্প্যানিশ আছে, তবে ডাচ, পোলিশ বা রুশ নেই। দ্বিতীয় টেবিলে অন্য চৌদ্দটি কনফিগারেশন: ইতালীয়, ক্যান্টনিজ, ব্রাজিলীয় পর্তুগিজ এবং এগারোটি ভাষা যেখানে এটি নিজস্ব লিপির বদলে ল্যাটিন লিপ্যন্তরণে উত্তর দিয়েছে। কোনো মেশিনে কোন ভাষা আছে তা অ্যাপকে রানটাইমে macOS-এর কাছে জানতে হয়। আপনার ভাষা না থাকলে Whisper প্রতিটি চ্যানেলে অ্যাপের তালিকার সব ভাষায় পৌঁছায়।
Apple Speech না Parakeet V3 — কোনটি?
দুটির সমর্থিত প্রতিটি ইউরোপীয় ভাষায় Parakeet V3। ইংরেজিতে এটি 8.80-এর বিপরীতে 6.89, ফরাসিতে 7.61-এর বিপরীতে 5.83, স্প্যানিশে 5.41-এর বিপরীতে 4.86, ইতালীয়তে 4.39-এর বিপরীতে 3.43 এবং ব্রাজিলীয় পর্তুগিজে 9.35-এর বিপরীতে 6.49 স্কোর করেছে; জার্মানে দুটোই 6.26। Parakeet V3-তে জাপানি, কোরীয়, চীনা বা ক্যান্টনিজ নেই, তাই সেখানে দুটির মধ্যে শুধু Apple Speech আছে, যা জাপানি, কোরীয় ও চীনা ভাষায় সারির সেরা মানের 1.5 পয়েন্টের মধ্যে। Parakeet V3-এর ডাউনলোড 465 MB এবং এটি 0.09 GiB পিক নিয়ে 75.6× রিয়েল-টাইমে চলেছে; Apple Speech-এর ভাষার প্যাক macOS ডাউনলোড করে এবং এটি এমন মেমরি নিয়ে 30.8×-এ চলেছে যা আমরা জানাই না।
SpeechAnalyzer কী, আর এটি কি Apple Dictation-এর মতোই?
SpeechAnalyzer হলো সেই বিস্তৃত API যা Apple WWDC 2025-এ চালু করে এবং macOS 26 ও iOS 26-এ সরবরাহ করে। এর ভেতরের ট্রান্সক্রিপশন অপারেটিং পয়েন্ট SpeechTranscriber; আমরা সেটিই মেপেছি এবং এই পোস্টে সেটিকেই Apple Speech বলা হয়েছে। Dictation হলো কম্প্যাটিবিলিটি অপারেটিং পয়েন্ট, সেটিও আমরা চালিয়েছি: উভয়ের পরিষ্কারভাবে সামলানো সব দশ ভাষায় Apple Speech বেশি নির্ভুল, মাঝের ভাষার প্রায় এক-তৃতীয়াংশ এবং ফরাসি ও জার্মানের অর্ধেকের বেশি ত্রুটি বাদ দিয়েছে। Dictation আরও বেশি ভাষা কভার করে, 21টির বিপরীতে 33টি কনফিগারেশন, তাই আপনি 17.34%, 13.50% ও 13.13% WER মেনে নিতে পারলে ডাচ, পোলিশ বা রুশের জন্য এটিই সিস্টেম ইঞ্জিন। একই ক্লিপে Whisper Large V3 Turbo-এর স্কোর 5.69%, 5.45% ও 5.13%।
Apple Speech ব্যবহার করলে অডিও কি আমার Mac-এর বাইরে যায়?
Apple-এর নথিতে SpeechTranscriber-কে ডিভাইসে চলা স্পিচ রিকগনিশন বলা হয়েছে: macOS ভাষার অ্যাসেট একবার ডাউনলোড করে এবং শনাক্তকরণ স্থানীয়ভাবে চলে। আমরা নির্ভুলতা ও গতি মেপেছি, নেটওয়ার্কের আচরণ নয়, তাই ওই অংশ Apple যেভাবে বর্ণনা করে সেভাবেই বলি। Whisper Notes নিজে যে ইঞ্জিনগুলো ডাউনলোড করে — Whisper, Parakeet V3, SenseVoice ও Qwen3-ASR — সেগুলো আপনার নিজের Mac-এর GPU বা Neural Engine-এ কোনো অ্যাকাউন্ট ও API key ছাড়া চলে, আর প্রতিটি চ্যানেলে নেটওয়ার্ক বন্ধ থাকলেও ট্রান্সক্রিপশন কাজ করে।
এই সংখ্যাগুলো আমার রেকর্ডিংয়ের নির্ভুলতার সঙ্গে মেলে না কেন?
কারণ FLEURS ছোট, পরিষ্কার ও পড়ে শোনানো স্পিচ, আর আপনার রেকর্ডিং তা নয়। আমাদের রান একটি উন্মুক্ত ডেটাসেটে ক্যালিব্রেশন: প্রতি ভাষায় প্রায় 150টি বাক্য ও 30 মিনিট অডিও, একটি M5 MacBook Air এবং প্রতিটি ইঞ্জিনের জন্য একই ক্লিপ। এটি বলে কোনো ইঞ্জিন একটি ভাষার জন্য সম্ভাব্য বিকল্প কি না, মিটিং, কোলাহলপূর্ণ অডিও, উচ্চারণযুক্ত স্পিচ বা দুই ঘণ্টার ফাইলে কী পাবেন তা নয়।
অন্য বেঞ্চমার্কগুলো কেন বলে Apple Speech Whisper-এর চেয়ে ভালো?
কারণ সেগুলো তুলনা করে Whisper Small-এর সঙ্গে, আর কেবল ইংরেজিতে। Whisper Small-এর ক্ষেত্রে আমাদের ফলও একই: উভয়ের জন্য পরিষ্কারভাবে মাপা দশ ভাষার আটটিতে Apple Speech এগিয়ে ছিল। যে দুটিতে এটি হেরেছে তার একটি ইংরেজি, 7.04-এর বিপরীতে 8.80। Whisper Large V3 Turbo-এর বেলায় ফলটি আর টেকে না: ওই দশ ভাষার আটটিতে Apple Speech পিছিয়ে, চীনা ভাষায় 7.97 নিয়ে সমান এবং এগিয়ে কেবল ক্যান্টনিজে। কোন Whisper-কে তুলনায় রাখা হচ্ছে, সেটিই শিরোনাম ঠিক করে।
চেষ্টা করে দেখুন
এখানকার ডাউনলোডযোগ্য পাঁচটি মডেল — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small ও Qwen3-ASR 1.7B — সবই Mac-এর জন্য Whisper Notes-এর Direct Download (DMG) বিল্ডে সেটিংস, তারপর ট্রান্সক্রিপশন মডেল-এর অধীনে আছে।
আমাদের সংখ্যা কোনো ভাষায় আপনার অভিজ্ঞতার সঙ্গে না মিললে ইমেল করুন mac@whispernotes.app। সম্পূর্ণ রিলিজ নোট: whispernotes.app/changelog।
উৎস: Google FLEURS-এর রিভিশন 70bb2e84-এর টেস্ট স্প্লিটে আমাদের রান, Apple-এর SpeechAnalyzer নথি এবং আগের ত্রিশ-ভাষার Qwen3-ASR রান।