Mistral প্রকাশ করেছে Voxtral — ট্রান্সক্রিপশন ও অডিও বোঝাপড়ার জন্য তাদের প্রথম ওপেন-ওয়েট মডেল পরিবার। অফিসিয়াল বেঞ্চমার্কগুলো শক্তিশালী বহুভাষিক স্পিচ রেকগনিশন ও অডিও Q&A দেখায়, তবে দুটি মডেল আকারের হার্ডওয়্যার চাহিদা একেবারে আলাদা। এখানে বলা হলো এই রিলিজ আসলে কী সমর্থন করে এবং কেন Whisper Notes এখনও কনজিউমার Apple হার্ডওয়্যারে ছোট, ট্রান্সক্রিপশন-কেন্দ্রিক মডেল ব্যবহার করে।
দুটি মডেল
Mistral জুলাই 2025-এ দুটি Apache-2.0 চেকপয়েন্ট প্রকাশ করেছে:
Voxtral Small 24B
- •24 বিলিয়ন প্যারামিটার
- •ট্রান্সক্রিপশন, অনুবাদ, অডিও Q&A এবং সারসংক্ষেপ
- •32k কনটেক্সট উইন্ডো
- •bf16/fp16-এ প্রায় 55 GB GPU RAM
Voxtral Mini 3B
- •3 বিলিয়ন প্যারামিটার
- •একই অডিও-ও-টেক্সট টাস্ক পরিবার, একটি ছোট চেকপয়েন্টে
- •অফিসিয়ালভাবে লোকাল ও এজ ডিপ্লয়মেন্টের জন্য নির্ধারিত
- •bf16/fp16-এ প্রায় 9.5 GB GPU RAM
ওপেন ওয়েট এবং লাইসেন্স
2025-এর দুটি চেকপয়েন্টই Apache 2.0 লাইসেন্সের অধীনে ওপেন ওয়েট। আপনি নিজেই এগুলো ডাউনলোড করে চালাতে পারেন:
- ✓ সম্পূর্ণ মডেল ওয়েট উপলব্ধ
- ✓ Apache 2.0 লাইসেন্সের মধ্যে এগুলো সেলফ-হোস্ট করুন বা নিজের প্রয়োজনে মানিয়ে নিন
- ✓ সেলফ-হোস্ট করলে কোনো Mistral API ফি নেই; তবে নিজের কম্পিউটের খরচ আপনাকেই বহন করতে হবে
- ✓ নিজের সার্ভারে অডিও প্রসেস করুন
সূত্র: Mistral-এর Voxtral রিলিজ, অফিসিয়াল Voxtral Small মডেল কার্ড এবং অফিসিয়াল Voxtral Mini মডেল কার্ড।
বেঞ্চমার্ক
Mistral-এর রিলিজ ইংরেজি শর্ট-ফর্ম ও লং-ফর্ম সেট, Mozilla Common Voice, FLEURS এবং Multilingual LibriSpeech জুড়ে ম্যাক্রো-গড word error rate তুলনা করে। Mistral-এর রিপোর্ট করা FLEURS ফলাফলে Voxtral Small প্রতিটি মূল্যায়িত টাস্কে Whisper-কে ছাড়িয়ে যায়। WER যত কম, তত ভালো:
Mistral-এর লঞ্চ বেঞ্চমার্কের FLEURS WER, আনুমানিক API মূল্যের বিপরীতে প্লট করা; বেঞ্চমার্ক ফলাফল ও মূল্য দুটোই বদলাতে পারে
FLEURS ট্রান্সক্রিপশন মানের কেবল একটি অংশ। এগুলো ভেন্ডর-রিপোর্ট করা ফলাফল, তাই কোনো মডেল বেছে নেওয়ার আগে প্রকাশিত বেঞ্চমার্ক সংজ্ঞাগুলো তুলনা করুন এবং নিজের ভাষা, মাইক্রোফোন ও রেকর্ডিং পরিস্থিতিতে পরীক্ষা করুন।
Voxtral বনাম Whisper: আপনার কোনটি ব্যবহার করা উচিত?
বেঞ্চমার্ক গল্পের কেবল একটি অংশ বলে। আপনি যদি সত্যিই নিজে কোনো মডেল চালাতে চান, তবে যে বিষয়গুলো গুরুত্বপূর্ণ সেগুলোতে দুটি মডেল পরিবার কীভাবে তুলনীয় তা এখানে দেওয়া হলো:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| ভাষা | 8টি প্রধান ভাষা | 8টি প্রধান ভাষা | 100+ | 100+ |
| ওপেন সোর্স | হ্যাঁ | হ্যাঁ | হ্যাঁ | হ্যাঁ |
| মডেলের আকার | 24B প্যারামিটার; bf16/fp16-এ ~55 GB GPU RAM | 3B প্যারামিটার; bf16/fp16-এ ~9.5 GB GPU RAM | 1.55B প্যারামিটার | 809M প্যারামিটার (~1.6 GB) |
| কনজিউমার Mac-এ ব্যবহারিক | সাধারণ হার্ডওয়্যারে ফুল প্রিসিশনে নয় | সামঞ্জস্যপূর্ণ রানটাইমে সম্ভব; Turbo-র চেয়ে ভারী | হ্যাঁ | হ্যাঁ |
রায়: Voxtral Small শক্তিশালী WER ফলাফল রিপোর্ট করে এবং এমন অডিও বোঝাপড়া যোগ করে যা Whisper করার চেষ্টাই করে না। Voxtral Mini হলো সেই চেকপয়েন্ট যাকে Mistral লোকাল ও এজ ডিপ্লয়মেন্টের জন্য নির্ধারণ করে, কিন্তু তার অফিসিয়াল মডেল কার্ড এখনও bf16/fp16-এ প্রায় 9.5 GB GPU RAM উল্লেখ করে। একটি কনজিউমার ট্রান্সক্রিপশন অ্যাপের জন্য Whisper Large-v3 Turbo এখনও শিপ করা সহজ এবং অনেক বেশি ভাষা কভার করে। এ কারণেই Whisper Notes বর্তমানে Voxtral-এর পরিবর্তে Whisper Turbo-কে Parakeet V3 ও SenseVoice-এর সঙ্গে যুক্ত করে ব্যবহার করে।
API এবং সেলফ-হোস্টিং খরচ
10 জুলাই 2026-এ যাচাই করা অনুযায়ী, Mistral-এর মডেল কার্ড Voxtral Small-এর অডিও ইনপুটের মূল্য প্রতি মিনিটে $0.004 উল্লেখ করে। অডিও-বোঝাপড়া অনুরোধে টেক্সট ইনপুট এবং জেনারেট করা টেক্সটের বিল আলাদাভাবে ধরা হয়। আপনি যদি Apache-2.0 ওয়েট সেলফ-হোস্ট করেন, তবে কোনো Mistral API চার্জ নেই, কিন্তু হার্ডওয়্যার ও অপারেশনের খরচ আপনাকে বহন করতে হয়।
Mistral API
সেলফ-হোস্টেড ওয়েট
এটি কীভাবে কাজ করে
অফিসিয়াল মডেল কার্ড Voxtral-কে একটি অডিও এনকোডার ও নিবেদিত ট্রান্সক্রিপশন মোডসহ একটি language-model ব্যাকবোন হিসেবে বর্ণনা করে। প্রোডাক্টের গুরুত্বপূর্ণ সীমাগুলো সুনির্দিষ্ট:
1. মাল্টিমোডাল আর্কিটেকচার
Voxtral কেবল একটি স্পিচ-টু-টেক্সট ডিকোডার হিসেবে কাজ করার পরিবর্তে একই কথোপকথনে অডিও ও টেক্সট দুটোই গ্রহণ করে:
- •সরাসরি ট্রান্সক্রিপশনের জন্য নিবেদিত মোড
- •অডিও Q&A এবং কাঠামোবদ্ধ সারসংক্ষেপ
- •একাধিক অডিও ইনপুট এবং মাল্টি-টার্ন অডিও কথোপকথন
লং-ফর্ম সীমা
32k কনটেক্সট উইন্ডো ট্রান্সক্রিপশনের জন্য 30 মিনিট পর্যন্ত এবং বৃহত্তর অডিও বোঝাপড়ার জন্য 40 মিনিট পর্যন্ত অডিও সমর্থন করে।
2. ভাষা এবং মূল্যায়ন
Mistral স্বয়ংক্রিয় শনাক্তকরণসহ আটটি প্রধান ভাষা তালিকাভুক্ত করে:
- •ইংরেজি, স্প্যানিশ, ফরাসি, পর্তুগিজ, হিন্দি, জার্মান, ডাচ এবং ইতালীয়
- •বেঞ্চমার্কে FLEURS, Mozilla Common Voice এবং Multilingual LibriSpeech অন্তর্ভুক্ত
- •রিলিজটি ইংরেজি শর্ট-ফর্ম ও লং-ফর্ম অডিও আলাদাভাবেও মূল্যায়ন করে
3. ডিপ্লয়মেন্ট প্রয়োজনীয়তা
ওপেন ওয়েট মানে এই নয় যে প্রতিটি চেকপয়েন্ট প্রতিটি ডিভাইসের জন্য যথেষ্ট ছোট:
- •Voxtral Small-এর মডেল কার্ড অনুযায়ী bf16/fp16-এ প্রায় 55 GB GPU RAM প্রয়োজন
- •Voxtral Mini হলো লোকাল ও এজ ডিপ্লয়মেন্টের জন্য তৈরি 3B চেকপয়েন্ট
- •প্রকাশিত চেকপয়েন্ট সার্ভ করার জন্য Mistral vLLM সুপারিশ করে
4. মূল বৈশিষ্ট্য
প্রাসঙ্গিক বোঝাপড়া
32k কনটেক্সট সীমার মধ্যে সরাসরি অডিও থেকে প্রশ্নের উত্তর দিতে এবং সারসংক্ষেপ তৈরি করতে পারে।
বহুভাষিক
স্বয়ংক্রিয়ভাবে আটটি প্রধান ভাষা শনাক্ত করে ট্রান্সক্রাইব করে: ইংরেজি, স্প্যানিশ, ফরাসি, পর্তুগিজ, হিন্দি, জার্মান, ডাচ এবং ইতালীয়।
শব্দ সামলানো
অফিসিয়াল মূল্যায়নে বিভিন্ন স্পিচ ডেটাসেট অন্তর্ভুক্ত, কিন্তু Mistral প্রতিটি কোলাহলপূর্ণ রেকর্ডিংয়ের জন্য কোনো ঢালাও গ্যারান্টি প্রকাশ করে না।
এজ ডিপ্লয়মেন্ট
Voxtral Mini হলো লোকাল ও এজ বিকল্প। এর অফিসিয়াল মডেল কার্ড bf16/fp16-এ প্রায় 9.5 GB GPU RAM উল্লেখ করে।
5. আর্কিটেকচার
তিনটি প্রধান উপাদান:
- 1. অডিও এনকোডার: ওয়েভফর্মকে শেখা অডিও উপস্থাপনায় রূপান্তর করে
- 2. প্রজেক্টর: অডিও উপস্থাপনাকে language model-এর hidden space-এ ম্যাপ করে
- 3. Language-model ব্যাকবোন: ট্রান্সক্রিপ্ট, উত্তর, সারসংক্ষেপ বা টুল কল জেনারেট করে
এই ডিজাইনই ব্যাখ্যা করে কেন Voxtral ট্রান্সক্রিপশনের চেয়ে বেশি কিছু করতে পারে, কিন্তু একই কারণে এটি Whisper Turbo-র মতো শুধু-ট্রান্সক্রিপশন মডেলের তুলনায় অনেক বড় language-model ওয়েটও বহন করে।
কেন Whisper Notes এখনও যুক্তিসঙ্গত
Voxtral এবং Whisper Notes আলাদা সমস্যার সমাধান করে। Voxtral ট্রান্সক্রিপশনকে অডিও বোঝাপড়ার সঙ্গে যুক্ত করে; Whisper Notes এমন প্রাইভেট ট্রান্সক্রিপশনে মনোযোগ দেয় যা কনজিউমার Apple হার্ডওয়্যারে সহজে চালানো যায়।
Whisper Notes যা দেয়
প্রাইভেসি
- •100% অফলাইন প্রসেসিং
- •কোনো ডেটা ট্রান্সমিশন নেই
- •কোনো ক্লাউড নির্ভরতা নেই
পারফরম্যান্স
- •Whisper প্রযুক্তি, প্রমাণিত নির্ভুলতা
- •Apple Silicon-এর জন্য অপ্টিমাইজড
- •নির্ভরযোগ্য ফলাফল
খরচ
- •Whisper Notes-এ সাবস্ক্রিপশন নয়, একবারের কেনাকাটা। App Store-এ একবার কিনলে iPhone, iPad ও Mac App Store সংস্করণ পাওয়া যায়; ওয়েবসাইটের DMG সংস্করণ আলাদাভাবে বিক্রি হওয়া এককালীন লাইসেন্স। দাম সংশ্লিষ্ট কেনার চ্যানেলে দেখানো হয়।
- •কোনো প্রতি-মিনিট চার্জ নেই
- •সীমাহীন ট্রান্সক্রিপশন
ব্যবহারকারীর অভিজ্ঞতা
- •সরল ইন্টারফেস
- •নিয়মিত আপডেট
- •ক্রমাগত উন্নতি
স্টোরেজ প্রয়োজনীয়তা
ফুল প্রিসিশনে Voxtral Small একটি সার্ভার-শ্রেণির মডেল: এর অফিসিয়াল কার্ড প্রায় 55 GB GPU RAM উল্লেখ করে। Voxtral Mini বিশেষভাবে লোকাল ও এজ ব্যবহারের জন্য তৈরি, কিন্তু এর কার্ডও bf16/fp16-এ প্রায় 9.5 GB GPU RAM উল্লেখ করে। Whisper Turbo-র অ্যাপ ডাউনলোড প্রায় 1.6 GB, যা বর্তমান Whisper Notes প্রোডাক্টের জন্য বেশি উপযুক্ত।
Whisper Notes ব্যবহার করে Whisper Large-v3 Turbo — এটি দৈনন্দিন ব্যবহারের জন্য পারফরম্যান্স, গতি এবং VRAM প্রয়োজনীয়তার মধ্যে ভারসাম্য রক্ষা করে। যুক্তিসঙ্গত রিসোর্স প্রয়োজনীয়তাসহ আরও ভালো মডেল উপলব্ধ হলে আমরা সেগুলোতে আপগ্রেড করব।
অডিও Q&A, সারসংক্ষেপ বা সেলফ-হোস্টেড সার্ভার ডিপ্লয়মেন্ট যখন গুরুত্বপূর্ণ, তখন Voxtral আকর্ষণীয়। Whisper Notes সেই ব্যক্তিগত ব্যবহারকারীদের জন্য, যারা প্রাইভেট ট্রান্সক্রিপশন এবং কোনো পুনরাবৃত্ত সাবস্ক্রিপশন চান না।
এর অর্থ কী
Voxtral সাধারণ স্পিচ রেকগনিশনের বাইরে একটি গুরুত্বপূর্ণ ওপেন-ওয়েট পদক্ষেপ, কারণ এটি অডিও ট্রান্সক্রাইব করার পাশাপাশি তার উপর যুক্তিও করতে পারে।
Mac এবং iPhone-এ প্রাইভেট অফলাইন ট্রান্সক্রিপশনের জন্য, ছোট বিশেষায়িত ইঞ্জিনগুলো প্যাকেজ করা এবং ধারাবাহিকভাবে চালানো এখনও সহজ।
সব লোকাল বিকল্প তুলনা করছেন? প্রতিটি অন-ডিভাইস স্পিচ-টু-টেক্সট মডেল — Whisper ভ্যারিয়েন্ট, Parakeet V3, SenseVoice এবং Voxtral — আমাদের Whisper মডেল তুলনা পেজে পাশাপাশি তুলনা করা হয়েছে।
প্রায়শই জিজ্ঞাসিত প্রশ্ন
Mistral Voxtral কী?
Voxtral হলো স্পিচ ট্রান্সক্রিপশন ও অডিও বোঝাপড়ার জন্য Mistral-এর ওপেন-ওয়েট মডেল পরিবার। জুলাই 2025-এর রিলিজে সার্ভার-শ্রেণির ওয়ার্কলোডের জন্য Voxtral Small 24B এবং লোকাল ও এজ ডিপ্লয়মেন্টের জন্য Voxtral Mini 3B অন্তর্ভুক্ত। উভয় চেকপয়েন্টই Apache 2.0 লাইসেন্স ব্যবহার করে।
Voxtral কি Mac-এ লোকালি চলতে পারে?
ডাউনলোডযোগ্য ওয়েট সেলফ-হোস্ট করা যায়, কিন্তু দুটি আকারের প্রয়োজনীয়তা আলাদা। Voxtral Small-এর bf16/fp16-এ প্রায় 55 GB GPU RAM দরকার, তাই এটি একটি সার্ভার-শ্রেণির পছন্দ। Voxtral Mini হলো লোকাল ও এজ চেকপয়েন্ট; এর মডেল কার্ড bf16/fp16-এ প্রায় 9.5 GB উল্লেখ করে, এবং Mac-এ প্রকৃত গতি ও মেমরি ব্যবহার রানটাইম ও কোয়ান্টাইজেশনের উপর নির্ভর করে।
Whisper Notes কি Voxtral ব্যবহার করে?
না। Whisper Notes চালায় Parakeet V3 (Mac ডিফল্ট), Whisper Large-v3 Turbo এবং SenseVoice — এই মডেলগুলো বেছে নেওয়া হয়েছে কারণ এগুলো Apple Silicon-এ দৈনন্দিন ব্যবহারের জন্য পারফরম্যান্স, গতি এবং VRAM প্রয়োজনীয়তার মধ্যে ভারসাম্য রক্ষা করে। কনজিউমার হার্ডওয়্যারে চালানোর মতো ব্যবহারিক হলেই আমরা আরও ভালো মডেল গ্রহণ করব।
Voxtral কতগুলো ভাষা সমর্থন করে?
অফিসিয়াল মডেল কার্ডগুলো স্বয়ংক্রিয় শনাক্তকরণসহ আটটি প্রধান ভাষা তালিকাভুক্ত করে: ইংরেজি, স্প্যানিশ, ফরাসি, পর্তুগিজ, হিন্দি, জার্মান, ডাচ এবং ইতালীয়। Mistral FLEURS-এ আরবিরও মূল্যায়ন করে, কিন্তু সেটি মডেল কার্ডের প্রধান-ভাষার তালিকায় অন্তর্ভুক্ত নয়।
Mistral Voxtral কবে প্রকাশিত হয়েছিল?
Mistral 15 জুলাই 2025-এ Voxtral প্রকাশ করেছিল। প্রাথমিক Apache-2.0 চেকপয়েন্টগুলো ছিল Voxtral Small 24B এবং Voxtral Mini 3B।