Mistral Voxtral vs GPT-4o | स्पीच AI बेंचमार्क

2 अगस्त 2025
·
8 min read
·Whisper Notes Team

Mistral ने Voxtral रिलीज़ किया है — ट्रांसक्रिप्शन और ऑडियो समझ के लिए उसका पहला ओपन-वेट मॉडल परिवार। आधिकारिक बेंचमार्क मज़बूत बहुभाषी स्पीच रिकग्निशन और ऑडियो Q&A दिखाते हैं, जबकि दोनों मॉडल आकारों की हार्डवेयर ज़रूरतें बहुत अलग हैं। यहाँ बताया गया है कि यह रिलीज़ वास्तव में क्या सपोर्ट करती है और क्यों Whisper Notes आज भी कंज़्यूमर Apple हार्डवेयर पर छोटे, ट्रांसक्रिप्शन-केंद्रित मॉडल इस्तेमाल करता है।

Mistral Voxtral प्रदर्शन बेंचमार्क

दो मॉडल

Mistral ने जुलाई 2025 में दो Apache-2.0 चेकपॉइंट रिलीज़ किए:

Voxtral Small 24B

  • 24 अरब पैरामीटर
  • ट्रांसक्रिप्शन, अनुवाद, ऑडियो Q&A और सारांश
  • 32k कॉन्टेक्स्ट विंडो
  • bf16/fp16 में लगभग 55 GB GPU RAM

Voxtral Mini 3B

  • 3 अरब पैरामीटर
  • वही ऑडियो-और-टेक्स्ट टास्क परिवार, एक छोटे चेकपॉइंट में
  • आधिकारिक रूप से लोकल और एज डिप्लॉयमेंट के लिए पोज़िशन किया गया
  • bf16/fp16 में लगभग 9.5 GB GPU RAM

ओपन वेट्स और लाइसेंस

2025 के दोनों चेकपॉइंट Apache 2.0 लाइसेंस के तहत ओपन वेट्स हैं। आप इन्हें खुद डाउनलोड करके चला सकते हैं:

  • पूरे मॉडल वेट्स उपलब्ध
  • Apache 2.0 लाइसेंस के दायरे में इन्हें सेल्फ-होस्ट करें या अपने हिसाब से ढालें
  • सेल्फ-होस्टिंग पर कोई Mistral API शुल्क नहीं; अपने कंप्यूट का खर्च फिर भी आपको ही उठाना होगा
  • ऑडियो को अपने ही सर्वरों पर प्रोसेस करें

स्रोत: Mistral की Voxtral रिलीज़, आधिकारिक Voxtral Small मॉडल कार्ड और आधिकारिक Voxtral Mini मॉडल कार्ड

बेंचमार्क

Mistral की रिलीज़ अंग्रेज़ी शॉर्ट-फ़ॉर्म और लॉन्ग-फ़ॉर्म सेट, Mozilla Common Voice, FLEURS और Multilingual LibriSpeech पर मैक्रो-औसत word error rate की तुलना करती है। Mistral के रिपोर्ट किए गए FLEURS नतीजों में Voxtral Small हर मूल्यांकित टास्क पर Whisper से आगे रहता है। WER जितना कम हो, उतना बेहतर:

सभी मॉडलों में Voxtral WER बेंचमार्क तुलना

Mistral के लॉन्च बेंचमार्क का FLEURS WER, अनुमानित API कीमत के मुकाबले प्लॉट किया गया; बेंचमार्क नतीजे और कीमतें दोनों बदल सकते हैं

FLEURS ट्रांसक्रिप्शन गुणवत्ता का सिर्फ़ एक पहलू है। ये वेंडर द्वारा रिपोर्ट किए गए नतीजे हैं, इसलिए मॉडल चुनने से पहले प्रकाशित बेंचमार्क परिभाषाओं की तुलना करें और अपनी भाषाओं, माइक्रोफ़ोन और रिकॉर्डिंग परिस्थितियों में खुद परीक्षण करें।

Voxtral बनाम Whisper: आपको कौन-सा इस्तेमाल करना चाहिए?

बेंचमार्क कहानी का सिर्फ़ एक हिस्सा बताते हैं। अगर आप वाकई इनमें से कोई मॉडल खुद चलाना चाहते हैं, तो जो बातें मायने रखती हैं उन पर दोनों मॉडल परिवारों की तुलना यह रही:

Voxtral Small Voxtral Mini Whisper Large v3 Whisper Large-v3 Turbo
भाषाएँ 8 प्रमुख भाषाएँ 8 प्रमुख भाषाएँ 100+ 100+
ओपन सोर्स हाँ हाँ हाँ हाँ
मॉडल आकार 24B पैरामीटर; bf16/fp16 में ~55 GB GPU RAM 3B पैरामीटर; bf16/fp16 में ~9.5 GB GPU RAM 1.55B पैरामीटर 809M पैरामीटर (~1.6 GB)
कंज़्यूमर Mac पर व्यावहारिक सामान्य हार्डवेयर पर फ़ुल प्रिसिज़न में नहीं संगत रनटाइम के साथ संभव; Turbo से भारी हाँ हाँ

निष्कर्ष: Voxtral Small मज़बूत WER नतीजे रिपोर्ट करता है और ऐसी ऑडियो समझ जोड़ता है जिसकी Whisper कोशिश ही नहीं करता। Voxtral Mini वह चेकपॉइंट है जिसे Mistral लोकल और एज डिप्लॉयमेंट के लिए पोज़िशन करता है, लेकिन उसका आधिकारिक मॉडल कार्ड अब भी bf16/fp16 में लगभग 9.5 GB GPU RAM बताता है। एक कंज़्यूमर ट्रांसक्रिप्शन ऐप के लिए Whisper Large-v3 Turbo को शिप करना आज भी आसान है और वह कहीं ज़्यादा भाषाएँ कवर करता है। इसीलिए Whisper Notes फ़िलहाल Voxtral के बजाय Whisper Turbo को Parakeet V3 और SenseVoice के साथ जोड़कर इस्तेमाल करता है।

API और सेल्फ-होस्टिंग लागत

10 जुलाई 2026 को की गई जाँच के अनुसार, Mistral का मॉडल कार्ड Voxtral Small के ऑडियो इनपुट की कीमत $0.004 प्रति मिनट बताता है। ऑडियो-समझ वाले अनुरोधों में टेक्स्ट इनपुट और जनरेट किए गए टेक्स्ट का बिल अलग से लगता है। अगर आप Apache-2.0 वेट्स को सेल्फ-होस्ट करते हैं, तो कोई Mistral API शुल्क नहीं लगता, लेकिन हार्डवेयर और ऑपरेशंस का खर्च आपको उठाना होता है।

Mistral API

$0.004
Voxtral Small के लिए प्रति ऑडियो मिनट

सेल्फ-होस्टेड वेट्स

Apache 2.0
कोई API शुल्क नहीं; कंप्यूट की ज़िम्मेदारी आपकी

यह कैसे काम करता है

आधिकारिक मॉडल कार्ड Voxtral को एक ऑडियो एनकोडर और समर्पित ट्रांसक्रिप्शन मोड वाले language-model बैकबोन के रूप में बताता है। प्रोडक्ट की अहम सीमाएँ ठोस हैं:

1. मल्टीमॉडल आर्किटेक्चर

Voxtral केवल स्पीच-टू-टेक्स्ट डिकोडर की तरह काम करने के बजाय एक ही बातचीत में ऑडियो और टेक्स्ट दोनों स्वीकार करता है:

  • सीधे ट्रांसक्रिप्शन के लिए समर्पित मोड
  • ऑडियो Q&A और संरचित सारांश
  • कई ऑडियो इनपुट और मल्टी-टर्न ऑडियो बातचीत

लॉन्ग-फ़ॉर्म सीमा

32k कॉन्टेक्स्ट विंडो ट्रांसक्रिप्शन के लिए 30 मिनट तक और व्यापक ऑडियो समझ के लिए 40 मिनट तक का ऑडियो सपोर्ट करती है।

2. भाषाएँ और मूल्यांकन

Mistral स्वचालित पहचान के साथ आठ प्रमुख भाषाएँ सूचीबद्ध करता है:

  • अंग्रेज़ी, स्पैनिश, फ़्रेंच, पुर्तगाली, हिंदी, जर्मन, डच और इतालवी
  • बेंचमार्क में FLEURS, Mozilla Common Voice और Multilingual LibriSpeech शामिल हैं
  • रिलीज़ अंग्रेज़ी शॉर्ट-फ़ॉर्म और लॉन्ग-फ़ॉर्म ऑडियो का अलग-अलग मूल्यांकन भी करती है

3. डिप्लॉयमेंट आवश्यकताएँ

ओपन वेट्स का मतलब यह नहीं कि हर चेकपॉइंट हर डिवाइस के लिए काफ़ी छोटा हो:

  • Voxtral Small को उसके मॉडल कार्ड के अनुसार bf16/fp16 में लगभग 55 GB GPU RAM चाहिए
  • Voxtral Mini लोकल और एज डिप्लॉयमेंट के लिए बनाया गया 3B चेकपॉइंट है
  • रिलीज़ किए गए चेकपॉइंट सर्व करने के लिए Mistral vLLM की सिफ़ारिश करता है

4. मुख्य विशेषताएँ

कॉन्टेक्स्ट की समझ

32k कॉन्टेक्स्ट सीमा के भीतर, सीधे ऑडियो से सवालों के जवाब दे सकता है और सारांश बना सकता है।

बहुभाषी

आठ प्रमुख भाषाओं को अपने आप पहचानकर ट्रांसक्राइब करता है: अंग्रेज़ी, स्पैनिश, फ़्रेंच, पुर्तगाली, हिंदी, जर्मन, डच और इतालवी।

शोर से निपटना

आधिकारिक मूल्यांकन में विविध स्पीच डेटासेट शामिल हैं, लेकिन Mistral हर शोर-भरी रिकॉर्डिंग के लिए कोई सर्वव्यापी गारंटी प्रकाशित नहीं करता।

एज डिप्लॉयमेंट

Voxtral Mini लोकल और एज विकल्प है। इसका आधिकारिक मॉडल कार्ड bf16/fp16 में लगभग 9.5 GB GPU RAM बताता है।

5. आर्किटेक्चर

तीन मुख्य घटक:

  1. 1. ऑडियो एनकोडर: वेवफ़ॉर्म को सीखे हुए ऑडियो निरूपणों में बदलता है
  2. 2. प्रोजेक्टर: ऑडियो निरूपणों को language model के hidden space में मैप करता है
  3. 3. Language-model बैकबोन: ट्रांसक्रिप्ट, जवाब, सारांश या टूल कॉल जनरेट करता है

यही डिज़ाइन समझाता है कि Voxtral ट्रांसक्रिप्शन से आगे क्यों जा पाता है, लेकिन इसी वजह से यह Whisper Turbo जैसे केवल-ट्रांसक्रिप्शन मॉडल की तुलना में कहीं बड़े language-model वेट्स भी साथ लाता है।

Whisper Notes अब भी क्यों सही चुनाव है

Voxtral और Whisper Notes अलग-अलग समस्याएँ हल करते हैं। Voxtral ट्रांसक्रिप्शन को ऑडियो समझ के साथ जोड़ता है; Whisper Notes ऐसी निजी ट्रांसक्रिप्शन पर केंद्रित है जो कंज़्यूमर Apple हार्डवेयर पर आसानी से चलती है।

Whisper Notes क्या देता है

प्राइवेसी

प्रदर्शन

  • Whisper तकनीक, प्रमाणित सटीकता
  • Apple Silicon के लिए ऑप्टिमाइज़्ड
  • भरोसेमंद नतीजे

लागत

  • Whisper Notes में सब्सक्रिप्शन नहीं, एक बार की खरीदारी है। App Store पर एक खरीद से iPhone, iPad और Mac App Store संस्करण मिलते हैं; वेबसाइट का DMG संस्करण अलग बिकने वाला एकमुश्त लाइसेंस है। कीमत संबंधित खरीद चैनल पर दिखाई जाती है।
  • कोई प्रति-मिनट शुल्क नहीं
  • असीमित ट्रांसक्रिप्शन

यूज़र अनुभव

  • सरल इंटरफ़ेस
  • नियमित अपडेट
  • निरंतर सुधार

स्टोरेज आवश्यकताएँ

फ़ुल प्रिसिज़न में Voxtral Small एक सर्वर-श्रेणी का मॉडल है: इसका आधिकारिक कार्ड लगभग 55 GB GPU RAM बताता है। Voxtral Mini खास तौर पर लोकल और एज इस्तेमाल के लिए है, लेकिन उसका कार्ड भी bf16/fp16 में लगभग 9.5 GB GPU RAM बताता है। Whisper Turbo का ऐप डाउनलोड लगभग 1.6 GB है, जो मौजूदा Whisper Notes प्रोडक्ट के लिए बेहतर फ़िट है।

Whisper Notes Whisper Large-v3 Turbo इस्तेमाल करता है — यह रोज़मर्रा के इस्तेमाल के लिए प्रदर्शन, गति और VRAM ज़रूरतों में संतुलन बनाता है। जब बेहतर मॉडल उचित संसाधन ज़रूरतों के साथ उपलब्ध होंगे, हम उनमें अपग्रेड करेंगे।

Voxtral तब आकर्षक है जब ऑडियो Q&A, सारांश या सेल्फ-होस्टेड सर्वर डिप्लॉयमेंट मायने रखता हो। Whisper Notes उन व्यक्तिगत उपयोगकर्ताओं के लिए है जो निजी ट्रांसक्रिप्शन चाहते हैं और कोई आवर्ती सब्सक्रिप्शन नहीं चाहते।

इसका क्या मतलब है

Voxtral सादे स्पीच रिकग्निशन से आगे एक अहम ओपन-वेट कदम है, क्योंकि यह ऑडियो को ट्रांसक्राइब करने के साथ-साथ उस पर तर्क भी कर सकता है।

Mac और iPhone पर निजी ऑफ़लाइन ट्रांसक्रिप्शन के लिए, छोटे विशेषीकृत इंजन पैकेज करने और लगातार भरोसे से चलाने में आज भी आसान बने हुए हैं।

सभी लोकल विकल्पों की तुलना करना चाहते हैं? हर ऑन-डिवाइस स्पीच-टू-टेक्स्ट मॉडल — Whisper वैरिएंट, Parakeet V3, SenseVoice और Voxtral — की आमने-सामने तुलना हमारे Whisper मॉडल तुलना पेज पर उपलब्ध है।

अक्सर पूछे जाने वाले सवाल

Mistral Voxtral क्या है?

Voxtral स्पीच ट्रांसक्रिप्शन और ऑडियो समझ के लिए Mistral का ओपन-वेट मॉडल परिवार है। जुलाई 2025 की रिलीज़ में सर्वर-श्रेणी के काम के लिए Voxtral Small 24B और लोकल व एज डिप्लॉयमेंट के लिए Voxtral Mini 3B शामिल हैं। दोनों चेकपॉइंट Apache 2.0 लाइसेंस इस्तेमाल करते हैं।

क्या Voxtral Mac पर लोकली चल सकता है?

डाउनलोड किए जा सकने वाले वेट्स सेल्फ-होस्ट किए जा सकते हैं, लेकिन दोनों आकारों की ज़रूरतें अलग-अलग हैं। Voxtral Small को bf16/fp16 में लगभग 55 GB GPU RAM चाहिए, इसलिए वह सर्वर-श्रेणी का विकल्प है। Voxtral Mini लोकल और एज चेकपॉइंट है; उसका मॉडल कार्ड bf16/fp16 में लगभग 9.5 GB बताता है, और Mac पर असली गति व मेमोरी उपयोग रनटाइम और क्वांटाइज़ेशन पर निर्भर करते हैं।

क्या Whisper Notes Voxtral इस्तेमाल करता है?

नहीं। Whisper Notes Parakeet V3 (Mac डिफ़ॉल्ट), Whisper Large-v3 Turbo और SenseVoice चलाता है — ये मॉडल इसलिए चुने गए हैं क्योंकि ये Apple Silicon पर रोज़मर्रा के इस्तेमाल के लिए प्रदर्शन, गति और VRAM ज़रूरतों में संतुलन बनाते हैं। जब भी बेहतर मॉडल कंज़्यूमर हार्डवेयर पर चलाने लायक होंगे, हम उन्हें अपनाएँगे।

Voxtral कितनी भाषाएँ सपोर्ट करता है?

आधिकारिक मॉडल कार्ड स्वचालित पहचान के साथ आठ प्रमुख भाषाएँ सूचीबद्ध करते हैं: अंग्रेज़ी, स्पैनिश, फ़्रेंच, पुर्तगाली, हिंदी, जर्मन, डच और इतालवी। Mistral FLEURS में अरबी का मूल्यांकन भी करता है, लेकिन वह मॉडल कार्ड की प्रमुख-भाषा सूची में शामिल नहीं है।

Mistral Voxtral कब रिलीज़ हुआ?

Mistral ने Voxtral को 15 जुलाई 2025 को रिलीज़ किया। शुरुआती Apache-2.0 चेकपॉइंट Voxtral Small 24B और Voxtral Mini 3B थे।