Mistral ได้เปิดตัว Voxtral ตระกูลโมเดลแบบ open-weight รุ่นแรกของบริษัทสำหรับการถอดเสียงและการทำความเข้าใจเสียง benchmark อย่างเป็นทางการแสดงให้เห็นความสามารถด้านการรู้จำเสียงพูดหลายภาษาและการถาม-ตอบจากเสียงที่แข็งแกร่ง ขณะที่โมเดลทั้งสองขนาดมีความต้องการฮาร์ดแวร์ต่างกันมาก นี่คือสิ่งที่รุ่นเปิดตัวนี้รองรับได้จริง และเหตุผลที่ Whisper Notes ยังคงใช้โมเดลขนาดเล็กกว่าที่เน้นการถอดเสียงบนฮาร์ดแวร์ Apple สำหรับผู้ใช้ทั่วไป
โมเดลสองรุ่น
Mistral เปิดตัว checkpoint ภายใต้ไลเซนส์ Apache 2.0 สองรุ่นในเดือนกรกฎาคม 2025:
Voxtral Small 24B
- •พารามิเตอร์ 24,000 ล้านตัว
- •ถอดเสียง แปลภาษา ถาม-ตอบจากเสียง และสรุปความ
- •หน้าต่างบริบท (context window) ขนาด 32k
- •ใช้ RAM ของ GPU ราว 55 GB ที่ bf16/fp16
Voxtral Mini 3B
- •พารามิเตอร์ 3,000 ล้านตัว
- •รองรับกลุ่มงานเสียงและข้อความชุดเดียวกันใน checkpoint ที่เล็กลง
- •ถูกวางตำแหน่งอย่างเป็นทางการสำหรับการใช้งานแบบโลคัลและ edge
- •ใช้ RAM ของ GPU ราว 9.5 GB ที่ bf16/fp16
Open Weights และไลเซนส์
checkpoint ทั้งสองรุ่นของปี 2025 เป็นแบบ open weights ภายใต้ไลเซนส์ Apache 2.0 คุณดาวน์โหลดมารันเองได้เลย:
- ✓ น้ำหนักโมเดล (weights) เปิดให้ดาวน์โหลดครบถ้วน
- ✓ โฮสต์เองหรือนำไปดัดแปลงได้ภายใต้เงื่อนไขของไลเซนส์ Apache 2.0
- ✓ ไม่มีค่า API ของ Mistral เมื่อโฮสต์เอง แต่คุณยังต้องจ่ายค่าประมวลผลของตัวเอง
- ✓ ประมวลผลเสียงบนเซิร์ฟเวอร์ของคุณเอง
แหล่งอ้างอิง: ประกาศเปิดตัว Voxtral ของ Mistral, model card อย่างเป็นทางการของ Voxtral Small และ model card อย่างเป็นทางการของ Voxtral Mini
ผล Benchmark
เอกสารเปิดตัวของ Mistral เปรียบเทียบอัตราข้อผิดพลาดของคำ (WER) แบบ macro-average บนชุดข้อมูลภาษาอังกฤษทั้งแบบสั้นและแบบยาว, Mozilla Common Voice, FLEURS และ Multilingual LibriSpeech ในผล FLEURS ที่ Mistral รายงาน Voxtral Small เอาชนะ Whisper ได้ในทุกงานที่ประเมิน WER ยิ่งต่ำยิ่งดี:
WER บน FLEURS จาก benchmark ตอนเปิดตัวของ Mistral นำมาพล็อตเทียบกับราคา API โดยประมาณ ทั้งผล benchmark และราคาอาจเปลี่ยนแปลงได้
FLEURS เป็นเพียงแง่มุมหนึ่งของคุณภาพการถอดเสียงเท่านั้น ตัวเลขเหล่านี้เป็นผลที่ผู้พัฒนารายงานเอง ดังนั้นควรตรวจสอบนิยาม benchmark ที่เผยแพร่ และทดสอบกับภาษา ไมโครโฟน และสภาพการบันทึกเสียงของคุณเองก่อนตัดสินใจเลือกโมเดล
Voxtral กับ Whisper: ควรใช้ตัวไหน?
Benchmark เล่าเรื่องได้เพียงบางส่วน นี่คือการเปรียบเทียบโมเดลสองตระกูลนี้ในปัจจัยที่สำคัญจริงๆ หากคุณต้องการรันเองสักตัว:
| Voxtral Small | Voxtral Mini | Whisper Large v3 | Whisper Large-v3 Turbo | |
|---|---|---|---|---|
| ภาษา | 8 ภาษาหลัก | 8 ภาษาหลัก | มากกว่า 100 ภาษา | มากกว่า 100 ภาษา |
| โอเพนซอร์ส | ใช่ | ใช่ | ใช่ | ใช่ |
| ขนาดโมเดล | พารามิเตอร์ 24B; RAM ของ GPU ~55 GB ที่ bf16/fp16 | พารามิเตอร์ 3B; RAM ของ GPU ~9.5 GB ที่ bf16/fp16 | พารามิเตอร์ 1.55B | พารามิเตอร์ 809M (~1.6 GB) |
| ใช้งานได้จริงบน Mac ทั่วไป | ไม่ ถ้ารันแบบ full precision บนฮาร์ดแวร์ทั่วไป | เป็นไปได้เมื่อใช้ runtime ที่รองรับ; หนักกว่า Turbo | ได้ | ได้ |
บทสรุป: Voxtral Small รายงานผล WER ที่แข็งแกร่ง และเพิ่มความสามารถทำความเข้าใจเสียงซึ่ง Whisper ไม่ได้พยายามทำ ส่วน Voxtral Mini คือ checkpoint ที่ Mistral วางตำแหน่งไว้สำหรับการใช้งานแบบโลคัลและ edge แต่ model card อย่างเป็นทางการของมันก็ยังระบุ RAM ของ GPU ไว้ราว 9.5 GB ที่ bf16/fp16 สำหรับแอปถอดเสียงสำหรับผู้ใช้ทั่วไป Whisper Large-v3 Turbo ยังคงบรรจุลงแอปได้ง่ายกว่าและครอบคลุมภาษามากกว่ามาก นั่นคือเหตุผลที่ Whisper Notes ปัจจุบันเลือกใช้ Whisper Turbo ร่วมกับ Parakeet V3 และ SenseVoice แทนที่จะเป็น Voxtral
ค่าใช้จ่าย API และการโฮสต์เอง
จากการตรวจสอบเมื่อวันที่ 10 กรกฎาคม 2026 model card ของ Mistral ระบุราคาอินพุตเสียงของ Voxtral Small ไว้ที่ $0.004 ต่อนาที ส่วนอินพุตข้อความและข้อความที่โมเดลสร้างขึ้นจะคิดค่าใช้จ่ายแยกต่างหากสำหรับคำขอประเภททำความเข้าใจเสียง หากคุณโฮสต์น้ำหนักโมเดล Apache 2.0 เอง จะไม่มีค่า API ของ Mistral แต่คุณต้องรับผิดชอบค่าฮาร์ดแวร์และค่าดำเนินการเอง
API ของ Mistral
โฮสต์น้ำหนักโมเดลเอง
หลักการทำงาน
model card อย่างเป็นทางการอธิบายว่า Voxtral คือแกนหลักแบบโมเดลภาษา (language-model backbone) ที่มาพร้อมตัวเข้ารหัสเสียง (audio encoder) และโหมดถอดเสียงโดยเฉพาะ ข้อจำกัดสำคัญของผลิตภัณฑ์ระบุไว้อย่างชัดเจน:
1. สถาปัตยกรรมมัลติโมดัล
Voxtral รับทั้งเสียงและข้อความในบทสนทนาเดียวกัน แทนที่จะทำหน้าที่เป็นเพียงตัวถอดรหัสเสียงพูดเป็นข้อความ:
- •โหมดเฉพาะสำหรับการถอดเสียงโดยตรง
- •ถาม-ตอบจากเสียงและการสรุปความแบบมีโครงสร้าง
- •รองรับอินพุตเสียงหลายรายการและบทสนทนาเสียงแบบหลายรอบ
ข้อจำกัดสำหรับเสียงความยาวมาก
หน้าต่างบริบทขนาด 32k รองรับเสียงได้สูงสุด 30 นาทีสำหรับการถอดเสียง หรือ 40 นาทีสำหรับงานทำความเข้าใจเสียงในวงกว้าง
2. ภาษาและการประเมินผล
Mistral ระบุภาษาหลัก 8 ภาษา พร้อมระบบตรวจจับภาษาอัตโนมัติ:
- •อังกฤษ, สเปน, ฝรั่งเศส, โปรตุเกส, ฮินดี, เยอรมัน, ดัตช์ และอิตาลี
- •benchmark ที่ใช้ประกอบด้วย FLEURS, Mozilla Common Voice และ Multilingual LibriSpeech
- •เอกสารเปิดตัวยังประเมินเสียงภาษาอังกฤษแบบสั้นและแบบยาวแยกจากกันด้วย
3. ข้อกำหนดในการติดตั้งใช้งาน
การเป็น open weights ไม่ได้แปลว่าทุก checkpoint จะเล็กพอสำหรับทุกอุปกรณ์:
- •Voxtral Small ต้องใช้ RAM ของ GPU ราว 55 GB ที่ bf16/fp16 ตามที่ระบุใน model card
- •Voxtral Mini คือ checkpoint ขนาด 3B ที่ตั้งใจไว้สำหรับการใช้งานแบบโลคัลและ edge
- •Mistral แนะนำให้ใช้ vLLM ในการให้บริการ checkpoint ที่เผยแพร่
4. ฟีเจอร์เด่น
ความเข้าใจตามบริบท
สามารถตอบคำถามและสร้างบทสรุปได้โดยตรงจากเสียง ภายในขีดจำกัดบริบท 32k
รองรับหลายภาษา
ตรวจจับและถอดเสียงภาษาหลัก 8 ภาษาโดยอัตโนมัติ: อังกฤษ, สเปน, ฝรั่งเศส, โปรตุเกส, ฮินดี, เยอรมัน, ดัตช์ และอิตาลี
การรับมือเสียงรบกวน
การประเมินอย่างเป็นทางการครอบคลุมชุดข้อมูลเสียงพูดที่หลากหลาย แต่ Mistral ไม่ได้ให้การรับประกันแบบเหมารวมสำหรับการบันทึกเสียงที่มีเสียงรบกวนทุกกรณี
การใช้งานแบบ Edge
Voxtral Mini คือตัวเลือกสำหรับการใช้งานแบบโลคัลและ edge โดย model card อย่างเป็นทางการระบุ RAM ของ GPU ไว้ราว 9.5 GB ที่ bf16/fp16
5. สถาปัตยกรรม
องค์ประกอบหลักสามส่วน:
- 1. ตัวเข้ารหัสเสียง (audio encoder): แปลงคลื่นเสียงให้เป็นตัวแทนเสียงที่โมเดลเรียนรู้มา
- 2. Projector: จับคู่ตัวแทนเสียงเข้าสู่พื้นที่ซ่อน (hidden space) ของโมเดลภาษา
- 3. แกนหลักโมเดลภาษา (language-model backbone): สร้างบทถอดเสียง คำตอบ บทสรุป หรือการเรียกใช้เครื่องมือ
การออกแบบเช่นนี้อธิบายว่าเหตุใด Voxtral จึงทำได้มากกว่าการถอดเสียง แต่มันก็ต้องแบกน้ำหนักโมเดลภาษาที่ใหญ่กว่าโมเดลที่เน้นถอดเสียงอย่างเดียวอย่าง Whisper Turbo มากเช่นกัน
ทำไม Whisper Notes ยังคงเป็นตัวเลือกที่สมเหตุสมผล
Voxtral กับ Whisper Notes แก้ปัญหาคนละอย่างกัน Voxtral ผสานการถอดเสียงเข้ากับการทำความเข้าใจเสียง ส่วน Whisper Notes มุ่งเน้นการถอดเสียงแบบเป็นส่วนตัวที่รันได้ง่ายบนฮาร์ดแวร์ Apple สำหรับผู้ใช้ทั่วไป
สิ่งที่ Whisper Notes มอบให้
ความเป็นส่วนตัว
- •ประมวลผลออฟไลน์ 100%
- •ไม่มีการส่งข้อมูลออกไปภายนอก
- •ไม่พึ่งพาคลาวด์
ประสิทธิภาพ
- •เทคโนโลยี Whisper ความแม่นยำที่พิสูจน์แล้ว
- •ปรับแต่งมาสำหรับ Apple Silicon
- •ผลลัพธ์ที่เชื่อถือได้
ค่าใช้จ่าย
- •Whisper Notes เป็นการซื้อครั้งเดียว ไม่มีค่าสมัครสมาชิก การซื้อผ่าน App Store ครั้งเดียวครอบคลุมเวอร์ชัน iPhone, iPad และ Mac App Store ส่วนเวอร์ชัน DMG จากเว็บไซต์เป็นไลเซนส์ซื้อครั้งเดียวที่ขายแยก ราคาอ้างอิงตามช่องทางซื้อ
- •ไม่มีการคิดเงินรายนาที
- •ถอดเสียงได้ไม่จำกัด
ประสบการณ์ใช้งาน
- •อินเทอร์เฟซเรียบง่าย
- •อัปเดตสม่ำเสมอ
- •ปรับปรุงพัฒนาอย่างต่อเนื่อง
ความต้องการพื้นที่จัดเก็บ
ที่ full precision Voxtral Small เป็นโมเดลระดับเซิร์ฟเวอร์: model card อย่างเป็นทางการระบุ RAM ของ GPU ไว้ราว 55 GB ส่วน Voxtral Mini ตั้งใจไว้สำหรับการใช้งานแบบโลคัลและ edge โดยเฉพาะ แต่ card ของมันก็ยังระบุ RAM ของ GPU ราว 9.5 GB ที่ bf16/fp16 ขณะที่ไฟล์ดาวน์โหลดของ Whisper Turbo ในแอปมีขนาดราว 1.6 GB ซึ่งเหมาะกับผลิตภัณฑ์ Whisper Notes ในปัจจุบันมากกว่า
Whisper Notes ใช้ Whisper Large-v3 Turbo — โมเดลที่สมดุลระหว่างประสิทธิภาพ ความเร็ว และความต้องการ VRAM สำหรับการใช้งานประจำวัน เราจะอัปเกรดไปใช้โมเดลที่ดีกว่าเมื่อมันพร้อมใช้งานด้วยความต้องการทรัพยากรที่สมเหตุสมผล
Voxtral น่าสนใจเมื่อคุณให้ความสำคัญกับการถาม-ตอบจากเสียง การสรุปความ หรือการติดตั้งบนเซิร์ฟเวอร์แบบโฮสต์เอง ส่วน Whisper Notes มุ่งเป้าไปที่ผู้ใช้ทั่วไปที่ต้องการการถอดเสียงแบบเป็นส่วนตัวและไม่ต้องจ่ายค่าสมัครสมาชิกแบบต่อเนื่อง
สิ่งนี้หมายความว่าอย่างไร
Voxtral เป็นก้าวสำคัญของโมเดล open-weight ที่ไปไกลกว่าการรู้จำเสียงพูดธรรมดา เพราะมันสามารถใช้เหตุผลกับเสียงได้ ไม่ใช่แค่ถอดเสียงเท่านั้น
สำหรับการถอดเสียงแบบออฟไลน์เป็นส่วนตัวบน Mac และ iPhone เอนจินเฉพาะทางขนาดเล็กกว่ายังคงบรรจุลงแอปได้ง่ายกว่าและทำงานได้สม่ำเสมอกว่า
กำลังเปรียบเทียบตัวเลือกแบบโลคัลทั้งหมดอยู่? โมเดลแปลงเสียงเป็นข้อความบนอุปกรณ์ทุกตัว — Whisper รุ่นต่างๆ, Parakeet V3, SenseVoice และ Voxtral — ถูกนำมาเปรียบเทียบแบบเคียงข้างกันบนหน้าเปรียบเทียบโมเดล Whisper ของเรา
คำถามที่พบบ่อย
Mistral Voxtral คืออะไร?
Voxtral คือตระกูลโมเดลแบบ open-weight ของ Mistral สำหรับการถอดเสียงพูดและการทำความเข้าใจเสียง รุ่นที่เปิดตัวในเดือนกรกฎาคม 2025 ประกอบด้วย Voxtral Small 24B สำหรับงานระดับเซิร์ฟเวอร์ และ Voxtral Mini 3B สำหรับการใช้งานแบบโลคัลและ edge ทั้งสอง checkpoint ใช้ไลเซนส์ Apache 2.0
Voxtral รันในเครื่องบน Mac ได้ไหม?
น้ำหนักโมเดลที่ดาวน์โหลดได้สามารถนำไปโฮสต์เองได้ แต่ทั้งสองขนาดมีความต้องการต่างกัน Voxtral Small ต้องใช้ RAM ของ GPU ราว 55 GB ที่ bf16/fp16 จึงเป็นตัวเลือกระดับเซิร์ฟเวอร์ ส่วน Voxtral Mini คือ checkpoint สำหรับการใช้งานแบบโลคัลและ edge โดย model card ระบุไว้ราว 9.5 GB ที่ bf16/fp16 และความเร็วกับปริมาณหน่วยความจำที่ใช้จริงบน Mac ขึ้นอยู่กับ runtime และการทำ quantization
Whisper Notes ใช้ Voxtral ไหม?
ไม่ใช้ Whisper Notes รัน Parakeet V3 (โมเดลเริ่มต้นบน Mac), Whisper Large-v3 Turbo และ SenseVoice — โมเดลเหล่านี้ถูกเลือกเพราะสมดุลระหว่างประสิทธิภาพ ความเร็ว และความต้องการ VRAM สำหรับการใช้งานประจำวันบน Apple Silicon เราจะนำโมเดลที่ดีกว่ามาใช้ทันทีที่มันรันบนฮาร์ดแวร์ทั่วไปได้อย่างเหมาะสม
Voxtral รองรับกี่ภาษา?
model card อย่างเป็นทางการระบุภาษาหลัก 8 ภาษาพร้อมการตรวจจับอัตโนมัติ: อังกฤษ, สเปน, ฝรั่งเศส, โปรตุเกส, ฮินดี, เยอรมัน, ดัตช์ และอิตาลี Mistral ยังประเมินภาษาอาหรับใน FLEURS ด้วย แต่ไม่ได้รวมภาษานี้ไว้ในรายชื่อภาษาหลักของ model card
Mistral Voxtral เปิดตัวเมื่อไหร่?
Mistral เปิดตัว Voxtral เมื่อวันที่ 15 กรกฎาคม 2025 โดย checkpoint Apache 2.0 ชุดแรกคือ Voxtral Small 24B และ Voxtral Mini 3B