Apple Speech vs Whisper: SpeechAnalyzer ใหม่ดีแค่ไหน?

1 กันยายน 2569
·
8 min read
·Whisper Notes Team

ตั้งแต่ macOS 26 และ iOS 26 เป็นต้นมา Apple ได้เปิดตัวระบบรู้จำเสียงพูดบนอุปกรณ์ยุคใหม่ — SpeechAnalyzer และ SpeechTranscriber ซึ่งด้านล่างจะเรียกสั้น ๆ ว่า Apple Speech ระบบนี้แม่นกว่าเอนจินป้อนตามคำบอกรุ่นเก่าอย่างเห็นได้ชัด เราจึงอยากรู้ว่า: ตอนนี้ระบบรู้จำเสียงพูดในตัวของ Apple ดีพอที่คุณจะไม่ต้องใช้แอปถอดเสียงเลยหรือยัง? แล้วมันห่างจากโมเดลเปิดที่ทำงานบนอุปกรณ์ใน Whisper Notes — Whisper, Parakeet, SenseVoice และ Qwen3-ASR — แค่ไหน? เราได้ทำการทดสอบอย่างเข้มงวด นี่คือผลลัพธ์ ในสิบภาษาที่เราทดสอบ Apple Speech ไม่เคยมีอัตราความผิดพลาดต่ำที่สุดเลย ตามหลังผู้นำไม่เกิน 1.5 จุดในภาษาเกาหลี ญี่ปุ่น และจีน และไม่มีโมเดลสำหรับภาษาดัตช์ รัสเซีย และโปแลนด์เลย

Apple Speech ห่างจากโมเดลที่คุณดาวน์โหลดแค่ไหน?

ภาษา Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
อังกฤษ 8.80 4.49 5.49 7.04 6.89 8.46
เยอรมัน 6.26 2.85 4.05 8.67 6.26
ดัตช์ 7.36 5.69 16.75 8.58
รัสเซีย 5.65 5.13 11.37 7.12
โปแลนด์ 12.59 5.45 15.81 8.30
ญี่ปุ่น 6.36 5.74 5.30 11.37 6.78
เกาหลี 4.31 3.54 4.25 7.30 7.85
ฝรั่งเศส 7.61 4.57 5.97 13.24 5.83
จีน 7.97 6.49 7.97 20.50 7.69
สเปน (ลาตินอเมริกา) 5.41 3.38 3.62 6.22 4.86

สิบภาษาในบรรดาภาษาที่ใช้กันอย่างแพร่หลาย หนึ่งเอนจินต่อหนึ่งคอลัมน์ แต่ละช่องคืออัตราความผิดพลาดของเอนจินนั้น ยิ่งต่ำยิ่งดี สีเขียวคือค่าต่ำสุดในแถว สีขาวคือค่าต่ำสุดอันดับสอง ใช้ CER สำหรับภาษาญี่ปุ่น เกาหลี และจีน ส่วนที่เหลือใช้ WER โดยไม่เคยรวมเป็นตัวเลขเดียว การทดสอบ FLEURS ที่ทีม Whisper Notes รันเองบน M5 MacBook Air หนึ่งเครื่องด้วยเสียงอ่าน

ชื่อย่อ: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small เครื่องหมายขีดหมายถึงเอนจินไม่มีโมเดลสำหรับภาษานั้น

Qwen3-ASR 1.7B ทำอัตราความผิดพลาดได้ต่ำสุดในหกจากสิบภาษา ส่วน Whisper Large V3 Turbo ต่ำสุดในอีกสี่ภาษา Apple Speech ตามหลังผู้นำของแถว 0.77 จุดในภาษาเกาหลี 1.06 จุดในภาษาญี่ปุ่น และ 1.48 จุดในภาษาจีน ซึ่งเป็นภาษาที่เอนจินนี้เสมอกับ Whisper Large V3 Turbo ที่ 7.97 จากเจ็ดภาษาที่รองรับ เอนจินนี้ตามหลังผู้นำของแถว 0.8 ถึง 4.3 จุด โดยห่างที่สุดในภาษาอังกฤษ: 8.80 เทียบกับ 4.49 ไม่มีผล Apple Speech สำหรับภาษาดัตช์ โปแลนด์ และรัสเซีย

Apple Speech รองรับภาษาใดบ้าง?

Apple Speech ได้ส่งผลลัพธ์กลับมาสำหรับ 21 จาก 83 การกำหนดค่าภาษาในการทดสอบนี้ โมเดล Whisper ทั้งสองครอบคลุมครบ 83 ส่วน Qwen3-ASR 1.7B ครอบคลุม 30 และ Parakeet V3 ครอบคลุม 25 ในสิบภาษาด้านบน เอนจินนี้ไม่มีโมเดลสำหรับภาษาดัตช์ โปแลนด์ หรือรัสเซีย ไม่มีรายชื่อคงที่ให้อ้างอิง เพราะทรัพยากรภาษาเป็นของ macOS แอปจึงต้องถามขณะรันว่าเครื่องนั้นมีภาษาใดบ้าง

ภาษา Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
อิตาลี 4.39 2.58 2.58 7.64 3.43
กวางตุ้ง 8.69 6.44 36.75 119.01 37.23
โปรตุเกส (บราซิล) 9.35 5.17 5.44 8.61 6.49
ฮินดี 101.50 13.19 29.64 61.26
เตลูกู 101.63 81.74 103.19
อูรดู 101.69 23.39 38.83
ปัญจาบ 101.75 92.05 103.40
เบงกาลี 102.00 83.52 117.37
เนปาล 102.13 88.59 118.84
มาลายาลัม 102.18 107.34 167.16
มราฐี 102.23 82.69 109.95
กันนาดา 103.83 72.07 116.10
คุชราต 104.52 75.31 108.91
ทมิฬ 113.01 71.28 79.77

อีกสิบสี่ภาษาที่ Apple Speech ได้ส่งผลลัพธ์กลับมา เรียงตามอัตราความผิดพลาดของตัวเอง ใช้คอลัมน์ สี และชื่อย่อเหมือนด้านบน ใช้ CER สำหรับภาษากวางตุ้ง ส่วนที่เหลือใช้ WER อัตราความผิดพลาดอาจเกิน 100% ได้เพราะการแทรกก็นับรวมในตัวเศษ

ในสิบเอ็ดแถวสุดท้าย ตั้งแต่ภาษาฮินดีถึงทมิฬ Apple Speech ได้ตอบกลับเป็นการถอดอักษรละตินแทนอักษรท้องถิ่น ดังนั้นอัตราความผิดพลาดในส่วนนั้นจึงวัดความไม่ตรงกันของระบบอักษร ไม่ใช่ความแม่นยำของการรู้จำ และช่องเหล่านั้นไม่ได้ถูกนำไปจัดอันดับในแถว ค่าของเอนจินอื่นในแถวเหล่านั้นเป็นการวัดตามปกติ

SpeechAnalyzer ทำงานอย่างไร

Apple มี API รู้จำเสียงพูดมาตั้งแต่ iOS 10 โดย SFSpeechRecognizer คือเอนจินเบื้องหลังเส้นทางป้อนตามคำบอกแบบเก่า SpeechAnalyzer เข้ามาแทนที่ โดยเปิดตัวใน macOS 26 และ iOS 26 และใช้ได้บนทุกแพลตฟอร์มของ Apple ยกเว้น watchOS

API นี้สร้างขึ้นรอบเซสชัน คุณสร้าง SpeechAnalyzer ใส่โมดูลหนึ่งตัวหรือหลายตัว แล้วป้อนเสียงให้มัน SpeechTranscriber คือโมดูลที่เปลี่ยนเสียงพูดเป็นข้อความ เสียงเข้ามาเป็นลำดับแบบอะซิงโครนัสที่คุณป้อนเอง ผลลัพธ์กลับมาเป็นลำดับที่สอง และทั้งสองมักทำงานคนละงาน ตัววิเคราะห์รับลำดับอินพุตได้ทีละหนึ่งลำดับ บัฟเฟอร์และผลลัพธ์ทุกชิ้นมีรหัสเวลาเทียบกับไทม์ไลน์ของเสียงเอง จึงนำผลลัพธ์กลับไปวางตรงตำแหน่งเดิมได้

แผนภาพ WWDC25 ของ Apple แสดงการทำงานพร้อมกันของ SpeechAnalyzer: งานอินพุตส่ง AsyncSequence อินพุตให้ SpeechAnalyzer และ SpeechTranscriber ในงานวิเคราะห์ ก่อนส่ง AsyncSequence ผลลัพธ์ไปยังงานผลลัพธ์และส่วนติดต่อผู้ใช้

หนึ่งเซสชัน สามงาน: เสียงเข้ามาเป็น AsyncSequence จากนั้น SpeechAnalyzer และ SpeechTranscriber วิเคราะห์เสียง แล้วผลลัพธ์กลับมาเป็น AsyncSequence ที่สองเพื่อให้อินเทอร์เฟซอ่าน ที่มา: Apple, เซสชัน 277 ของ WWDC25

ผลลัพธ์มาถึงสองครั้ง ทุกอย่างที่อยู่ในช่วงซึ่ง Apple เรียกว่าช่วงผันผวนยังอาจถูกแทนที่ด้วยผลลัพธ์ที่ดีกว่า ส่วนทุกอย่างนอกช่วงนั้นเป็นผลสุดท้าย นี่คือวิธีที่แอปแสดงข้อความถอดเสียงแบบคร่าว ๆ ขณะที่คุณยังพูดอยู่ แล้วแก้ไขในภายหลัง

Apple ระบุเป้าหมายการออกแบบห้าข้อสำหรับโมเดล SpeechTranscriber ได้แก่ เสียงยาว เสียงพูดสนทนา ผู้พูดที่อยู่ไกล ความหน่วงต่ำ และความเป็นส่วนตัว ซึ่งหมายความว่าโมเดลทำงานบนอุปกรณ์ แอปโน้ต แอปเสียงบันทึก แอปบันทึก และการสรุปสายโทรศัพท์สร้างขึ้นบนโมเดลนี้

สไลด์ WWDC25 ของ Apple แสดงความสามารถของโมเดล SpeechTranscriber: เสียงยาว เสียงพูดสนทนา ผู้พูดที่อยู่ไกล ความหน่วงต่ำ และความเป็นส่วนตัว

เป้าหมายการออกแบบห้าข้อที่ Apple ระบุสำหรับโมเดล SpeechTranscriber ที่มา: Apple, เซสชัน 277 ของ WWDC25

โมเดลเหล่านี้ไม่ได้เป็นส่วนหนึ่งของแอปใด โมเดลถูกดาวน์โหลดจากเซิร์ฟเวอร์ของ Apple ผ่าน AssetInventory ระบบเป็นผู้จัดเก็บและอัปเดต และแชร์ระหว่างแอป โมเดลไม่เพิ่มขนาดดาวน์โหลดหรือพื้นที่หน่วยความจำของแอป และการถอดรหัสเกิดขึ้นนอกกระบวนการที่เรียกใช้ ในกรณีที่ SpeechTranscriber ไม่มีโมเดลสำหรับภาษาหรืออุปกรณ์ DictationTranscriber จะรับช่วงต่อด้วยโมเดลเดียวกับการป้อนตามคำบอกของระบบ

เราวัดอย่างไร

ทุกเอนจินในบทความนี้ได้ถอดเสียงคลิปชุดเดียวกัน ตามลำดับเดียวกัน ครั้งละหนึ่งคลิป บน M5 MacBook Air (32 GB, macOS 27.0) เสียงมาจากส่วนทดสอบของ Google FLEURS ที่รุ่น 70bb2e84 ภาษาละประมาณ 150 ประโยคและ 30 นาที แฮชคงที่จาก ID รายการของชุดข้อมูลเองใช้กำหนดลำดับ และเราเลือกช่วงรายการเต็มที่สั้นที่สุดซึ่งเกินสามสิบนาที เอาต์พุตของโมเดลไม่มีส่วนในการเลือกนั้น ทุกช่องได้ถูกสร้างใหม่จากบันทึกผลของแต่ละช่องและตรวจซ้ำ โดยผ่านครบทั้ง 285 ช่อง

คะแนนคืออัตราความผิดพลาดระดับคำเมื่อคำแยกด้วยเว้นวรรค และอัตราความผิดพลาดระดับอักขระสำหรับภาษาญี่ปุ่น เกาหลี จีน และกวางตุ้ง FLEURS เป็นเสียงอ่าน ไม่ใช่การประชุมหรือการป้อนตามคำบอก ตารางเหล่านี้บอกว่าเอนจินหนึ่งพอจะใช้กับภาษาของคุณได้หรือไม่ ไม่ได้บอกว่าคุณจะได้ผลอย่างไรกับไฟล์บันทึกของตัวเอง

ดีกว่า Apple Dictation รุ่นเก่าแค่ไหน?

Apple มีจุดการทำงานด้านการถอดเสียงสองแบบ และเราได้วัดทั้งคู่ SpeechTranscriber คือแบบใหม่ ซึ่งบทความนี้เรียกว่า Apple Speech DictationTranscriber คือแบบที่เน้นความเข้ากันได้ หรือเส้นทางป้อนตามคำบอกที่ Mac เคยใช้มาก่อน

ภาษา Apple Dictation Apple Speech
เกาหลี 7.11 4.31
อิตาลี 6.93 4.39
สเปน (ลาตินอเมริกา) 8.43 5.41
เยอรมัน 12.69 6.26
ญี่ปุ่น 9.37 6.36
ฝรั่งเศส 17.10 7.61
จีน 10.28 7.97
กวางตุ้ง 10.18 8.69
อังกฤษ 13.83 8.80
โปรตุเกส (บราซิล) 10.85 9.35

ทุกภาษาที่จุดการทำงานทั้งสองแบบของ Apple วัดได้อย่างเรียบร้อย เรียงตามอัตราความผิดพลาดของ Apple Speech สีเขียวคือค่าที่ดีกว่าในแถว การทดสอบเดียวกัน คลิปเดียวกัน Mac เครื่องเดียวกัน ใช้ CER สำหรับภาษาญี่ปุ่น เกาหลี จีน และกวางตุ้ง ส่วนที่เหลือใช้ WER

Apple Speech แม่นกว่าในทั้งสิบภาษา ภาษาค่ามัธยฐานลดความผิดพลาดได้ประมาณหนึ่งในสาม ภาษาฝรั่งเศสและเยอรมันมากกว่าครึ่ง ส่วนโปรตุเกสแบบบราซิลและกวางตุ้งประมาณหนึ่งข้อผิดพลาดจากทุกเจ็ดข้อ

นี่คือการเปรียบเทียบกับอดีตของ Apple เอง เมื่อเทียบกับโมเดลที่คุณดาวน์โหลด อันดับดีที่สุดในภาษาที่วัดได้อย่างเรียบร้อยคืออันดับสองในภาษากวางตุ้ง Dictation ครอบคลุมภาษามากกว่า: 33 การกำหนดค่าเทียบกับ 21 ในการทดสอบนี้ รวมทั้งสามภาษาที่เอนจินใหม่ไม่มีในที่นี้

เอนจินในตัวให้อะไรกับคุณ?

เอนจิน ความเร็ว หน่วยความจำสูงสุด ขนาดดาวน์โหลด
SenseVoice Small 162.3× ของเวลาจริง 0.95 GiB 827 MB
Parakeet V3 75.6× ของเวลาจริง 0.09 GiB 465 MB
Apple Speech 30.8× ของเวลาจริง ไม่ได้รายงาน macOS เป็นผู้ดาวน์โหลดแพ็กภาษา ไม่ใช่แอป
Qwen3-ASR 1.7B 11.1× ของเวลาจริง 2.43 GiB ประมาณ 2.5 GB
Whisper Small 7.9× ของเวลาจริง 0.87 GiB 600 MB
Whisper Large V3 Turbo 3.0× ของเวลาจริง 1.87 GiB ประมาณ 1.6 GB

ความเร็วคือค่ามัธยฐานของแต่ละเอนจินในสิบสามภาษาที่บทความนี้วัดได้อย่างเรียบร้อย โดยนับเฉพาะภาษาที่เอนจินนั้นได้รัน — เป็นอัตราการประมวลผลรายการแยกสำหรับการวินิจฉัย ไม่ใช่ความหน่วงของผลิตภัณฑ์ หน่วยความจำสูงสุดคือค่าสูงสุดของกลุ่มกระบวนการในการทดสอบนี้ Apple Speech ถอดรหัสภายในบริการ macOS ที่แอปผู้เรียกไม่ได้เป็นเจ้าของ ดังนั้นตัวเลขในส่วนนั้นจึงไม่อาจมีความหมายแบบเดียวกับอีกห้าเอนจิน

ระบบดาวน์โหลดทรัพยากรภาษาของ Apple Speech เพียงครั้งเดียวและแชร์ให้ทุกแอป ไม่มีอะไรติดไปในตัวแอป และไม่มีอะไรถูกจัดสรรในกระบวนการของแอปเอง บริการระบบยังคงใช้หน่วยความจำขณะทำงาน แต่เราไม่สามารถระบุส่วนนั้นได้อย่างแม่นยำ จึงไม่รายงานตัวเลขแทนที่จะใส่ศูนย์ เอนจินนี้ได้รันที่ 30.8× ของเวลาจริง ตามหลัง Parakeet V3 และ SenseVoice Small

Whisper Large V3 Turbo นำสี่จากสิบแถวและเป็นเอนจินที่ช้าที่สุดในที่นี้ ช้ากว่า Apple Speech ประมาณสิบเท่า โดยใช้พื้นที่ดิสก์ประมาณ 1.6 GB ส่วน Qwen3-ASR 1.7B นำอีกหกแถว ใช้พื้นที่ประมาณ 2.5 GB และหน่วยความจำ 2.43 GiB Parakeet V3 ใช้ 465 MB และ 0.09 GiB นำ Turbo ในภาษาฝรั่งเศส ตามหลังในภาษาโปแลนด์ และไม่มีภาษาญี่ปุ่น เกาหลี จีน หรือกวางตุ้ง Whisper Small เป็นตัวเปรียบเทียบที่ใกล้ที่สุดที่ 600 MB และ Apple Speech ทำได้แม่นกว่าในแปดจากสิบภาษาที่ทั้งสองวัดได้อย่างเรียบร้อย

คุณควรใช้ Apple Speech แทนโมเดลที่ดาวน์โหลดหรือไม่?

ไล่ทีละภาษา:

  • อังกฤษ: ไม่เหมาะ Apple Speech ได้คะแนน 8.80; Qwen3-ASR 1.7B (4.49) หรือ Whisper Large V3 Turbo (5.49) แม่นกว่าอย่างชัดเจน
  • เยอรมัน: ไม่เหมาะ Apple Speech ได้คะแนน 6.26; Qwen3-ASR 1.7B (2.85) หรือ Whisper Large V3 Turbo (4.05) แม่นกว่าอย่างชัดเจน
  • ดัตช์ รัสเซีย และโปแลนด์: Apple Speech ไม่มีโมเดลสำหรับทั้งสามภาษา Whisper Large V3 Turbo ได้แม่นที่สุดในแต่ละภาษา ที่ 5.69, 5.13 และ 5.45
  • ญี่ปุ่น: ใช้ได้ Apple Speech ได้คะแนน 6.36 ตามหลัง Whisper Large V3 Turbo ที่ 5.30
  • เกาหลี: ใช้ได้ Apple Speech ได้คะแนน 4.31 ตามหลัง Qwen3-ASR 1.7B ที่ 3.54
  • ฝรั่งเศส: ไม่เหมาะ Apple Speech ได้คะแนน 7.61; Qwen3-ASR 1.7B (4.57) หรือ Parakeet V3 (5.83) แม่นกว่าอย่างชัดเจน
  • จีน: ใช้ได้ Apple Speech ได้คะแนน 7.97 เสมอกับ Whisper Large V3 Turbo ส่วนโมเดลที่แม่นที่สุดคือ Qwen3-ASR 1.7B ที่ 6.49
  • สเปน: ไม่เหมาะ Apple Speech ได้คะแนน 5.41; Qwen3-ASR 1.7B (3.38) หรือ Whisper Large V3 Turbo (3.62) แม่นกว่าอย่างชัดเจน

Apple Speech คือชื่อย่อที่บทความนี้ใช้เรียก SpeechTranscriber ของ Apple ซึ่งเป็น API บนอุปกรณ์ที่แอป Mac ใดก็เรียกใช้ได้บน macOS 26 ขึ้นไป ไม่ใช่หนึ่งในโมเดลที่ Whisper Notes สำหรับ Mac ดาวน์โหลด โดยบิลด์ Mac ดาวน์โหลดตรง (DMG) มี Whisper, Parakeet V3, SenseVoice และ Qwen3-ASR ส่วนบิลด์บน iPhone และ Mac App Store มี Whisper, Parakeet V3 และ SenseVoice ตารางแยกตามเอนจินอยู่ใน หน้ารองรับภาษา

ไม่มีอะไรในที่นี้เปลี่ยนแปลงวิธีทำงานของ Whisper Notes สำหรับ Mac ในวันนี้: Parakeet V3 ยังเป็นโมเดลเริ่มต้น

คำถามที่พบบ่อย

Apple Speech แม่นเท่า Whisper หรือไม่?

ไม่ใช่ในภาษาส่วนใหญ่ที่ทั้งสองรองรับ ในการทดสอบ FLEURS ของเราเอง จากเจ็ดในสิบภาษานี้ที่ Apple Speech รองรับ Whisper Large V3 Turbo ทำได้แม่นกว่าในหกภาษา และทั้งสองเสมอกันพอดีในภาษาจีนที่ CER 7.97% เท่ากัน เมื่อเทียบกับ Whisper Small ลำดับจะกลับกัน โดย Apple Speech ทำผลงานนำในหกจากเจ็ดภาษาและแพ้เฉพาะภาษาอังกฤษ WER 8.80% เทียบกับ 7.04% เอนจินนี้ไม่ได้นำในภาษาใดที่วัดได้อย่างเรียบร้อยในการทดสอบนี้ และใกล้ที่สุดในภาษาเกาหลีที่ CER 4.31% เทียบกับ 3.54% ของผู้นำในแถว กวางตุ้งเป็นภาษาเดียวที่วัดได้อย่างเรียบร้อยซึ่งเอนจินนี้เอาชนะ Whisper Large V3 Turbo ในการทดสอบนี้ ที่ CER 8.69% เทียบกับ 36.75% ใช้เอนจินในตัวเมื่อรองรับภาษาของคุณและคุณต้องการให้ macOS จัดการแพ็กภาษา ใช้ Whisper Large V3 Turbo เมื่อต้องการผลที่แม่นที่สุด หรือเมื่อภาษาของคุณเป็นหนึ่งในสามภาษาที่ Apple Speech ไม่มีในที่นี้

Apple Speech รองรับภาษาใดบ้าง?

macOS เป็นผู้กำหนดรายชื่อ ไม่ใช่แอป ในการทดสอบนี้ Apple Speech ได้ให้ผลลัพธ์ใน 21 จาก 83 การกำหนดค่าภาษาที่เราทดสอบ เทียบกับ 83 สำหรับ Whisper ทั้งสองบิลด์ 30 สำหรับ Qwen3-ASR 1.7B และ 25 สำหรับ Parakeet V3 ในสิบภาษาในบรรดาภาษาที่ใช้กันอย่างแพร่หลายในตารางหลัก เอนจินนี้รองรับภาษาอังกฤษ เยอรมัน ญี่ปุ่น เกาหลี ฝรั่งเศส จีน และสเปน แต่ไม่รองรับภาษาดัตช์ โปแลนด์ หรือรัสเซีย ตารางที่สองมีอีกสิบสี่การกำหนดค่า ได้แก่ อิตาลี กวางตุ้ง โปรตุเกสแบบบราซิล และอีกสิบเอ็ดภาษาที่เอนจินได้ตอบเป็นการถอดอักษรละตินแทนอักษรท้องถิ่น แอปต้องถาม macOS ขณะรันว่าเครื่องหนึ่งมีภาษาใดบ้าง หากภาษาของคุณไม่มี Whisper รองรับทุกภาษาในรายชื่อของแอปบนทุกช่องทาง

Apple Speech หรือ Parakeet V3 — เลือกอะไรดี?

Parakeet V3 สำหรับทุกภาษายุโรปที่ทั้งสองรองรับ โมเดลนี้ได้คะแนน 6.89 เทียบกับ 8.80 ในภาษาอังกฤษ 5.83 เทียบกับ 7.61 ในภาษาฝรั่งเศส 4.86 เทียบกับ 5.41 ในภาษาสเปน 3.43 เทียบกับ 4.39 ในภาษาอิตาลี และ 6.49 เทียบกับ 9.35 ในภาษาโปรตุเกสแบบบราซิล ส่วนภาษาเยอรมันเสมอกันที่ 6.26 Parakeet V3 ไม่มีภาษาญี่ปุ่น เกาหลี จีน หรือกวางตุ้ง ดังนั้นในภาษาเหล่านั้น Apple Speech จึงเป็นตัวเดียวในสองตัวนี้ที่มีอยู่ และตามหลังผู้นำของแถวไม่เกิน 1.5 จุดในภาษาญี่ปุ่น เกาหลี และจีน Parakeet V3 เป็นไฟล์ดาวน์โหลด 465 MB และได้รันที่ 75.6× ของเวลาจริงด้วยหน่วยความจำสูงสุด 0.09 GiB แพ็กภาษาของ Apple Speech ดาวน์โหลดโดย macOS และเอนจินได้รันที่ 30.8× ด้วยหน่วยความจำที่เราไม่ได้รายงาน

SpeechAnalyzer คืออะไร และเหมือนกับ Apple Dictation หรือไม่?

SpeechAnalyzer คือ API หลักที่ Apple เปิดตัวใน WWDC 2025 และเปิดให้ใช้ใน macOS 26 กับ iOS 26 ส่วน SpeechTranscriber คือจุดการทำงานด้านการถอดเสียงภายใน API ซึ่งเป็นสิ่งที่เราได้วัดและบทความนี้เรียกว่า Apple Speech ส่วน Dictation คือจุดการทำงานที่เน้นความเข้ากันได้ และเราได้รันด้วยเช่นกัน Apple Speech ทำได้แม่นกว่าในทั้งสิบภาษาที่ทั้งสองจัดการได้อย่างเรียบร้อย โดยลดความผิดพลาดของภาษาค่ามัธยฐานประมาณหนึ่งในสาม และลดได้มากกว่าครึ่งในภาษาฝรั่งเศสกับเยอรมัน Dictation ครอบคลุมภาษามากกว่า: 33 การกำหนดค่าเทียบกับ 21 จึงเป็นเอนจินระบบสำหรับภาษาดัตช์ โปแลนด์ หรือรัสเซีย หากคุณยอมรับ WER 17.34%, 13.50% และ 13.13% ได้ Whisper Large V3 Turbo ทำคะแนนได้ 5.69%, 5.45% และ 5.13% บนคลิปเดียวกัน

เสียงออกจาก Mac ของฉันหรือไม่เมื่อใช้ Apple Speech?

Apple ระบุในเอกสารว่า SpeechTranscriber เป็นระบบรู้จำเสียงพูดบนอุปกรณ์ โดย macOS ดาวน์โหลดทรัพยากรภาษาเพียงครั้งเดียว และการรู้จำทำงานในเครื่อง เราได้วัดความแม่นยำและความเร็ว ไม่ใช่พฤติกรรมเครือข่าย จึงอธิบายส่วนนั้นตามคำอธิบายของ Apple เอนจินที่ Whisper Notes ดาวน์โหลดเอง — Whisper, Parakeet V3, SenseVoice และ Qwen3-ASR — ทำงานบน GPU หรือ Neural Engine ของ Mac คุณเองโดยไม่ต้องมีบัญชีและไม่ต้องมี API key และการถอดเสียงทำงานได้ขณะปิดเครือข่ายบนทุกช่องทาง

ทำไมตัวเลขเหล่านี้ไม่ตรงกับความแม่นยำที่ฉันได้จากไฟล์บันทึกของตัวเอง?

เพราะ FLEURS เป็นเสียงอ่านสั้นและสะอาด ส่วนไฟล์บันทึกของคุณไม่ใช่ การทดสอบของเราเป็นการสอบเทียบบนชุดข้อมูลสาธารณะ: ภาษาละประมาณ 150 ประโยคและเสียง 30 นาที M5 MacBook Air หนึ่งเครื่อง คลิปชุดเดียวกันสำหรับทุกเอนจิน ผลนี้บอกว่าเอนจินหนึ่งพอจะใช้กับภาษาหนึ่งได้หรือไม่ ไม่ได้บอกว่าคุณจะได้ผลอย่างไรในการประชุม ในเสียงรบกวน ในเสียงพูดที่มีสำเนียง หรือในไฟล์ยาวสองชั่วโมง

ทำไมการทดสอบอื่นถึงบอกว่า Apple Speech แม่นกว่า Whisper?

เพราะการทดสอบเหล่านั้นเทียบกับ Whisper Small และวัดเฉพาะภาษาอังกฤษ เมื่อเทียบกับ Whisper Small ผลของเราก็ตรงกัน คือ Apple Speech ชนะในแปดจากสิบภาษาที่ทั้งสองวัดได้อย่างเรียบร้อย ภาษาอังกฤษเป็นหนึ่งในสองภาษาที่แพ้ ที่ 8.80 เทียบกับ 7.04 ผลนี้ไม่ได้ตามไปถึง Whisper Large V3 Turbo ซึ่ง Apple Speech ตามหลังในแปดจากสิบภาษาเดียวกัน เสมอในภาษาจีนที่ 7.97 และนำเฉพาะภาษากวางตุ้ง การเลือกว่าจะเทียบกับ Whisper ตัวไหนจึงเป็นตัวกำหนดพาดหัว

ลองใช้เลย

โมเดลที่ดาวน์โหลดได้ทั้งห้าตัวในที่นี้ — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small และ Qwen3-ASR 1.7B — อยู่ใน Whisper Notes สำหรับ Mac บิลด์ดาวน์โหลดตรง (DMG) ที่การตั้งค่า จากนั้นโมเดลถอดเสียง

หากตัวเลขของเราไม่ตรงกับประสบการณ์ของคุณในภาษาหนึ่ง โปรดส่งอีเมลถึง mac@whispernotes.app บันทึกประจำรุ่นฉบับเต็ม: whispernotes.app/changelog

แหล่งที่มา: การทดสอบของเราบนส่วนทดสอบของ Google FLEURS ที่รุ่น 70bb2e84 เอกสาร SpeechAnalyzer ของ Apple และ การทดสอบ Qwen3-ASR สามสิบภาษา ก่อนหน้านี้