Apple Speech vs Whisper: 새 SpeechAnalyzer의 한국어 정확도는?

2026년 9월 1일
·
8 min read
·Whisper Notes Team

macOS 26과 iOS 26부터 Apple은 새로운 세대의 온디바이스 음성 인식인 SpeechAnalyzer와 SpeechTranscriber를 제공하고 있습니다. 아래에서는 줄여서 Apple Speech라고 부릅니다. 이전 받아쓰기 엔진보다 눈에 띄게 정확합니다. 그래서 확인하고 싶었습니다: 이제 Apple 내장 음성 인식만으로 별도 전사 앱 없이도 충분할까? 그리고 Whisper Notes의 온디바이스 오픈 모델인 Whisper, Parakeet, SenseVoice, Qwen3-ASR과는 얼마나 차이가 날까? 엄격하게 측정한 결과를 소개합니다. 저희가 측정한 열 개 언어 가운데 Apple Speech가 오류율이 가장 낮은 언어는 하나도 없었고, 한국어와 일본어, 중국어에서는 선두와 1.5점 이내였으며, 네덜란드어와 러시아어, 폴란드어에는 모델 자체가 없습니다.

Apple Speech와 다운로드 모델의 차이는 얼마나 큰가

언어 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
영어 8.80 4.49 5.49 7.04 6.89 8.46
독일어 6.26 2.85 4.05 8.67 6.26
네덜란드어 7.36 5.69 16.75 8.58
러시아어 5.65 5.13 11.37 7.12
폴란드어 12.59 5.45 15.81 8.30
일본어 6.36 5.74 5.30 11.37 6.78
한국어 4.31 3.54 4.25 7.30 7.85
프랑스어 7.61 4.57 5.97 13.24 5.83
중국어 7.97 6.49 7.97 20.50 7.69
스페인어(라틴 아메리카) 5.41 3.38 3.62 6.22 4.86

가장 많이 사용되는 언어 중 열 개를 엔진별 열로 비교했습니다. 각 셀은 해당 엔진의 오류율이며 낮을수록 좋습니다. 초록색은 행의 최저값, 흰색은 두 번째로 낮은 값을 뜻합니다. 일본어, 한국어, 중국어는 문자 오류율(CER), 나머지는 단어 오류율(WER)이며 하나의 숫자로 합치지 않았습니다. Whisper Notes 팀이 직접 돌린 FLEURS, M5 MacBook Air 한 대, 낭독 음성입니다.

표의 짧은 이름: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. 대시는 해당 엔진에 그 언어용 모델이 없다는 뜻입니다.

열 개 언어 중 Qwen3-ASR 1.7B가 여섯 개에서 최저 오류율을 기록했고, 나머지 네 개에서는 Whisper Large V3 Turbo가 가장 낮았습니다. Apple Speech는 행 선두와 한국어에서 0.77점, 일본어에서 1.06점, 중국어에서 1.48점 차이이며, 중국어에서는 Whisper Large V3 Turbo와 7.97로 같습니다. 지원하는 일곱 개 언어에서는 행 선두보다 0.8~4.3점 뒤졌고, 격차가 가장 큰 영어는 8.80 대 4.49였습니다. 네덜란드어, 폴란드어, 러시아어에는 Apple Speech 결과가 없습니다.

Apple Speech는 어떤 언어를 지원하나

이번 측정에서 Apple Speech는 83개 언어 구성 중 21개에서 결과를 반환했습니다. 두 Whisper 모델은 83개 전부, Qwen3-ASR 1.7B는 30개, Parakeet V3는 25개를 지원합니다. 위의 열 개 언어 중 네덜란드어, 폴란드어, 러시아어용 모델은 없습니다. 인용할 수 있는 고정 목록도 없습니다. 언어 자산은 macOS가 관리하므로 앱은 실행 시점에 해당 기기에서 무엇을 쓸 수 있는지 조회합니다.

언어 Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
이탈리아어 4.39 2.58 2.58 7.64 3.43
광둥어 8.69 6.44 36.75 119.01 37.23
포르투갈어(브라질) 9.35 5.17 5.44 8.61 6.49
힌디어 101.50 13.19 29.64 61.26
텔루구어 101.63 81.74 103.19
우르두어 101.69 23.39 38.83
펀자브어 101.75 92.05 103.40
벵골어 102.00 83.52 117.37
네팔어 102.13 88.59 118.84
말라얄람어 102.18 107.34 167.16
마라티어 102.23 82.69 109.95
칸나다어 103.83 72.07 116.10
구자라트어 104.52 75.31 108.91
타밀어 113.01 71.28 79.77

Apple Speech가 결과를 반환한 나머지 열네 개 언어를 자체 오류율 순으로 나열했습니다. 열, 색상, 짧은 이름은 위와 같습니다. 광둥어는 문자 오류율, 나머지는 단어 오류율입니다. 삽입 오류도 분자에 포함되므로 오류율은 100%를 넘을 수 있습니다.

마지막 열한 행인 힌디어부터 타밀어까지 Apple Speech는 원래 문자 대신 라틴 문자 음역으로 답했습니다. 따라서 그 오류율은 인식 정확도가 아니라 문자 체계 불일치를 측정하며, 해당 셀은 행 순위에서 제외했습니다. 같은 행의 다른 엔진 값은 일반적인 측정값입니다.

SpeechAnalyzer의 작동 방식

Apple은 iOS 10부터 음성 인식 API를 제공해 왔습니다. 기존 SFSpeechRecognizer는 이전 받아쓰기 경로를 뒷받침하는 엔진입니다. 이를 대체하는 SpeechAnalyzer는 macOS 26과 iOS 26에서 도입됐으며 watchOS를 제외한 모든 Apple 플랫폼에서 사용할 수 있습니다.

이 API는 세션을 중심으로 구성됩니다. SpeechAnalyzer를 만들고 하나 이상의 모듈을 붙인 뒤 오디오를 공급합니다. 음성을 텍스트로 바꾸는 모듈이 SpeechTranscriber입니다. 직접 채우는 비동기 시퀀스로 오디오가 들어가고 결과는 두 번째 시퀀스로 돌아오며, 둘은 보통 서로 다른 작업에서 실행됩니다. 분석기는 한 번에 입력 시퀀스 하나만 받습니다. 모든 버퍼와 결과에는 오디오 자체 타임라인 기준의 시간 코드가 붙으므로 결과를 원래 위치에 다시 놓을 수 있습니다.

Apple WWDC25 SpeechAnalyzer 동시성 다이어그램. 입력 작업이 입력 AsyncSequence를 분석 작업의 SpeechAnalyzer와 SpeechTranscriber에 전달하고, 결과 AsyncSequence가 결과 작업과 사용자 인터페이스로 전송되는 구조

한 세션, 세 작업: 오디오는 AsyncSequence로 들어가고 SpeechAnalyzer와 SpeechTranscriber가 분석하며, 결과는 두 번째 AsyncSequence로 인터페이스에 돌아옵니다. 출처: Apple, WWDC25 세션 277.

결과는 두 번 도착합니다. Apple이 volatile range라고 부르는 가변 범위 안의 내용은 더 나은 결과로 바뀔 수 있고, 범위 밖의 내용은 확정됩니다. 앱은 이 방식으로 말하는 동안 임시 전사문을 보여 주고 나중에 바로잡을 수 있습니다.

Apple이 밝힌 SpeechTranscriber 모델의 설계 목표는 다섯 가지입니다: 긴 오디오, 대화 음성, 멀리 있는 화자, 짧은 지연 시간, 그리고 기기에서 실행된다는 의미의 개인정보 보호입니다. 메모, 음성 메모, 저널, 통화 요약이 이를 기반으로 합니다.

긴 오디오, 대화 음성, 멀리 있는 화자, 짧은 지연 시간, 개인정보 보호라는 SpeechTranscriber 모델의 기능을 나열한 Apple WWDC25 슬라이드

Apple이 밝힌 SpeechTranscriber 모델의 다섯 가지 설계 목표. 출처: Apple, WWDC25 세션 277.

모델은 어느 앱에도 포함되지 않습니다. Apple 서버에서 AssetInventory를 통해 다운로드되며, 시스템이 저장하고 업데이트해 앱끼리 공유합니다. 앱의 다운로드 크기나 메모리 공간에는 더해지지 않고 디코딩은 호출한 프로세스 밖에서 이뤄집니다. 특정 언어나 기기에 SpeechTranscriber 모델이 없으면 DictationTranscriber가 시스템 받아쓰기와 같은 모델로 이어받습니다.

측정 방법

이 글의 모든 엔진은 M5 MacBook Air(32 GB, macOS 27.0)에서 같은 클립을 같은 순서로 한 번에 하나씩 전사했습니다. 오디오는 Google FLEURS 테스트 분할 리비전 70bb2e84이며, 언어당 약 150문장과 30분입니다. 데이터셋 자체 항목 ID의 고정 해시로 순서를 정하고 삼십 분을 넘기는 가장 짧은 온전한 항목 구간을 사용했습니다. 모델 출력은 이 선택에 전혀 관여하지 않았습니다. 각 셀을 자체 기록에서 다시 계산하고 재확인했으며 285개 모두 통과했습니다.

띄어쓰기로 단어를 구분하는 언어는 단어 오류율, 일본어, 한국어, 중국어, 광둥어는 문자 오류율로 채점했습니다. FLEURS는 회의나 받아쓰기가 아닌 낭독 음성입니다. 이 표는 어떤 엔진이 해당 언어에서 시도할 만한지를 보여 주며, 실제 녹음에서 얻을 결과를 예측하지는 않습니다.

이전 Apple Dictation보다 얼마나 좋아졌나

Apple은 두 가지 전사 작동점을 제공하며 저희는 둘 다 측정했습니다. 새 작동점은 SpeechTranscriber로, 이 글에서 Apple Speech라고 부르는 대상입니다. DictationTranscriber는 호환성을 위한 작동점으로, 이전 Mac의 받아쓰기 경로입니다.

언어 Apple Dictation Apple Speech
한국어 7.11 4.31
이탈리아어 6.93 4.39
스페인어(라틴 아메리카) 8.43 5.41
독일어 12.69 6.26
일본어 9.37 6.36
프랑스어 17.10 7.61
중국어 10.28 7.97
광둥어 10.18 8.69
영어 13.83 8.80
포르투갈어(브라질) 10.85 9.35

Apple의 두 작동점이 모두 깔끔하게 측정된 모든 언어를 Apple Speech 오류율 순으로 나열했습니다. 초록색은 행에서 더 나은 값입니다. 같은 측정, 같은 클립, 같은 Mac입니다. 일본어, 한국어, 중국어, 광둥어는 문자 오류율, 나머지는 단어 오류율입니다.

열 개 언어 모두 Apple Speech가 더 정확했습니다. 중앙값 언어는 오류가 약 삼분의 일 줄었고, 프랑스어와 독일어는 절반 이상, 브라질 포르투갈어와 광둥어는 오류 일곱 개 중 약 하나가 줄었습니다.

이는 Apple 자체의 과거와 비교한 결과입니다. 다운로드 모델과 비교하면 깔끔하게 측정된 언어에서의 최고 순위는 광둥어 두 번째였습니다. Dictation은 더 많은 언어를 지원해 이번 측정에서 33개 구성 대 21개였으며, 새 엔진에 없는 세 언어도 모두 포함합니다.

내장 엔진이 주는 이점

엔진 속도 최대 메모리 다운로드
SenseVoice Small 실시간의 162.3배 0.95 GiB 827 MB
Parakeet V3 실시간의 75.6배 0.09 GiB 465 MB
Apple Speech 실시간의 30.8배 수치 미보고 언어 팩은 앱이 아닌 macOS가 다운로드
Qwen3-ASR 1.7B 실시간의 11.1배 2.43 GiB 약 2.5 GB
Whisper Small 실시간의 7.9배 0.87 GiB 600 MB
Whisper Large V3 Turbo 실시간의 3.0배 1.87 GiB 약 1.6 GB

속도는 이 글에서 깔끔하게 측정된 열세 개 언어 중 각 엔진을 실제 실행한 언어의 중앙값입니다. 격리된 항목 처리량을 나타내는 진단값이지 제품 지연 시간은 아닙니다. 최대 메모리는 이번 측정의 프로세스 그룹 최댓값입니다. Apple Speech는 호출 앱이 소유하지 않는 macOS 서비스 안에서 디코딩하므로 여기에 어떤 수치를 넣어도 다른 다섯 엔진과 같은 의미가 되지 않습니다.

Apple Speech 언어 자산은 시스템이 한 번 다운로드해 모든 앱이 공유합니다. 앱 자체에는 모델이 포함되지 않으며 앱 자체 프로세스에 메모리를 할당하지도 않습니다. 시스템 서비스는 작업 중 여전히 메모리를 사용하지만 이를 정확히 귀속할 수 없으므로, 영으로 적는 대신 수치를 보고하지 않습니다. 속도는 실시간의 30.8배로 Parakeet V3와 SenseVoice Small보다 느렸습니다.

Whisper Large V3 Turbo는 열 개 행 중 네 개에서 선두지만 여기서는 가장 느린 엔진으로, Apple Speech보다 약 열 배 느리고 디스크에서 약 1.6 GB를 차지합니다. Qwen3-ASR 1.7B는 나머지 여섯 행에서 선두이며 약 2.5 GB와 2.43 GiB 메모리를 사용합니다. Parakeet V3는 465 MB와 0.09 GiB이고, 프랑스어에서는 Turbo보다 앞서지만 폴란드어에서는 뒤지며 일본어, 한국어, 중국어, 광둥어용 모델이 없습니다. 600 MB인 Whisper Small이 가장 가까운 비교 대상이며, 두 엔진이 모두 깔끔하게 측정된 열 개 언어 중 여덟 개에서 Apple Speech가 더 정확했습니다.

Apple Speech를 다운로드 모델 대신 써야 할까

언어별로 보면 다음과 같습니다:

  • 영어: 적합하지 않습니다. Apple Speech는 8.80을 기록했습니다. Qwen3-ASR 1.7B(4.49) 또는 Whisper Large V3 Turbo(5.49)가 확실히 더 정확합니다.
  • 독일어: 적합하지 않습니다. Apple Speech는 6.26을 기록했습니다. Qwen3-ASR 1.7B(2.85) 또는 Whisper Large V3 Turbo(4.05)가 확실히 더 정확합니다.
  • 네덜란드어, 러시아어, 폴란드어: Apple Speech에는 이 세 언어용 모델이 없습니다. Whisper Large V3 Turbo는 각각 5.69, 5.13, 5.45로 모두 가장 정확했습니다.
  • 일본어: 사용할 만합니다. Apple Speech는 6.36으로, Whisper Large V3 Turbo의 5.30보다 뒤졌습니다.
  • 한국어: 사용할 만합니다. Apple Speech는 4.31로, Qwen3-ASR 1.7B의 3.54보다 뒤졌습니다.
  • 프랑스어: 적합하지 않습니다. Apple Speech는 7.61을 기록했습니다. Qwen3-ASR 1.7B(4.57) 또는 Parakeet V3(5.83)가 확실히 더 정확합니다.
  • 중국어: 사용할 만합니다. Apple Speech는 7.97로 Whisper Large V3 Turbo와 같습니다. 가장 정확한 것은 Qwen3-ASR 1.7B의 6.49였습니다.
  • 스페인어: 적합하지 않습니다. Apple Speech는 5.41을 기록했습니다. Qwen3-ASR 1.7B(3.38) 또는 Whisper Large V3 Turbo(3.62)가 확실히 더 정확합니다.

Apple Speech는 이 글에서 Apple의 SpeechTranscriber를 줄여 부르는 이름으로, macOS 26 이상에서 모든 Mac 앱이 호출할 수 있는 온디바이스 API입니다. 이는 Mac용 Whisper Notes가 다운로드하는 모델에 포함되지 않습니다. Mac Direct Download(DMG) 버전에는 Whisper, Parakeet V3, SenseVoice, Qwen3-ASR이 있고, iPhone과 Mac App Store 버전에는 Whisper, Parakeet V3, SenseVoice가 있습니다. 엔진별 표는 언어 지원 페이지에 있습니다.

이 결과가 현재 Mac용 Whisper Notes의 동작을 바꾸지는 않습니다: Parakeet V3는 여전히 기본 모델입니다.

자주 묻는 질문

Apple Speech는 Whisper만큼 정확한가요?

두 엔진이 모두 지원하는 언어 대부분에서는 아닙니다. 저희 FLEURS 측정에서 이 열 개 언어 중 Apple Speech가 지원하는 일곱 개를 보면, Whisper Large V3 Turbo가 여섯 개에서 더 정확했고 중국어는 각각 문자 오류율 7.97%로 정확히 같았습니다. Whisper Small과 비교하면 순서가 뒤집힙니다. Apple Speech가 일곱 개 중 여섯 개에서 앞섰고 영어만 단어 오류율 8.80% 대 7.04%로 졌습니다. 이번에 깔끔하게 측정된 언어 중 선두는 하나도 없었고, 가장 가까운 한국어에서 문자 오류율 4.31%, 행 선두는 3.54%였습니다. 광둥어는 깔끔하게 측정된 언어 중 Whisper Large V3 Turbo를 이긴 유일한 언어로, 문자 오류율 8.69% 대 36.75%였습니다. 지원 언어에서 언어 팩 관리를 macOS에 맡기려면 내장 엔진을, 가장 정확한 결과가 필요하거나 Apple Speech에 없는 세 언어 중 하나라면 Whisper Large V3 Turbo를 쓰세요.

Apple Speech는 어떤 언어를 지원하나요?

목록은 앱이 아니라 macOS가 정합니다. 이번 측정에서 Apple Speech는 테스트한 83개 언어 구성 중 21개에서 결과를 냈고, 두 Whisper 빌드는 83개, Qwen3-ASR 1.7B는 30개, Parakeet V3는 25개였습니다. 주 표의 가장 많이 사용되는 열 개 언어에서는 영어, 독일어, 일본어, 한국어, 프랑스어, 중국어, 스페인어를 지원하고 네덜란드어, 폴란드어, 러시아어는 지원하지 않습니다. 두 번째 표에는 나머지 열네 개 구성인 이탈리아어, 광둥어, 브라질 포르투갈어와 원래 문자 대신 라틴 문자 음역으로 답한 열한 개 언어가 있습니다. 앱은 실행 시점에 해당 기기에 어떤 언어가 있는지 macOS에 물어야 합니다. 해당 언어가 없다면 Whisper는 모든 배포 채널에서 앱 목록의 모든 언어를 지원합니다.

Apple Speech와 Parakeet V3 중 어느 것을 골라야 하나요?

둘 다 지원하는 모든 유럽 언어에서는 Parakeet V3입니다. 영어 6.89 대 8.80, 프랑스어 5.83 대 7.61, 스페인어 4.86 대 5.41, 이탈리아어 3.43 대 4.39, 브라질 포르투갈어 6.49 대 9.35였고 독일어는 6.26으로 같았습니다. Parakeet V3에는 일본어, 한국어, 중국어, 광둥어용 모델이 없어 둘 중 Apple Speech만 존재하며, 일본어, 한국어, 중국어에서는 행 선두와 1.5점 이내입니다. Parakeet V3는 465 MB를 다운로드하며 실시간의 75.6배, 최대 메모리 0.09 GiB였습니다. Apple Speech 언어 팩은 macOS가 다운로드하며 실시간의 30.8배로 실행됐고 메모리 수치는 보고하지 않습니다.

SpeechAnalyzer란 무엇이며 Apple Dictation과 같은 것인가요?

SpeechAnalyzer는 Apple이 WWDC 2025에서 발표해 macOS 26과 iOS 26에서 제공하기 시작한 포괄적 API입니다. 그 안의 전사 작동점이 SpeechTranscriber이며, 저희가 측정하고 이 글에서 Apple Speech라고 부르는 대상입니다. Dictation은 호환성 작동점으로, 이것도 측정했습니다. 두 작동점 모두 깔끔하게 측정된 열 개 언어에서 Apple Speech가 전부 더 정확했고, 중앙값 언어의 오류를 약 삼분의 일, 프랑스어와 독일어에서는 절반 이상 줄였습니다. Dictation은 더 많은 언어를 지원해 33개 구성 대 21개입니다. 따라서 단어 오류율 17.34%, 13.50%, 13.13%를 받아들일 수 있다면 네덜란드어, 폴란드어, 러시아어용 시스템 엔진입니다. 같은 클립에서 Whisper Large V3 Turbo는 5.69%, 5.45%, 5.13%였습니다.

Apple Speech를 쓰면 오디오가 Mac 밖으로 나가나요?

Apple은 SpeechTranscriber를 온디바이스 음성 인식으로 설명합니다. macOS가 언어 자산을 한 번 다운로드하고 인식은 로컬에서 실행됩니다. 저희가 측정한 것은 정확도와 속도이지 네트워크 동작이 아니므로 이 부분은 Apple의 설명에 따릅니다. Whisper Notes가 직접 다운로드하는 Whisper, Parakeet V3, SenseVoice, Qwen3-ASR은 Mac 자체 GPU나 Neural Engine에서 실행되고 계정과 API key가 필요 없으며, 모든 배포 채널에서 네트워크를 꺼도 전사됩니다.

이 숫자가 실제 녹음에서 얻는 정확도와 다른 이유는 무엇인가요?

FLEURS는 짧고 깨끗한 낭독 음성이며 실제 녹음은 그렇지 않기 때문입니다. 이번 측정은 공개 데이터셋에서 한 보정입니다: 언어당 약 150문장과 30분 오디오, M5 MacBook Air 한 대, 모든 엔진에 같은 클립을 썼습니다. 어떤 엔진이 해당 언어에서 시도할 만한지는 알 수 있지만 회의, 잡음이 있는 오디오, 억양이 강한 말, 두 시간짜리 파일에서 얻을 결과를 예측하지는 않습니다.

다른 벤치마크에서는 왜 Apple Speech가 Whisper보다 낫다고 하나요?

비교 대상이 Whisper Small이고 영어만 측정하기 때문입니다. Whisper Small과 비교하면 저희 측정도 같은 결론입니다. 두 엔진이 모두 깔끔하게 측정된 열 개 언어 중 여덟 개에서 Apple Speech가 더 정확했습니다. 진 두 언어 중 하나가 영어로, 8.80 대 7.04였습니다. 이 결과는 Whisper Large V3 Turbo에는 이어지지 않습니다. 같은 열 개 언어 중 여덟 개에서 Apple Speech가 뒤졌고, 중국어는 7.97로 같았으며 앞선 언어는 광둥어뿐이었습니다. 어느 Whisper와 비교하느냐가 제목을 정합니다.

직접 써 보세요

여기 있는 다섯 가지 다운로드 모델인 Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small, Qwen3-ASR 1.7B는 모두 Mac용 Whisper Notes Direct Download(DMG) 버전에 있으며, 설정 → 전사 모델에서 선택할 수 있습니다.

어떤 언어에서 저희 수치가 실제 경험과 맞지 않는다면 mac@whispernotes.app으로 메일을 보내 주세요. 전체 릴리스 노트: whispernotes.app/changelog.

출처: Google FLEURS 테스트 분할 리비전 70bb2e84에서 저희가 수행한 측정, Apple의 SpeechAnalyzer 문서와 앞서 진행한 서른 개 언어 Qwen3-ASR 측정.