확인하고 싶었던 건 하나였습니다. 내 언어를 Whisper Large V3보다 정확하게 전사하는 로컬 모델이 있을까? 그래서 FLEURS 데이터셋에서 이 모델들을 직접 측정했습니다.
FLEURS는 102개 언어의 낭독 음성을 모은 Google 데이터셋입니다. 각 언어에서 약 75문장을 뽑아, 똑같은 클립을 똑같은 순서로 다섯 개 모델에 통과시켰습니다:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
결과는 이렇습니다.
Qwen3-ASR 1.7B 대 Whisper Large V3 Turbo — 저희가 직접 돌린 FLEURS, M5 MacBook Air 1대, 낭독 음성, 짧은 클립.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| 지원 언어 | 30 | 101 |
| 확실한 우위 | 광둥어, 힌디어, 태국어, 베트남어, 프랑스어(5개) | 핀란드어, 헝가리어, 그리스어 등 11개 언어 |
| 속도 | 실시간의 8.7배 | 실시간의 2.4배 |
| 최대 메모리 | 2.43 GiB | 1.87 GiB |
| 다운로드 | 약 2.5 GB | 약 1.6 GB |
각자 강한 언어를 벗어나면 정확도 차이는 크지 않습니다.
Whisper Large V3와 Qwen3-ASR 상세 비교
30개 언어 전체를 Qwen이 가장 크게 앞선 쪽부터 가장 크게 뒤진 쪽까지 나열했습니다. 두 열 모두 숫자가 낮을수록 좋습니다.
저희가 직접 돌린 FLEURS, M5 MacBook Air 1대, 낭독 음성. 중국어, 광둥어, 일본어, 한국어, 태국어는 문자 오류율(CER), 나머지는 단어 오류율(WER). 초록색은 95% 오차 범위를 넘어선 우위입니다.
| 언어 | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| 광둥어 | 6.00 | 37.97 |
| 힌디어 | 13.67 | 30.42 |
| 태국어 | 5.92 | 12.95 |
| 베트남어 | 5.07 | 9.79 |
| 페르시아어 | 26.98 | 30.03 |
| 아랍어 | 14.14 | 15.75 |
| 인도네시아어 | 4.97 | 6.50 |
| 프랑스어 | 3.98 | 5.39 |
| 중국어 | 5.69 | 6.88 |
| 영어 | 5.07 | 5.92 |
| 독일어 | 3.51 | 4.10 |
| 일본어 | 5.39 | 5.71 |
| 한국어 | 3.51 | 3.70 |
| 스페인어 | 3.60 | 3.76 |
| 이탈리아어 | 2.98 | 3.05 |
| 러시아어 | 5.98 | 5.51 |
| 포르투갈어 | 5.64 | 4.91 |
| 마케도니아어 | 17.81 | 16.64 |
| 말레이어 | 11.60 | 10.18 |
| 네덜란드어 | 7.65 | 5.63 |
| 터키어 | 8.34 | 5.53 |
| 덴마크어 | 20.12 | 14.92 |
| 폴란드어 | 12.78 | 5.32 |
| 루마니아어 | 18.97 | 8.22 |
| 필리핀어 | 20.44 | 9.37 |
| 스웨덴어 | 20.04 | 8.72 |
| 체코어 | 23.92 | 11.15 |
| 그리스어 | 30.20 | 12.97 |
| 핀란드어 | 26.08 | 6.54 |
| 헝가리어 | 36.35 | 13.66 |
FLEURS 테스트 분할 리비전 70bb2e84에서 같은 클립으로 짝지어 직접 측정, 언어당 약 75문장, M5 MacBook Air 1대.
Qwen3-ASR 1.7B가 확실히 이긴 5개 언어. 오류율(%, Qwen 대 Turbo): 광둥어(6.0 대 38.0), 힌디어(13.7 대 30.4), 태국어(5.9 대 13.0), 베트남어(5.1 대 9.8), 프랑스어(4.0 대 5.4). 광둥어와 태국어는 문자 단위, 나머지는 단어 단위로 채점했습니다. Qwen의 강점은 문자 단위로 채점하는 언어에 몰려 있습니다. 중국어, 광둥어, 일본어, 한국어, 태국어 평균은 5.3%로 Turbo의 13.4%보다 낮고, 단어 단위로 채점한 나머지 25개 언어에서는 방향이 뒤집혀 Qwen 평균 14.0%, Turbo 10.2%입니다.
Whisper Large V3 Turbo가 확실히 이긴 11개 언어. 오류율(%, Qwen 대 Turbo), 모두 단어 단위: 헝가리어(36.4 대 13.7), 그리스어(30.2 대 13.0), 핀란드어(26.1 대 6.5), 체코어(23.9 대 11.2), 필리핀어(20.4 대 9.4), 덴마크어(20.1 대 14.9), 스웨덴어(20.0 대 8.7), 루마니아어(19.0 대 8.2), 폴란드어(12.8 대 5.3), 터키어(8.3 대 5.5), 네덜란드어(7.7 대 5.6).
차이가 작거나 대등한 14개 언어. 영어(5.1 대 5.9), 독일어(3.5 대 4.1), 스페인어(3.6 대 3.8), 이탈리아어(3.0 대 3.1), 러시아어(6.0 대 5.5), 포르투갈어(5.6 대 4.9). 중국어(5.7 대 6.9), 일본어(5.4 대 5.7), 한국어(3.5 대 3.7)는 문자 단위 채점입니다. 여기에 아랍어, 인도네시아어, 페르시아어, 말레이어, 마케도니아어가 더해집니다. 이 구간의 격차는 모두 작고 95% 구간 안에 들어가므로, 이번 측정으로는 두 모델을 가를 수 없습니다.
선택을 실제로 바꾸는 줄은 광둥어 하나입니다. 같은 클립에서 Whisper Large V3 Turbo는 문자 오류율 37.97%, 저희가 광둥어용으로 권해 온 SenseVoice Small은 36.71%로 둘 다 37% 언저리였습니다. Qwen3-ASR 1.7B는 6.00%였습니다. 이 낭독 음성에서는 앞의 두 숫자가 광둥어를 감당하지 못하므로, 예전 권장에는 이제 이 단서가 붙습니다.
Qwen3-ASR 1.7B는 얼마나 빠른가
다섯 엔진을 같은 측정 환경, 같은 기기(M5 MacBook Air)에서 쟀습니다. 적어도 서로 비교할 수는 있는 숫자입니다.
같은 FLEURS 측정에서 각 엔진이 지원하는 언어의 실시간 배속 중앙값. M5 MacBook Air 1대, 낭독 음성.
| 엔진 | 언어 수 | 이번 측정의 속도 중앙값(짧은 클립) |
|---|---|---|
| SenseVoice Small | 6개 언어 | 161.0배 |
| Parakeet TDT 0.6B v3 | 25 | 82.9배 |
| Qwen3-ASR 1.7B | 공식 30개 | 8.7배 |
| Whisper Small | 101 | 6.4배 |
| Whisper Large V3 Turbo | 101 | 2.4배 |
짧은 클립 측정값이라, 같은 엔진이 긴 녹음에서 내는 수치보다 낮게 나옵니다. 이 열은 이번 한 번의 측정 안에서 엔진끼리 비교하는 용도로만 쓰세요.
같은 측정 환경에서 Parakeet V3와 SenseVoice Small은 Qwen3-ASR보다 대략 자릿수가 하나 다를 만큼 빠릅니다. 짧은 클립이 아니라 긴 파일에서는 Parakeet가 M4 Pro에서 실시간의 103배, SenseVoice가 52배 이상을 기록했습니다. 다른 오디오에서 다른 방식으로 잰 값이지만 가리키는 방향은 같습니다.
Qwen3-ASR은 중간에 있습니다. 이번 짧은 클립 측정에서 가장 느린 엔진은 Qwen이 아니라 Whisper Large V3 Turbo였습니다. 다만 언어별 편차는 다른 엔진보다 큽니다. 그리스어 2.7배에서 일본어 12.4배까지 벌어집니다.
Qwen3-ASR은 메모리와 디스크를 얼마나 쓰나
최대 메모리는 같은 FLEURS 측정의 항목들에서 관측한 프로세스 최대 사용량. M5 MacBook Air 1대, 낭독 음성, 짧은 클립.
| 엔진 | 다운로드 | 이번 측정의 최대 메모리 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | 약 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | 약 2.5 GB | 2.43 GiB |
두 축 모두에서 Qwen3-ASR이 다섯 중 가장 무겁습니다. 다운로드 약 2.5 GB, 이번 측정의 프로세스 최대 메모리 2.43 GiB입니다. Whisper Large V3 Turbo는 약 1.6 GB와 1.87 GiB였습니다.
메모리 8 GB 기기라면 더 가벼운 선택지가 있습니다. Parakeet V3는 465 MB와 0.09 GiB로 25개 언어를, Whisper Small은 600 MB와 0.87 GiB로 101개 언어를 커버합니다.
측정 방법: FLEURS, 30개 언어, Mac 1대
Qwen3-ASR 1.7B는 MLX 8-bit 빌드로, Whisper Large V3 Turbo는 Metal에서 도는 whisper.cpp의 ggml 빌드로 실행했습니다. 데이터는 Google FLEURS 테스트 분할 리비전 70bb2e84(CC-BY-4.0)입니다. 102개 언어 중 83개, 언어당 약 75문장·15분 분량을 모든 모델에 같은 클립, 같은 순서로 통과시켰습니다. 짝지어 비교한 대상은 Qwen이 밝힌 30개 언어입니다. 띄어쓰기가 있는 언어는 단어 오류율, 중국어·광둥어·일본어·한국어·태국어는 문자 오류율로 재고 하나의 숫자로 합치지 않았습니다. 오차 범위는 항목 단위 부트스트랩 10,000회입니다. 기기는 M5 MacBook Air 1대, 32 GB, macOS 26.5이며 두 모델 모두 빈 출력이나 실패는 없었습니다.
FLEURS는 낭독 음성입니다. 회의도, 받아쓰기도 아닙니다. 낭독 음성의 순위는 저희 테스트에서만도 실제 오디오 앞에서 두 번 무너졌기 때문에 긴 녹음으로 확대 해석하지 않습니다. 이 표들이 말해 주는 것은 어떤 모델이 사용하는 언어에서 시도해 볼 만한가이지, 실제로 얻게 될 정확도가 아닙니다. Qwen3-ASR 1.7B의 실제 회의 평가는 따로 글로 쓰겠습니다.
Whisper Large V3 대신 Qwen3-ASR을 써야 할까
Mac용 Whisper Notes 안에서라면, 언어별로 이렇게 답하겠습니다.
- 광둥어, 힌디어, 태국어, 베트남어, 프랑스어를 전사한다면: Qwen3-ASR 1.7B를 고르세요.
- 중국어, 일본어, 한국어, 영어, 독일어, 스페인어, 이탈리아어를 전사한다면: 아주 근소하게 앞섰고, 저희가 주장할 수 있는 것도 그 근소한 차이뿐입니다. 어느 모델이든 괜찮습니다. 페르시아어, 아랍어, 인도네시아어, 러시아어, 포르투갈어, 마케도니아어, 말레이어도 마찬가지입니다.
- 핀란드어, 헝가리어, 그리스어, 체코어, 스웨덴어, 덴마크어, 폴란드어, 루마니아어, 필리핀어, 터키어, 네덜란드어를 전사한다면: Whisper Large V3 Turbo에 머무르세요. 이 11개 언어는 모두 확실히 이겼습니다.
- 속도나 저장 공간이 중요하다면: 이 엔진은 아닙니다. 같은 측정에서 Parakeet V3와 SenseVoice Small은 자릿수가 다를 만큼 더 빠르고 다운로드 용량도 몇 분의 일 수준입니다. Whisper Small은 600 MB로 101개 언어를 커버하며 이번 측정에서 6.4배였습니다.
- iPhone이나 Mac App Store 버전을 쓰고 있다면: 이 엔진은 아직 그쪽에 없습니다. 그 채널에서 광둥어는 SenseVoice로 하세요.
이것은 Mac용 Whisper Notes가 알리바바의 공개 모델 Qwen3-ASR을 기기에서 돌리도록 옮긴 것입니다. 공개 가중치를 Apple MLX 8-bit로 변환해 Mac의 GPU에서 실행하며, 오디오가 알리바바 서버로 가지 않습니다. Direct Download(DMG) 1.5.0에서 SenseVoice가 대체한 0.6B와는 다른 모델입니다.
사용 방법(Mac Direct Download, DMG 1.6.0 이상): 설정 → 전사 모델 → Qwen3-ASR 1.7B. 모델은 처음 사용할 때 앱 안에서 내려받으며 약 2.5 GB입니다. Apple Silicon에 macOS 15 이상이 필요하고 메모리는 16 GB를 권장합니다. 앱의 나머지 기능은 macOS 14에서도 동작합니다. 엔진별 지원 언어는 언어 지원 페이지에 있습니다. 로컬 CLI와 MCP 서버는 qwen, qwen3, qwen3-asr 세 이름을 모두 받습니다.
바꾸고 싶지 않다면 그대로 두셔도 됩니다. Parakeet V3는 여전히 기본 모델입니다.
자주 묻는 질문
Qwen3-ASR이 Whisper Large V3 Turbo보다 정확한가요?
언어에 따라 다르고, 승부는 거의 반반입니다. Mac용 Whisper Notes에서 저희가 직접 돌린 FLEURS 측정에서, 두 모델이 함께 지원하는 30개 언어 중 Qwen3-ASR 1.7B가 15개, Whisper Large V3 Turbo가 15개에서 앞섰습니다. Qwen이 확실히 앞선 언어는 광둥어(문자 오류율 6.00% 대 37.97%), 힌디어(단어 오류율 13.67% 대 30.42%), 태국어, 베트남어, 프랑스어입니다. Turbo가 확실히 앞선 언어는 핀란드어(단어 오류율 6.54% 대 26.08%), 헝가리어, 그리스어, 체코어, 스웨덴어, 덴마크어, 폴란드어, 루마니아어, 필리핀어, 터키어, 네덜란드어입니다. 30개 중 14개의 격차는 오차 범위 안이라 무승부로 읽어야 합니다. 쓰시는 언어가 Qwen이 앞선 쪽에 있고 Whisper Notes의 Mac Direct Download(DMG) 버전을 쓰신다면 Qwen3-ASR을, 그 밖의 경우와 Qwen의 30개에 없는 모든 언어에는 Whisper Large V3 Turbo를 고르세요. Whisper는 101개 언어를 모두 지원합니다.
iPhone이나 Mac App Store에서 Qwen3-ASR을 쓸 수 있나요?
현재는 Whisper Notes의 Mac Direct Download(DMG) 버전 1.6.0부터 들어 있습니다. Mac App Store 버전도 이후 릴리스에서 새 엔진을 받을 계획이지만 날짜는 아직 없습니다. 그때까지 iPhone 앱과 Mac App Store 버전에는 Whisper, Parakeet V3, SenseVoice 세 계열이 있고, Qwen이 인식하는 언어는 그곳의 Whisper도 모두 커버합니다. 모델 수로 세면 Mac App Store 버전은 오늘 기준 네 개, Direct Download 버전은 다섯 개입니다. Whisper가 Small과 Large V3 Turbo 두 가지로 들어가기 때문입니다. iPhone에서 광둥어가 필요하시면 그곳에서는 SenseVoice를 쓰세요.
중국어, 일본어, 한국어에는 Qwen3-ASR과 SenseVoice 중 무엇이 나은가요?
정확도는 가깝고 속도는 크게 벌어집니다. 저희 FLEURS 측정에서 Qwen3-ASR의 문자 오류율은 중국어 5.69%, 일본어 5.39%, 한국어 3.51%였고, SenseVoice Small은 같은 클립에서 각각 7.06%, 6.85%, 7.82%였습니다. 다만 같은 측정에서 SenseVoice의 실시간 배속 중앙값은 161배, Qwen은 8.7배였고, 다운로드는 827 MB 대 약 2.5 GB이며, SenseVoice는 iPhone과 두 Mac 버전 모두에서 쓸 수 있습니다. 광둥어를 전사하는 경우가 아니라면 SenseVoice를 고르세요. 광둥어에서는 Qwen3-ASR이 문자 오류율 6.00%, SenseVoice가 36.71%로 기다릴 만한 차이가 납니다.
Qwen3-ASR 1.7B의 시스템 요구 사항은 무엇인가요?
macOS 15 이상을 쓰는 Apple Silicon Mac, 권장 메모리 16 GB, 모델용 디스크 약 2.5 GB가 필요합니다. Mac용 Whisper Notes의 다른 부분보다 요구 사항이 높습니다. 앱 자체는 macOS 14 이상에서 돌아갑니다. 이번 벤치마크에서 이 모델의 프로세스 최대 메모리는 2.43 GiB로 다섯 엔진 중 가장 높았습니다. 메모리 8 GB Mac이라면 Whisper Small이 600 MB로 같은 101개 언어를, Parakeet V3가 465 MB로 25개 유럽 언어를 커버합니다.
Qwen3-ASR을 쓰면 오디오가 Mac 밖으로 나가나요?
아닙니다. 알리바바는 Qwen3-ASR을 DashScope의 실시간 API와 파일 전사 API를 통해 클라우드 서비스로도 제공하며, 그 경로에서는 오디오가 알리바바 서버로 올라갑니다. Whisper Notes는 그 API들을 쓰지 않습니다. 공개 가중치를 MLX 8-bit 모델로 Mac의 GPU에서 실행하고, 계정도 API 키도 필요 없으며 네트워크를 꺼도 전사됩니다. 앱의 모든 엔진 계열이, 어느 배포 채널에서든 마찬가지입니다.
이 숫자가 제 녹음에서 나오는 정확도와 다른 이유는 무엇인가요?
FLEURS는 짧고 깨끗한 낭독 음성이고, 실제 녹음은 그렇지 않기 때문입니다. 이번 측정은 공개 데이터셋에서 한 보정입니다. 언어당 약 75문장, M5 MacBook Air 1대, 모든 모델에 같은 클립. 어떤 모델이 어떤 언어에서 시도해 볼 만한지 묻는 데는 쓸모가 있지만, 회의나 잡음이 있는 오디오, 억양이 강한 말, 두 시간짜리 파일에서의 정확도를 예측해 주지는 않습니다.
직접 써 보세요
Qwen3-ASR 1.7B는 Mac용 Whisper Notes 1.6.0 이상, Direct Download(DMG) 버전에만 있습니다. 설정 → 전사 모델에서 고르시면 됩니다. 무료 체험은 10,000 단어까지이므로, 사용하는 언어를 한 번 돌려 보고 위의 표에 반박하기에 충분합니다.
저희 숫자가 실제 경험과 맞지 않는 언어를 찾으셨다면 mac@whispernotes.app으로 메일을 보내 주세요. 전체 릴리스 노트는 whispernotes.app/changelog에 있습니다.
위 내용의 출처: Google FLEURS 테스트 분할 리비전 70bb2e84에서 저희가 수행한 측정, Qwen3-ASR 1.7B 모델 카드, 그리고 언어 지원 페이지의 엔진별 언어 표입니다. 그 표는 앱 소스에서 생성됩니다.