확인하고 싶었던 건 하나였습니다. 내 언어를 Whisper Large V3보다 정확하게 전사하는 로컬 모델이 있을까? 그래서 FLEURS 데이터셋에서 이 모델들을 직접 측정했습니다.
FLEURS는 102개 언어의 낭독 음성을 모은 Google 데이터셋입니다. 각 언어에서 약 150문장을 뽑아, 똑같은 클립을 똑같은 순서로 다섯 개 모델에 통과시켰습니다:
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
결과는 이렇습니다.
Qwen3-ASR 1.7B 대 Whisper Large V3 Turbo — 저희가 직접 돌린 FLEURS, M5 MacBook Air 1대, 낭독 음성, 짧은 클립.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| 지원 언어 | 30 | 101 |
| 확실한 우위 | 광둥어, 힌디어, 태국어, 베트남어, 프랑스어 등(7개) | 핀란드어, 헝가리어, 그리스어 등 11개 언어 |
| 속도 | 실시간의 9.6배 | 실시간의 2.6배 |
| 최대 메모리 | 2.43 GiB | 1.87 GiB |
| 다운로드 | 약 2.5 GB | 약 1.6 GB |
각자 강한 언어를 벗어나면 정확도 차이는 크지 않습니다.
Whisper Large V3와 Qwen3-ASR 상세 비교
30개 언어 전체를 Qwen이 가장 크게 앞선 쪽부터 가장 크게 뒤진 쪽까지 나열했습니다. 두 열 모두 숫자가 낮을수록 좋습니다.
저희가 직접 돌린 FLEURS, M5 MacBook Air 1대, 낭독 음성. 중국어, 광둥어, 일본어, 한국어, 태국어는 문자 오류율(CER), 나머지는 단어 오류율(WER). 초록색은 95% 오차 범위를 넘어선 우위입니다.
| 언어 | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| 광둥어 | 6.44 | 36.75 |
| 힌디어 | 13.19 | 29.64 |
| 태국어 | 6.53 | 13.40 |
| 베트남어 | 4.91 | 8.10 |
| 중국어 | 6.49 | 7.97 |
| 인도네시아어 | 4.91 | 6.31 |
| 아랍어 | 14.32 | 15.72 |
| 프랑스어 | 4.57 | 5.97 |
| 독일어 | 2.85 | 4.05 |
| 영어 | 4.49 | 5.49 |
| 한국어 | 3.54 | 4.25 |
| 페르시아어 | 30.32 | 30.93 |
| 포르투갈어 | 5.17 | 5.44 |
| 스페인어 | 3.38 | 3.62 |
| 이탈리아어 | 2.58 | 2.58 |
| 일본어 | 5.74 | 5.30 |
| 러시아어 | 5.65 | 5.13 |
| 마케도니아어 | 18.57 | 17.46 |
| 말레이어 | 10.62 | 9.22 |
| 네덜란드어 | 7.36 | 5.69 |
| 터키어 | 8.81 | 5.95 |
| 폴란드어 | 12.59 | 5.45 |
| 덴마크어 | 22.24 | 13.63 |
| 스웨덴어 | 19.80 | 8.78 |
| 루마니아어 | 20.20 | 8.36 |
| 체코어 | 24.59 | 11.94 |
| 필리핀어 | 23.31 | 9.72 |
| 그리스어 | 30.22 | 13.94 |
| 핀란드어 | 27.71 | 7.11 |
| 헝가리어 | 36.63 | 14.59 |
FLEURS 테스트 분할 리비전 70bb2e84에서 같은 클립으로 짝지어 직접 측정, 언어당 약 150문장, M5 MacBook Air 1대.
Qwen3-ASR 1.7B가 확실히 이긴 7개 언어. 오류율(%, Qwen 대 Turbo): 광둥어(6.4 대 36.8), 힌디어(13.2 대 29.6), 태국어(6.5 대 13.4), 베트남어(4.9 대 8.1), 프랑스어(4.6 대 6.0), 독일어(2.9 대 4.1), 영어(4.5 대 5.5). 광둥어와 태국어는 문자 단위, 나머지는 단어 단위로 채점했습니다. Qwen의 강점은 문자 단위로 채점하는 언어에 몰려 있습니다. 중국어, 광둥어, 일본어, 한국어, 태국어 평균은 5.7%로 Turbo의 13.5%보다 낮고, 단어 단위로 채점한 나머지 25개 언어에서는 방향이 뒤집혀 Qwen 평균 14.4%, Turbo 10.2%입니다.
Whisper Large V3 Turbo가 확실히 이긴 11개 언어. 오류율(%, Qwen 대 Turbo), 모두 단어 단위: 헝가리어(36.6 대 14.6), 그리스어(30.2 대 13.9), 핀란드어(27.7 대 7.1), 체코어(24.6 대 11.9), 필리핀어(23.3 대 9.7), 덴마크어(22.2 대 13.6), 루마니아어(20.2 대 8.4), 스웨덴어(19.8 대 8.8), 폴란드어(12.6 대 5.5), 터키어(8.8 대 6.0), 네덜란드어(7.4 대 5.7).
차이가 작거나 대등한 12개 언어. 스페인어(3.4 대 3.6), 이탈리아어(2.6 대 2.6), 러시아어(5.7 대 5.1), 포르투갈어(5.2 대 5.4). 중국어(6.5 대 8.0), 일본어(5.7 대 5.3), 한국어(3.5 대 4.3)는 문자 단위 채점입니다. 여기에 아랍어, 인도네시아어, 페르시아어, 말레이어, 마케도니아어가 더해집니다. 이 구간의 격차는 모두 작고 95% 구간 안에 들어가므로, 이번 측정으로는 두 모델을 가를 수 없습니다.
선택을 실제로 바꾸는 줄은 광둥어 하나입니다. 같은 클립에서 Whisper Large V3 Turbo는 문자 오류율 36.75%, 저희가 광둥어용으로 권해 온 SenseVoice Small은 37.23%로 둘 다 37% 언저리였습니다. Qwen3-ASR 1.7B는 6.44%였습니다. 이 낭독 음성에서는 앞의 두 숫자가 광둥어를 감당하지 못하므로, 예전 권장에는 이제 이 단서가 붙습니다.
Qwen3-ASR 1.7B는 얼마나 빠른가
다섯 엔진을 같은 측정 환경, 같은 기기(M5 MacBook Air)에서 쟀습니다. 적어도 서로 비교할 수는 있는 숫자입니다.
같은 FLEURS 측정에서 각 엔진이 지원하는 언어의 실시간 배속 중앙값. M5 MacBook Air 1대, 낭독 음성.
| 엔진 | 언어 수 | 이번 측정의 속도 중앙값(짧은 클립) |
|---|---|---|
| SenseVoice Small | 6개 언어 | 162.3배 |
| Parakeet TDT 0.6B v3 | 25 | 83.0배 |
| Qwen3-ASR 1.7B | 공식 30개 | 9.6배 |
| Whisper Small | 101 | 7.0배 |
| Whisper Large V3 Turbo | 101 | 2.6배 |
짧은 클립 측정값이라, 같은 엔진이 긴 녹음에서 내는 수치보다 낮게 나옵니다. 이 열은 이번 한 번의 측정 안에서 엔진끼리 비교하는 용도로만 쓰세요.
같은 측정 환경에서 Parakeet V3와 SenseVoice Small은 Qwen3-ASR보다 대략 자릿수가 하나 다를 만큼 빠릅니다. 짧은 클립이 아니라 긴 파일에서는 Parakeet가 M4 Pro에서 실시간의 103배, SenseVoice가 52배 이상을 기록했습니다. 다른 오디오에서 다른 방식으로 잰 값이지만 가리키는 방향은 같습니다.
Qwen3-ASR은 중간에 있습니다. 이번 짧은 클립 측정에서 가장 느린 엔진은 Qwen이 아니라 Whisper Large V3 Turbo였습니다. 다만 언어별 편차는 다른 엔진보다 큽니다. 그리스어 2.8배에서 일본어 13.4배까지 벌어집니다.
Qwen3-ASR은 메모리와 디스크를 얼마나 쓰나
최대 메모리는 같은 FLEURS 측정의 항목들에서 관측한 프로세스 최대 사용량. M5 MacBook Air 1대, 낭독 음성, 짧은 클립.
| 엔진 | 다운로드 | 이번 측정의 최대 메모리 |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 MB | 0.09 GiB |
| Whisper Small | 600 MB | 0.87 GiB |
| SenseVoice Small | 827 MB | 0.95 GiB |
| Whisper Large V3 Turbo | 약 1.6 GB | 1.87 GiB |
| Qwen3-ASR 1.7B | 약 2.5 GB | 2.43 GiB |
두 축 모두에서 Qwen3-ASR이 다섯 중 가장 무겁습니다. 다운로드 약 2.5 GB, 이번 측정의 프로세스 최대 메모리 2.43 GiB입니다. Whisper Large V3 Turbo는 약 1.6 GB와 1.87 GiB였습니다.
메모리 8 GB 기기라면 더 가벼운 선택지가 있습니다. Parakeet V3는 465 MB와 0.09 GiB로 25개 언어를, Whisper Small은 600 MB와 0.87 GiB로 101개 언어를 커버합니다.
측정 방법: FLEURS, 30개 언어, Mac 1대
Qwen3-ASR 1.7B는 MLX 8-bit 빌드로, Whisper Large V3 Turbo는 Metal에서 도는 whisper.cpp의 ggml 빌드로 실행했습니다. 데이터는 Google FLEURS 테스트 분할 리비전 70bb2e84(CC-BY-4.0)입니다. 102개 언어 중 83개를 모든 모델에 같은 클립, 같은 순서로 통과시켰습니다. 짝지어 비교한 대상은 Qwen이 밝힌 30개 언어로, 언어당 약 150문장·30분 분량입니다. 띄어쓰기가 있는 언어는 단어 오류율, 중국어·광둥어·일본어·한국어·태국어는 문자 오류율로 재고 하나의 숫자로 합치지 않았습니다. 오차 범위는 항목 단위 부트스트랩 10,000회입니다. 기기는 M5 MacBook Air 1대, 32 GB, macOS 27.0이며 두 모델 모두 빈 출력이나 실패는 없었습니다.
FLEURS는 낭독 음성입니다. 회의도, 받아쓰기도 아닙니다. 낭독 음성의 순위는 저희 테스트에서만도 실제 오디오 앞에서 두 번 무너졌기 때문에 긴 녹음으로 확대 해석하지 않습니다. 이 표들이 말해 주는 것은 어떤 모델이 사용하는 언어에서 시도해 볼 만한가이지, 실제로 얻게 될 정확도가 아닙니다. Qwen3-ASR 1.7B의 실제 회의 평가는 따로 글로 쓰겠습니다.
Whisper Large V3 대신 Qwen3-ASR을 써야 할까
Mac용 Whisper Notes 안에서라면, 언어별로 이렇게 답하겠습니다.
- 광둥어, 힌디어, 태국어, 베트남어, 프랑스어, 독일어, 영어를 전사한다면: Qwen3-ASR 1.7B를 고르세요.
- 중국어, 한국어, 스페인어를 전사한다면: 아주 근소하게 앞섰고, 저희가 주장할 수 있는 것도 그 근소한 차이뿐입니다. 여기서는 어느 모델이든 괜찮습니다. 일본어, 이탈리아어, 페르시아어, 아랍어, 인도네시아어, 러시아어, 포르투갈어, 마케도니아어, 말레이어도 마찬가지입니다.
- 핀란드어, 헝가리어, 그리스어, 체코어, 스웨덴어, 덴마크어, 폴란드어, 루마니아어, 필리핀어, 터키어, 네덜란드어를 전사한다면: Whisper Large V3 Turbo에 머무르세요. 이 11개 언어는 모두 확실히 이겼습니다.
- 속도나 저장 공간이 중요하다면: 이 엔진은 아닙니다. 같은 측정에서 Parakeet V3와 SenseVoice Small은 자릿수가 다를 만큼 더 빠르고 다운로드 용량도 몇 분의 일 수준입니다. Whisper Small은 600 MB로 101개 언어를 커버하며 이번 측정에서 7.0배였습니다.
- iPhone이나 Mac App Store 버전을 쓰고 있다면: 이 엔진은 아직 그쪽에 없습니다. 그 채널에서 광둥어는 SenseVoice로 하세요.
이것은 Mac용 Whisper Notes가 알리바바의 공개 모델 Qwen3-ASR을 기기에서 돌리도록 옮긴 것입니다. 공개 가중치를 Apple MLX 8-bit로 변환해 Mac의 GPU에서 실행하며, 오디오가 알리바바 서버로 가지 않습니다. Direct Download(DMG) 1.5.0에서 SenseVoice가 대체한 0.6B와는 다른 모델입니다.
사용 방법(Mac Direct Download, DMG 1.6.0 이상): 설정 → 전사 모델 → Qwen3-ASR 1.7B. 모델은 처음 사용할 때 앱 안에서 내려받으며 약 2.5 GB입니다. Apple Silicon에 macOS 15 이상이 필요하고 메모리는 16 GB를 권장합니다. 앱의 나머지 기능은 macOS 14에서도 동작합니다. 엔진별 지원 언어는 언어 지원 페이지에 있습니다. 로컬 CLI와 MCP 서버는 qwen, qwen3, qwen3-asr 세 이름을 모두 받습니다.
바꾸고 싶지 않다면 그대로 두셔도 됩니다. Parakeet V3는 여전히 기본 모델입니다.
자주 묻는 질문
Qwen3-ASR이 Whisper Large V3 Turbo보다 정확한가요?
언어에 따라 다르고, 승부는 거의 반반입니다. Mac용 Whisper Notes에서 저희가 직접 돌린 FLEURS 측정에서, 두 모델이 함께 지원하는 30개 언어 중 Qwen3-ASR 1.7B가 14개, Whisper Large V3 Turbo가 15개에서 앞섰습니다. 이탈리아어는 저희가 남긴 소수점 자리까지 똑같은 정확한 동점입니다. Qwen이 확실히 앞선 언어는 광둥어(문자 오류율 6.44% 대 36.75%), 힌디어(단어 오류율 13.19% 대 29.64%), 태국어, 베트남어, 프랑스어, 독일어, 영어입니다. Turbo가 확실히 앞선 언어는 핀란드어(단어 오류율 7.11% 대 27.71%), 헝가리어, 그리스어, 체코어, 스웨덴어, 덴마크어, 폴란드어, 루마니아어, 필리핀어, 터키어, 네덜란드어입니다. 30개 중 12개의 격차는 오차 범위 안이라 무승부로 읽어야 합니다. 쓰시는 언어가 Qwen이 앞선 쪽에 있고 Whisper Notes의 Mac Direct Download(DMG) 버전을 쓰신다면 Qwen3-ASR을, 그 밖의 경우와 Qwen의 30개에 없는 모든 언어에는 Whisper Large V3 Turbo를 고르세요. Whisper는 101개 언어를 모두 지원합니다.
iPhone이나 Mac App Store에서 Qwen3-ASR을 쓸 수 있나요?
현재는 Whisper Notes의 Mac Direct Download(DMG) 버전 1.6.0부터 들어 있습니다. Mac App Store 버전도 이후 릴리스에서 새 엔진을 받을 계획이지만 날짜는 아직 없습니다. 그때까지 iPhone 앱과 Mac App Store 버전에는 Whisper, Parakeet V3, SenseVoice 세 계열이 있고, Qwen이 인식하는 언어는 그곳의 Whisper도 모두 커버합니다. 모델 수로 세면 Mac App Store 버전은 오늘 기준 네 개, Direct Download 버전은 다섯 개입니다. Whisper가 Small과 Large V3 Turbo 두 가지로 들어가기 때문입니다. iPhone에서 광둥어가 필요하시면 그곳에서는 SenseVoice를 쓰세요.
중국어, 일본어, 한국어에는 Qwen3-ASR과 SenseVoice 중 무엇이 나은가요?
정확도는 가깝고 속도는 크게 벌어집니다. 저희 FLEURS 측정에서 Qwen3-ASR의 문자 오류율은 중국어 6.49%, 일본어 5.74%, 한국어 3.54%였고, SenseVoice Small은 같은 클립에서 각각 7.69%, 6.78%, 7.85%였습니다. 다만 같은 측정에서 SenseVoice의 실시간 배속 중앙값은 162배, Qwen은 9.6배였고, 다운로드는 827 MB 대 약 2.5 GB이며, SenseVoice는 iPhone과 두 Mac 버전 모두에서 쓸 수 있습니다. 광둥어를 전사하는 경우가 아니라면 SenseVoice를 고르세요. 광둥어에서는 Qwen3-ASR이 문자 오류율 6.44%, SenseVoice가 37.23%로 기다릴 만한 차이가 납니다.
Qwen3-ASR 1.7B의 시스템 요구 사항은 무엇인가요?
macOS 15 이상을 쓰는 Apple Silicon Mac, 권장 메모리 16 GB, 모델용 디스크 약 2.5 GB가 필요합니다. Mac용 Whisper Notes의 다른 부분보다 요구 사항이 높습니다. 앱 자체는 macOS 14 이상에서 돌아갑니다. 이번 벤치마크에서 이 모델의 프로세스 최대 메모리는 2.43 GiB로 다섯 엔진 중 가장 높았습니다. 메모리 8 GB Mac이라면 Whisper Small이 600 MB로 같은 101개 언어를, Parakeet V3가 465 MB로 25개 유럽 언어를 커버합니다.
Qwen3-ASR을 쓰면 오디오가 Mac 밖으로 나가나요?
아닙니다. 알리바바는 Qwen3-ASR을 DashScope의 실시간 API와 파일 전사 API를 통해 클라우드 서비스로도 제공하며, 그 경로에서는 오디오가 알리바바 서버로 올라갑니다. Whisper Notes는 그 API들을 쓰지 않습니다. 공개 가중치를 MLX 8-bit 모델로 Mac의 GPU에서 실행하고, 계정도 API 키도 필요 없으며 네트워크를 꺼도 전사됩니다. 앱의 모든 엔진 계열이, 어느 배포 채널에서든 마찬가지입니다.
이 숫자가 제 녹음에서 나오는 정확도와 다른 이유는 무엇인가요?
FLEURS는 짧고 깨끗한 낭독 음성이고, 실제 녹음은 그렇지 않기 때문입니다. 이번 측정은 공개 데이터셋에서 한 보정입니다. 언어당 약 150문장, M5 MacBook Air 1대, 모든 모델에 같은 클립. 어떤 모델이 어떤 언어에서 시도해 볼 만한지 묻는 데는 쓸모가 있지만, 회의나 잡음이 있는 오디오, 억양이 강한 말, 두 시간짜리 파일에서의 정확도를 예측해 주지는 않습니다.
직접 써 보세요
Qwen3-ASR 1.7B는 Mac용 Whisper Notes 1.6.0 이상, Direct Download(DMG) 버전에만 있습니다. 설정 → 전사 모델에서 고르시면 됩니다. 무료 사용량은 주 5,000 단어까지이므로, 사용하는 언어를 한 번 돌려 보고 위의 표에 반박하기에 충분합니다.
저희 숫자가 실제 경험과 맞지 않는 언어를 찾으셨다면 mac@whispernotes.app으로 메일을 보내 주세요. 전체 릴리스 노트는 whispernotes.app/changelog에 있습니다.
위 내용의 출처: Google FLEURS 테스트 분할 리비전 70bb2e84에서 저희가 수행한 측정, Qwen3-ASR 1.7B 모델 카드, 그리고 언어 지원 페이지의 엔진별 언어 표입니다. 그 표는 앱 소스에서 생성됩니다.