Nous voulions répondre à une seule question : existe-t-il un modèle local qui transcrive votre langue plus précisément que Whisper Large V3 ? Nous avons donc testé ces modèles sur le jeu de données FLEURS.
FLEURS est un jeu de données Google de parole lue dans 102 langues. Nous avons pris environ 75 phrases par langue et fait passer les mêmes extraits, dans le même ordre, par cinq modèles :
- Parakeet V3
- Whisper Large V3 Turbo
- SenseVoice Small
- Whisper Small
- Qwen3-ASR 1.7B
Voici le résultat.
Qwen3-ASR 1.7B face à Whisper Large V3 Turbo — notre propre série de tests FLEURS, un MacBook Air M5, parole lue, extraits courts.
| Qwen3-ASR 1.7B | Whisper Large V3 Turbo | |
|---|---|---|
| Langues prises en charge | 30 | 101 |
| Avantages nets | Cantonais, hindi, thaï, vietnamien, français (5) | Finnois, hongrois, grec et 8 autres langues (11) |
| Vitesse | 8,7× le temps réel | 2,4× le temps réel |
| Mémoire maximale | 2,43 GiB | 1,87 GiB |
| Téléchargement | environ 2,5 Go | environ 1,6 Go |
En dehors des langues fortes de chaque modèle, l'écart de précision est faible.
Whisper Large V3 face à Qwen3-ASR : la comparaison en détail
Les 30 langues, classées du plus grand avantage de Qwen à son plus grand retard. Dans les deux colonnes, plus c'est bas, mieux c'est.
Notre propre série de tests FLEURS, un MacBook Air M5, parole lue. CER pour le chinois, le cantonais, le japonais, le coréen et le thaï, WER pour le reste ; le vert signale une avance plus large que les barres d'erreur appariées à 95 %.
| Langue | Qwen3-ASR 1.7B | Whisper Large V3 Turbo |
|---|---|---|
| Cantonais | 6,00 | 37,97 |
| Hindi | 13,67 | 30,42 |
| Thaï | 5,92 | 12,95 |
| Vietnamien | 5,07 | 9,79 |
| Persan | 26,98 | 30,03 |
| Arabe | 14,14 | 15,75 |
| Indonésien | 4,97 | 6,50 |
| Français | 3,98 | 5,39 |
| Chinois | 5,69 | 6,88 |
| Anglais | 5,07 | 5,92 |
| Allemand | 3,51 | 4,10 |
| Japonais | 5,39 | 5,71 |
| Coréen | 3,51 | 3,70 |
| Espagnol | 3,60 | 3,76 |
| Italien | 2,98 | 3,05 |
| Russe | 5,98 | 5,51 |
| Portugais | 5,64 | 4,91 |
| Macédonien | 17,81 | 16,64 |
| Malais | 11,60 | 10,18 |
| Néerlandais | 7,65 | 5,63 |
| Turc | 8,34 | 5,53 |
| Danois | 20,12 | 14,92 |
| Polonais | 12,78 | 5,32 |
| Roumain | 18,97 | 8,22 |
| Filipino | 20,44 | 9,37 |
| Suédois | 20,04 | 8,72 |
| Tchèque | 23,92 | 11,15 |
| Grec | 30,20 | 12,97 |
| Finnois | 26,08 | 6,54 |
| Hongrois | 36,35 | 13,66 |
Notre propre série appariée sur le jeu de test FLEURS, révision 70bb2e84, environ 75 phrases par langue, un MacBook Air M5.
Les cinq langues que Qwen3-ASR 1.7B gagne nettement. Taux d'erreur en pourcentage, Qwen face à Turbo : cantonais (6,0 contre 38,0), hindi (13,7 contre 30,4), thaï (5,9 contre 13,0), vietnamien (5,1 contre 9,8), français (4,0 contre 5,4). Le cantonais et le thaï sont notés par caractère, les autres par mot. Son avantage se concentre sur les langues notées par caractère : sur le chinois, le cantonais, le japonais, le coréen et le thaï, il a obtenu 5,3 % en moyenne contre 13,4 % pour Turbo. Sur les vingt-cinq autres, notées par mot, il a obtenu 14,0 % en moyenne contre 10,2 %.
Les onze langues que Whisper Large V3 Turbo gagne nettement. Taux d'erreur en pourcentage, Qwen face à Turbo, tout est noté par mot : hongrois (36,4 contre 13,7), grec (30,2 contre 13,0), finnois (26,1 contre 6,5), tchèque (23,9 contre 11,2), filipino (20,4 contre 9,4), danois (20,1 contre 14,9), suédois (20,0 contre 8,7), roumain (19,0 contre 8,2), polonais (12,8 contre 5,3), turc (8,3 contre 5,5), néerlandais (7,7 contre 5,6).
Les quatorze qui restent proches ou à égalité. Anglais (5,1 contre 5,9), allemand (3,5 contre 4,1), espagnol (3,6 contre 3,8), italien (3,0 contre 3,1), russe (6,0 contre 5,5), portugais (5,6 contre 4,9) ; le chinois (5,7 contre 6,9), le japonais (5,4 contre 5,7) et le coréen (3,5 contre 3,7) sont notés par caractère. Viennent ensuite l'arabe, l'indonésien, le persan, le malais et le macédonien. Chaque écart y est petit et tient dans l'intervalle à 95 %, donc cette série ne permet pas de départager les deux modèles.
Le cantonais est la seule ligne qui change une décision : 6,00 % contre 37,97 %. Et SenseVoice Small, que nous avions publié comme la réponse pour le cantonais, a obtenu 36,71 % de CER sur les mêmes extraits. Sur cet ensemble de parole lue, aucun des deux ne passe la barre ; l'ancienne recommandation s'accompagne donc désormais de cette réserve.
À quelle vitesse tourne Qwen3-ASR 1.7B ?
Les cinq moteurs, mesurés dans le même banc d'essai sur une seule machine (MacBook Air M5). Ils sont donc au moins comparables entre eux.
Facteur temps réel médian sur les langues de chaque moteur, dans la même série de tests FLEURS, un MacBook Air M5, parole lue.
| Moteur | Langues | Vitesse médiane sur cette série (extraits courts) |
|---|---|---|
| SenseVoice Small | 6 au choix | 161,0× |
| Parakeet TDT 0.6B v3 | 25 | 82,9× |
| Qwen3-ASR 1.7B | 30 nommées | 8,7× |
| Whisper Small | 101 | 6,4× |
| Whisper Large V3 Turbo | 101 | 2,4× |
Ce sont des chiffres de banc d'essai sur extraits courts, et ils sont plus bas que ce que les mêmes moteurs font sur un enregistrement long. Servez-vous de cette colonne pour comparer les moteurs entre eux à l'intérieur de cette seule série, et pour rien d'autre.
Parakeet V3 et SenseVoice Small sont d'un ordre de grandeur plus rapides que Qwen3-ASR dans le même banc d'essai. Sur des fichiers longs plutôt que sur des extraits courts, Parakeet a tourné à 103× le temps réel sur un M4 Pro et SenseVoice à 52× ou mieux — une autre mesure, sur un autre audio, qui pointe dans la même direction.
Qwen3-ASR se situe au milieu. Ce n'était pas le moteur le plus lent de cette série sur extraits courts — c'était Whisper Large V3 Turbo — mais il varie plus selon la langue que les autres, de 2,7× sur le grec à 12,4× sur le japonais.
Que coûte Qwen3-ASR en mémoire et en espace disque ?
La mémoire maximale est la plus grande empreinte du processus observée sur les éléments de la même série de tests FLEURS, un MacBook Air M5, parole lue, extraits courts.
| Moteur | Téléchargement | Mémoire maximale sur cette série |
|---|---|---|
| Parakeet TDT 0.6B v3 | 465 Mo | 0,09 GiB |
| Whisper Small | 600 Mo | 0,87 GiB |
| SenseVoice Small | 827 Mo | 0,95 GiB |
| Whisper Large V3 Turbo | environ 1,6 Go | 1,87 GiB |
| Qwen3-ASR 1.7B | environ 2,5 Go | 2,43 GiB |
Qwen3-ASR est le plus lourd des cinq sur les deux axes : environ 2,5 Go à télécharger et 2,43 GiB de mémoire de processus au maximum sur cette série, contre environ 1,6 Go et 1,87 GiB pour Whisper Large V3 Turbo.
Sur une machine de 8 Go, il existe une voie plus légère. Parakeet V3 couvre 25 langues en 465 Mo et 0,09 GiB, et Whisper Small en couvre 101 en 600 Mo et 0,87 GiB.
Comment nous avons mesuré : FLEURS, 30 langues, un Mac
Qwen3-ASR 1.7B tournait en build MLX 8 bits, Whisper Large V3 Turbo en build ggml whisper.cpp sur Metal. Les données sont le jeu de test Google FLEURS en révision 70bb2e84 (CC-BY-4.0) : 83 de ses 102 langues, environ 75 phrases et 15 minutes chacune, les mêmes extraits dans le même ordre pour chaque modèle ; la comparaison appariée porte sur les 30 langues de Qwen. WER pour les langues qui séparent les mots par des espaces, CER pour le chinois, le cantonais, le japonais, le coréen et le thaï, jamais fondus en un seul chiffre ; les barres d'erreur viennent d'un bootstrap à 10 000 rééchantillonnages au niveau de l'élément. Un MacBook Air M5, 32 Go, macOS 26.5, aucune sortie vide ni aucun échec chez l'un ou l'autre modèle.
FLEURS, c'est de la parole lue, pas une réunion et pas de la dictée. Deux fois déjà, dans nos propres tests, des classements issus de parole lue n'ont pas survécu à de l'audio réel. Nous ne les extrapolons donc pas aux enregistrements longs : ces tableaux disent si un modèle est plausible pour votre langue, pas quelle précision vous obtiendrez. L'évaluation de Qwen3-ASR 1.7B sur de vraies réunions fera l'objet d'un article séparé.
Faut-il utiliser Qwen3-ASR plutôt que Whisper Large V3 ?
Langue par langue, voici comment nous répondrions à cette question dans Whisper Notes pour Mac.
- Si vous transcrivez du cantonais, du hindi, du thaï, du vietnamien ou du français : prenez Qwen3-ASR 1.7B.
- Si vous transcrivez du chinois, du japonais, du coréen, de l'anglais, de l'allemand, de l'espagnol ou de l'italien : il mène d'un cheveu, et c'est tout ce que nous affirmerons. L'un ou l'autre modèle convient, comme pour le persan, l'arabe, l'indonésien, le russe, le portugais, le macédonien et le malais.
- Si vous transcrivez du finnois, du hongrois, du grec, du tchèque, du suédois, du danois, du polonais, du roumain, du filipino, du turc ou du néerlandais : restez sur Whisper Large V3 Turbo. Il a gagné les onze, nettement.
- Si c'est la vitesse ou l'espace disque qui compte pour vous : ce moteur n'est pas le bon. Parakeet V3 et SenseVoice Small étaient d'un ordre de grandeur plus rapides, pour une fraction du téléchargement, et Whisper Small couvre 101 langues en 600 Mo à 6,4×.
- Si vous êtes sur iPhone ou sur la version du Mac App Store : le moteur n'y est pas encore. SenseVoice est le choix pour le cantonais sur ces canaux.
C'est le portage sur appareil du Qwen3-ASR ouvert d'Alibaba tel que le propose Whisper Notes pour Mac : les poids ouverts convertis en Apple MLX sur 8 bits, exécutés sur le GPU de votre propre Mac, sans qu'aucun audio ne parte vers les serveurs d'Alibaba. Ce n'est pas le même modèle que le 0.6B que SenseVoice a remplacé dans la version 1.5.0 en téléchargement direct (DMG).
Comment l'utiliser (téléchargement direct sur Mac, DMG 1.6.0 et versions suivantes) : Réglages, puis Modèle de transcription, puis Qwen3-ASR 1.7B. Le modèle se télécharge dans l'app à la première utilisation et pèse environ 2,5 Go. Il demande macOS 15 ou plus récent sur Apple silicon, avec 16 Go de mémoire recommandés ; le reste de l'app tourne sur macOS 14. La liste des langues par moteur se trouve sur notre page des langues prises en charge. Le CLI local et le serveur MCP acceptent « qwen », « qwen3 » et « qwen3-asr ».
Si vous préférez ne pas changer, rien ne vous y oblige : Parakeet V3 reste le modèle par défaut.
Questions fréquentes
Qwen3-ASR est-il plus précis que Whisper Large V3 Turbo ?
Cela dépend de la langue, et le partage est presque égal. Sur notre propre série de tests FLEURS dans Whisper Notes pour Mac, sur les 30 langues que les deux modèles couvrent, Qwen3-ASR 1.7B était devant sur 15 et Whisper Large V3 Turbo sur 15. Qwen menait nettement sur le cantonais (6,00 % contre 37,97 % de CER), le hindi (13,67 % contre 30,42 % de WER), le thaï, le vietnamien et le français. Turbo menait nettement sur le finnois (6,54 % contre 26,08 % de WER), le hongrois, le grec, le tchèque, le suédois, le danois, le polonais, le roumain, le filipino, le turc et le néerlandais. Quatorze des trente écarts tiennent dans les barres d'erreur et se lisent comme des égalités. Choisissez Qwen3-ASR si votre langue figure dans sa colonne gagnante et que vous êtes sur la version de Whisper Notes pour Mac en téléchargement direct (DMG) ; choisissez Whisper Large V3 Turbo pour tout le reste, et pour toutes les langues en dehors des 30 de Qwen, puisque Whisper atteint les 101 choix.
Puis-je utiliser Qwen3-ASR sur iPhone ou depuis le Mac App Store ?
Aujourd'hui, il est dans la version de Whisper Notes en téléchargement direct sur Mac (DMG), à partir de la version 1.6.0. La version du Mac App Store devrait recevoir les moteurs plus récents dans des mises à jour ultérieures, et nous n'avons pas de date pour cela. En attendant, l'app iPhone et la version du Mac App Store ont trois familles de moteurs — Whisper, Parakeet V3 et SenseVoice — et toutes les langues que Qwen reconnaît y sont aussi couvertes par Whisper. En nombre de modèles, la version du Mac App Store en propose quatre aujourd'hui et la version en téléchargement direct cinq, parce que Whisper y figure en Small et en Large V3 Turbo. S'il vous faut du cantonais sur iPhone, SenseVoice est le moteur à utiliser là-bas.
Qwen3-ASR ou SenseVoice pour le chinois, le japonais et le coréen ?
Les deux sont proches en précision et très éloignés en vitesse. Sur notre série FLEURS, Qwen3-ASR a obtenu 5,69 % de CER en chinois, 5,39 % en japonais et 3,51 % en coréen ; SenseVoice Small a obtenu 7,06 %, 6,85 % et 7,82 % sur les mêmes extraits. SenseVoice a tourné à une médiane de 161× le temps réel dans cette série contre 8,7× pour Qwen, se télécharge en 827 Mo contre environ 2,5 Go, et il est disponible sur iPhone comme dans les deux versions Mac. Choisissez SenseVoice, sauf si vous transcrivez du cantonais : Qwen3-ASR y a obtenu 6,00 % de CER contre 36,71 % pour SenseVoice, et l'écart est assez grand pour valoir l'attente.
Quelle est la configuration requise pour Qwen3-ASR 1.7B ?
Un Mac Apple silicon sous macOS 15 ou plus récent, avec 16 Go de mémoire recommandés, plus environ 2,5 Go de disque pour le modèle. C'est plus que le reste de Whisper Notes pour Mac, qui tourne à partir de macOS 14. Dans notre série de mesures, le modèle a culminé à 2,43 GiB de mémoire de processus, le plus haut des cinq moteurs. Sur un Mac de 8 Go, Whisper Small couvre la même liste de 101 langues en 600 Mo et Parakeet V3 couvre 25 langues européennes en 465 Mo.
L'audio quitte-t-il mon Mac quand j'utilise Qwen3-ASR ?
Non. Alibaba propose aussi Qwen3-ASR en service cloud, via les API DashScope Real-time et FileTrans, où l'audio est envoyé sur ses serveurs. Whisper Notes ne les utilise pas. L'app exécute les poids ouverts en local, comme modèle MLX sur 8 bits, sur le GPU de votre Mac, sans compte et sans clé d'API, et la transcription fonctionne réseau coupé. C'est vrai de toutes les familles de moteurs de l'app, sur tous les canaux.
Pourquoi ces chiffres ne correspondent-ils pas à la précision que j'obtiens sur mes enregistrements ?
Parce que FLEURS, c'est de la parole lue, courte et propre, et que vos enregistrements ne le sont pas. Notre série est un étalonnage sur un jeu de données public : environ 75 phrases par langue, un MacBook Air M5, les mêmes extraits pour chaque modèle. Elle sert à savoir si un modèle est plausible pour une langue. Elle ne prédit pas votre précision sur une réunion, sur de l'audio bruité, sur un accent ou sur un fichier de deux heures.
Essayez-le
Qwen3-ASR 1.7B est dans Whisper Notes pour Mac 1.6.0 et versions suivantes, en téléchargement direct (DMG) uniquement. Réglages, puis Modèle de transcription. L'essai gratuit couvre 10 000 mots, de quoi y faire passer votre propre langue et contredire les tableaux ci-dessus.
Si vous trouvez une langue où nos chiffres ne correspondent pas à votre expérience, écrivez à mac@whispernotes.app. Notes de version complètes : whispernotes.app/changelog.
Les sources de tout ce qui précède : notre série FLEURS sur le jeu de test Google FLEURS en révision 70bb2e84, la fiche du modèle Qwen3-ASR 1.7B et le tableau des langues par moteur sur notre page des langues prises en charge, qui est générée depuis le code source de l'app.