Depuis macOS 26 et iOS 26, Apple propose une nouvelle génération de reconnaissance vocale sur appareil — SpeechAnalyzer et SpeechTranscriber, appelés Apple Speech dans la suite. Elle est nettement plus précise que l'ancien moteur de dictée. Nous voulions donc savoir : la reconnaissance vocale intégrée d'Apple est-elle désormais assez bonne pour se passer complètement d'une app de transcription ? Et quel écart la sépare des modèles ouverts sur appareil de Whisper Notes — Whisper, Parakeet, SenseVoice et Qwen3-ASR ? Nous avons mené un test strict. Voici les résultats. Sur les dix langues testées, Apple Speech n'a jamais eu le taux d'erreur le plus bas, reste à moins de 1,5 point du meilleur en coréen, japonais et chinois, et n'a aucun modèle pour le néerlandais, le russe et le polonais.
Quel écart sépare Apple Speech des modèles que vous téléchargez ?
| Langue | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Anglais | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Allemand | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Néerlandais | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Russe | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polonais | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japonais | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Coréen | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Français | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Chinois | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Espagnol (Amérique latine) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Dix des langues les plus utilisées, un moteur par colonne. Chaque cellule indique le taux d'erreur du moteur ; plus il est bas, mieux c'est. Le vert marque le plus bas de la ligne, le blanc le deuxième. CER pour le japonais, le coréen et le chinois, WER pour le reste, jamais fusionnés en un seul chiffre. Notre propre série FLEURS, réalisée par l'équipe de Whisper Notes, sur un M5 MacBook Air, parole lue.
Noms courts : Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Un tiret signifie que le moteur n'a pas de modèle pour cette langue.
Qwen3-ASR 1.7B affiche le taux d'erreur le plus bas dans six des dix langues, Whisper Large V3 Turbo dans les quatre autres. Apple Speech accuse 0,77 point de retard sur le meilleur de la ligne en coréen, 1,06 en japonais et 1,48 en chinois, où il est à égalité avec Whisper Large V3 Turbo à 7,97. Sur les sept langues qu'il prend en charge, il accuse un retard de 0,8 à 4,3 points sur le meilleur de la ligne, le plus grand en anglais, avec 8,80 contre 4,49. Aucun résultat Apple Speech n'est disponible pour le néerlandais, le polonais et le russe.
Quelles langues Apple Speech prend-il en charge ?
Apple Speech a produit des résultats pour 21 des 83 configurations linguistiques de cette série. Les deux modèles Whisper couvrent les 83, Qwen3-ASR 1.7B en couvre 30 et Parakeet V3 25. Parmi les dix langues ci-dessus, il n'a aucun modèle pour le néerlandais, le polonais ou le russe. Il n'existe pas de liste fixe à citer : les ressources linguistiques appartiennent à macOS, une app demande donc à l'exécution ce dont dispose une machine donnée.
| Langue | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italien | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Cantonais | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portugais (Brésil) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Télougou | 101,63 | — | 81,74 | 103,19 | — | — |
| Ourdou | 101,69 | — | 23,39 | 38,83 | — | — |
| Pendjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengali | 102,00 | — | 83,52 | 117,37 | — | — |
| Népalais | 102,13 | — | 88,59 | 118,84 | — | — |
| Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamoul | 113,01 | — | 71,28 | 79,77 | — | — |
Les quatorze autres langues pour lesquelles Apple Speech a produit un résultat, classées selon son propre taux d'erreur. Mêmes colonnes, couleurs et noms courts que ci-dessus ; CER pour le cantonais, WER pour le reste. Un taux d'erreur peut dépasser 100 % parce que les insertions comptent elles aussi au numérateur.
Sur les onze dernières lignes, du hindi au tamoul, Apple Speech a répondu en translittération latine plutôt que dans l'écriture native. Son taux d'erreur y mesure donc un écart d'écriture et non la précision de reconnaissance ; ces cellules sont exclues du classement de la ligne. Les valeurs des autres moteurs sur ces lignes sont des mesures ordinaires.
Fonctionnement de SpeechAnalyzer
Apple dispose d'une API de reconnaissance vocale depuis iOS 10. Cette API, SFSpeechRecognizer, est le moteur de l'ancien parcours de dictée. SpeechAnalyzer la remplace ; introduit dans macOS 26 et iOS 26, il est disponible sur toutes les plateformes Apple sauf watchOS.
L'API s'articule autour d'une session. Vous créez un SpeechAnalyzer, lui fournissez un ou plusieurs modules et l'alimentez en audio ; SpeechTranscriber est le module qui transforme la parole en texte. L'audio entre sous forme d'une séquence asynchrone que vous alimentez vous-même, les résultats reviennent dans une seconde, et les deux s'exécutent généralement dans des tâches différentes. L'analyseur accepte une seule séquence d'entrée à la fois. Chaque mémoire tampon et chaque résultat est horodaté par rapport à la propre chronologie de l'audio, ce qui permet de replacer un résultat à son point d'origine.
Une session, trois tâches : l'audio entre sous forme d'AsyncSequence, SpeechAnalyzer et SpeechTranscriber l'analysent, puis les résultats reviennent dans une seconde AsyncSequence que l'interface peut lire. Source : Apple, session 277 de la WWDC25.
Les résultats arrivent deux fois. Tout ce qui se trouve dans ce qu'Apple appelle la plage volatile peut encore être remplacé par un meilleur résultat ; tout ce qui est à l'extérieur est définitif. C'est ainsi qu'une app affiche une transcription provisoire pendant que vous parlez encore, puis la corrige ensuite.
Apple énonce cinq objectifs de conception pour le modèle SpeechTranscriber : audio long, parole conversationnelle, locuteurs éloignés, faible latence et confidentialité, ce qui signifie qu'il s'exécute sur l'appareil. Notes, Dictaphone, Journal et les résumés d'appels reposent dessus.
Les cinq objectifs de conception annoncés par Apple pour le modèle SpeechTranscriber. Source : Apple, session 277 de la WWDC25.
Les modèles ne font partie d'aucune app. Ils sont téléchargés depuis les serveurs d'Apple par AssetInventory, stockés et mis à jour par le système, puis partagés entre les apps. Ils n'ajoutent rien à la taille de téléchargement de l'app ni à l'espace mémoire de son propre processus, et le décodage a lieu hors du processus appelant. Lorsque SpeechTranscriber n'a pas de modèle pour une langue ou un appareil, DictationTranscriber prend le relais avec les mêmes modèles que la dictée système.
Comment nous avons mesuré
Chaque moteur de cet article a transcrit les mêmes extraits, dans le même ordre et un par un, sur un M5 MacBook Air (32 Go, macOS 27.0). L'audio provient du jeu de test Google FLEURS à la révision 70bb2e84, environ 150 phrases et 30 minutes par langue. Un hachage fixe des identifiants d'élément du jeu de données ordonne les éléments, et nous prenons la plus courte suite d'éléments entiers qui dépasse trente minutes ; aucune sortie de modèle n'a participé à ce choix. Chaque cellule a été reconstruite à partir de son propre relevé et vérifiée à nouveau, et les 285 ont réussi.
Les scores sont le taux d'erreur sur les mots lorsque les mots sont séparés par des espaces, et le taux d'erreur sur les caractères pour le japonais, le coréen, le chinois et le cantonais. FLEURS est de la parole lue, pas une réunion ni une dictée. Ces tableaux indiquent si un moteur est plausible pour votre langue, pas ce que vous obtiendrez sur vos propres enregistrements.
Quel progrès par rapport à l'ancien Apple Dictation ?
Apple propose deux modes de transcription, et nous avons mesuré les deux. SpeechTranscriber est le nouveau, celui que cet article appelle Apple Speech. DictationTranscriber est le mode de compatibilité, le parcours de dictée qu'utilisait auparavant un Mac.
| Langue | Apple Dictation | Apple Speech |
|---|---|---|
| Coréen | 7,11 | 4,31 |
| Italien | 6,93 | 4,39 |
| Espagnol (Amérique latine) | 8,43 | 5,41 |
| Allemand | 12,69 | 6,26 |
| Japonais | 9,37 | 6,36 |
| Français | 17,10 | 7,61 |
| Chinois | 10,28 | 7,97 |
| Cantonais | 10,18 | 8,69 |
| Anglais | 13,83 | 8,80 |
| Portugais (Brésil) | 10,85 | 9,35 |
Toutes les langues mesurées proprement par les deux modes Apple, classées selon le taux d'erreur d'Apple Speech ; le vert indique la meilleure valeur de la ligne. Même série, mêmes extraits, même Mac. CER pour le japonais, le coréen, le chinois et le cantonais, WER pour le reste.
Apple Speech est plus précis dans les dix langues. Pour la langue médiane, environ un tiers des erreurs disparaît ; pour le français et l'allemand, plus de la moitié ; pour le portugais brésilien et le cantonais, environ une erreur sur sept.
Il s'agit d'une comparaison avec le propre passé d'Apple. Face aux modèles que vous téléchargez, son meilleur classement dans une langue mesurée proprement est la deuxième place, en cantonais. Dictation couvre davantage de langues : 33 configurations contre 21 dans cette série, dont les trois absentes du nouveau moteur ici.
Quel est l'intérêt du moteur intégré ?
| Moteur | Vitesse | Mémoire maximale | Téléchargement |
|---|---|---|---|
| SenseVoice Small | 162,3× le temps réel | 0,95 GiB | 827 Mo |
| Parakeet V3 | 75,6× le temps réel | 0,09 GiB | 465 Mo |
| Apple Speech | 30,8× le temps réel | non communiquée | pack linguistique téléchargé par macOS, pas par l'app |
| Qwen3-ASR 1.7B | 11,1× le temps réel | 2,43 GiB | environ 2,5 Go |
| Whisper Small | 7,9× le temps réel | 0,87 GiB | 600 Mo |
| Whisper Large V3 Turbo | 3,0× le temps réel | 1,87 GiB | environ 1,6 Go |
La vitesse est la médiane de chaque moteur sur les treize langues mesurées proprement dans cet article, en ne comptant que celles qu'il a exécutées — le débit de traitement d'éléments isolés, une valeur de diagnostic et non la latence du produit. La mémoire maximale est le pic du groupe de processus dans cette série. Apple Speech décode dans un service macOS qui n'appartient pas à l'app appelante ; aucune valeur à cet endroit n'aurait donc le même sens que pour les cinq autres.
Les ressources linguistiques d'Apple Speech sont téléchargées une fois par le système et partagées entre toutes les apps. L'app elle-même n'embarque aucun modèle et n'alloue rien pour lui dans son propre processus. Le service système utilise tout de même de la mémoire pendant son fonctionnement, sans que nous puissions l'attribuer précisément ; nous ne communiquons donc aucune valeur plutôt qu'un zéro. Il a tourné à 30,8× le temps réel, derrière Parakeet V3 et SenseVoice Small.
Whisper Large V3 Turbo remporte quatre des dix lignes et c'est le moteur le plus lent ici, environ dix fois plus lent qu'Apple Speech, pour environ 1,6 Go sur disque. Qwen3-ASR 1.7B remporte les six autres, pour environ 2,5 Go et 2,43 GiB de mémoire. Parakeet V3 coûte 465 Mo et 0,09 GiB, devance Turbo en français, reste derrière en polonais et n'a ni japonais, ni coréen, ni chinois, ni cantonais. Whisper Small est le point de comparaison le plus proche avec 600 Mo, et Apple Speech était plus précis dans huit des dix langues mesurées proprement pour les deux.
Faut-il utiliser Apple Speech plutôt qu'un modèle téléchargé ?
Langue par langue :
- Anglais : choix peu adapté. Apple Speech a obtenu 8,80 ; Qwen3-ASR 1.7B (4,49) ou Whisper Large V3 Turbo (5,49) est nettement plus précis.
- Allemand : choix peu adapté. Apple Speech a obtenu 6,26 ; Qwen3-ASR 1.7B (2,85) ou Whisper Large V3 Turbo (4,05) est nettement plus précis.
- Néerlandais, russe et polonais : Apple Speech n'a pas de modèle pour ces trois langues. Whisper Large V3 Turbo était le plus précis pour chacune, à 5,69, 5,13 et 5,45.
- Japonais : utilisable. Apple Speech a obtenu 6,36, derrière Whisper Large V3 Turbo à 5,30.
- Coréen : utilisable. Apple Speech a obtenu 4,31, derrière Qwen3-ASR 1.7B à 3,54.
- Français : choix peu adapté. Apple Speech a obtenu 7,61 ; Qwen3-ASR 1.7B (4,57) ou Parakeet V3 (5,83) est nettement plus précis.
- Chinois : utilisable. Apple Speech a obtenu 7,97, à égalité avec Whisper Large V3 Turbo ; le plus précis était Qwen3-ASR 1.7B à 6,49.
- Espagnol : choix peu adapté. Apple Speech a obtenu 5,41 ; Qwen3-ASR 1.7B (3,38) ou Whisper Large V3 Turbo (3,62) est nettement plus précis.
Apple Speech est le nom court donné ici au SpeechTranscriber d'Apple, l'API sur appareil que toute app Mac peut appeler sous macOS 26 ou version ultérieure. Il ne fait pas partie des modèles que Whisper Notes pour Mac télécharge : il s'agit de Whisper, Parakeet V3, SenseVoice et Qwen3-ASR dans la version Mac en téléchargement direct (DMG), et de Whisper, Parakeet V3 et SenseVoice sur iPhone et dans la version du Mac App Store. Le tableau par moteur se trouve sur notre page des langues prises en charge.
Rien de tout cela ne change le fonctionnement actuel de Whisper Notes pour Mac : Parakeet V3 reste le modèle par défaut.
Questions fréquentes
Apple Speech est-il aussi précis que Whisper ?
Pas dans la plupart des langues couvertes par les deux. Dans notre propre série FLEURS, sur les sept de ces dix langues prises en charge par Apple Speech, Whisper Large V3 Turbo était plus précis dans six ; les deux étaient exactement à égalité en chinois, à 7,97 % de CER chacun. Face à Whisper Small, l'ordre s'inverse : Apple Speech était devant dans six des sept et ne perdait qu'en anglais, 8,80 % contre 7,04 % de WER. Il ne mène dans aucune langue mesurée proprement ici et se rapproche le plus en coréen, à 4,31 % de CER contre 3,54 % pour le meilleur de la ligne. Le cantonais est la seule langue mesurée proprement où il a battu Whisper Large V3 Turbo, 8,69 % contre 36,75 % de CER. Utilisez le moteur intégré s'il couvre votre langue et si vous préférez laisser macOS gérer le pack linguistique ; utilisez Whisper Large V3 Turbo pour le résultat le plus précis, ou si votre langue fait partie des trois absentes d'Apple Speech ici.
Quelles langues Apple Speech prend-il en charge ?
C'est macOS qui décide de la liste, pas une app. Dans cette série, Apple Speech a produit des résultats pour 21 des 83 configurations linguistiques testées, contre 83 pour les deux versions de Whisper, 30 pour Qwen3-ASR 1.7B et 25 pour Parakeet V3. Parmi les dix langues les plus utilisées du tableau principal, il couvre l'anglais, l'allemand, le japonais, le coréen, le français, le chinois et l'espagnol, mais pas le néerlandais, le polonais ni le russe. Le deuxième tableau contient les quatorze autres configurations : italien, cantonais, portugais brésilien, et onze langues où il a répondu en translittération latine plutôt que dans l'écriture native. Une app doit demander à macOS à l'exécution quelles langues sont installées sur une machine donnée. Si votre langue manque, Whisper couvre toutes les langues de la liste de l'app sur chaque canal.
Apple Speech ou Parakeet V3 — lequel choisir ?
Parakeet V3, dans toutes les langues européennes que les deux couvrent. Il a obtenu 6,89 contre 8,80 en anglais, 5,83 contre 7,61 en français, 4,86 contre 5,41 en espagnol, 3,43 contre 4,39 en italien et 6,49 contre 9,35 en portugais brésilien ; les deux sont à égalité en allemand à 6,26. Parakeet V3 n'a ni japonais, ni coréen, ni chinois, ni cantonais ; Apple Speech est donc le seul des deux à exister dans ces langues et reste à moins de 1,5 point du meilleur de la ligne en japonais, coréen et chinois. Parakeet V3 représente un téléchargement de 465 Mo et a tourné à 75,6× le temps réel avec un pic de 0,09 GiB ; le pack linguistique d'Apple Speech est téléchargé par macOS, et il a tourné à 30,8× avec une mémoire que nous ne communiquons pas.
Qu'est-ce que SpeechAnalyzer, et est-ce la même chose qu'Apple Dictation ?
SpeechAnalyzer est l'API générale qu'Apple a présentée à la WWDC 2025 et publiée avec macOS 26 et iOS 26. SpeechTranscriber est le mode de transcription qu'elle contient ; c'est ce que nous avons mesuré et ce que cet article appelle Apple Speech. Dictation est le mode de compatibilité, que nous avons également testé : Apple Speech était plus précis dans les dix langues que les deux ont mesurées proprement, retirant environ un tiers des erreurs pour la langue médiane et plus de la moitié pour le français et l'allemand. Dictation couvre davantage de langues, 33 configurations contre 21 ; c'est donc le moteur système pour le néerlandais, le polonais ou le russe si vous pouvez accepter 17,34 %, 13,50 % et 13,13 % de WER. Whisper Large V3 Turbo a obtenu 5,69 %, 5,45 % et 5,13 % sur les mêmes extraits.
L'audio quitte-t-il mon Mac lorsque j'utilise Apple Speech ?
Apple décrit SpeechTranscriber comme une reconnaissance vocale sur appareil : macOS télécharge les ressources linguistiques une fois, puis la reconnaissance s'exécute en local. Nous avons mesuré la précision et la vitesse, pas le comportement réseau ; nous rapportons donc ce point comme Apple le décrit. Les moteurs que Whisper Notes télécharge lui-même — Whisper, Parakeet V3, SenseVoice et Qwen3-ASR — s'exécutent sur le GPU ou Neural Engine de votre propre Mac, sans compte ni API key, et la transcription fonctionne réseau coupé sur chaque canal.
Pourquoi ces chiffres ne correspondent-ils pas à la précision obtenue sur mes enregistrements ?
Parce que FLEURS est de la parole lue, courte et propre, ce que vos enregistrements ne sont pas. Notre série est un étalonnage sur un jeu de données public : environ 150 phrases et 30 minutes d'audio par langue, un M5 MacBook Air, les mêmes extraits pour chaque moteur. Elle indique si un moteur est plausible pour une langue, pas ce que vous obtiendrez lors d'une réunion, avec un son bruité, avec un accent ou dans un fichier de deux heures.
Pourquoi d'autres benchmarks affirment-ils qu'Apple Speech bat Whisper ?
Ils le comparent à Whisper Small, et uniquement en anglais. Sur Whisper Small, notre série va dans le même sens : parmi les dix langues que les deux ont mesurées proprement, Apple Speech l'emporte dans huit. L'anglais est l'une des deux qu'il perd, 8,80 contre 7,04. Le résultat ne vaut plus face à Whisper Large V3 Turbo : Apple Speech y est devancé dans huit de ces dix langues, à égalité en chinois à 7,97, et en tête uniquement en cantonais. C'est le Whisper retenu pour la comparaison qui décide du titre.
Essayez-les
Les cinq modèles téléchargeables présentés ici — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small et Qwen3-ASR 1.7B — figurent tous dans Whisper Notes pour Mac en téléchargement direct (DMG), sous Réglages, puis Modèle de transcription.
Si nos chiffres ne correspondent pas à votre expérience dans une langue, écrivez à mac@whispernotes.app. Notes de version complètes : whispernotes.app/changelog.
Sources : notre série sur le jeu de test Google FLEURS à la révision 70bb2e84, la documentation SpeechAnalyzer d'Apple, et la série Qwen3-ASR en trente langues qui l'a précédée.