Whisper Large V3 Turbo vs V3 : 5× Plus Rapide sur Mac (Benchmark)

6 novembre 2024
·
6 min read
·Whisper Notes Team

Le Whisper Large-v3 Turbo d'OpenAI réduit le decoder de 32 couches à 4, faisant passer les paramètres de 1,55B à 809M. Lors de nos tests sur Apple Silicon, il a transcrit le même audio environ 5× plus vite, avec une précision quasi identique. Whisper Notes l'intègre sur Mac et iPhone.

Comparaison d'architecture Whisper Large V3 Turbo vs V3

V3 Turbo vs V3 : ce qui a changé

Turbo n'est pas une nouvelle architecture : c'est exactement le même modèle Whisper Large-v3 avec le decoder élagué de 32 couches à 4, puis affiné (fine-tuned) pour récupérer la précision. L'encoder reste inchangé.

Large-v3 Turbo Large-v3
Paramètres 809M 1,550M
Couches du decoder 4 32
Langues 100+ 100+
Tâche de traduction Non supportée Supportée
Licence MIT Apache 2.0

Méthode : le même fichier audio de 10 minutes a été transcrit dans la même version de Whisper Notes sur chaque appareil nommé. Les temps sont des secondes réelles, du lancement de la transcription au texte final ; seul le modèle a changé entre V3 et Turbo.

La tâche de traduction a été explicitement exclue des données d'entraînement de Turbo. Le modèle complet Large-v3 la supporte, mais Whisper Notes n'intègre que Turbo — la traduction est gérée séparément via Apple Intelligence.

Le modèle de base : qu'est-ce que Whisper Large-v3 ?

Whisper Large-v3 est le modèle phare de reconnaissance vocale open source d'OpenAI, publié en novembre 2023. Il compte 1,55B de paramètres, utilise une entrée spectrogramme à 128 bandes mel, a été entraîné sur 5 millions d'heures d'audio (1M faiblement étiquetées + 4M pseudo-étiquetées) et prend en charge plus de 100 langues, dont le cantonais. Sur le Hugging Face Open ASR Leaderboard, il obtient en moyenne ~7,4 % de taux d'erreur de mots — le plafond de précision auquel Turbo est comparé tout au long de cet article. Pour voir comment Large-v3 se situe face à tous les autres modèles sur appareil, consultez notre comparaison des modèles Whisper.

Benchmark de vitesse : Whisper Notes sur Apple Silicon

Dans Whisper Notes pour Mac, Turbo fonctionne via CoreML sur le Neural Engine. Traitement de 10 minutes d'audio :

Appareil Whisper V3 V3 Turbo Accélération
iPhone 15 Pro 425 s 82 s 5,2×
iPad Pro M2 380 s 71 s 5,4×
MacBook Pro M2 316 s 63 s 5,0×

L'accélération de 5× est spécifique à Whisper Notes sur Apple Silicon, où le decoder plus petit bénéficie de l'optimisation du Neural Engine. Sur GPU avec des frameworks comme faster-whisper, l'écart se réduit à ~2,7× (voir les benchmarks communautaires ci-dessous).

Précision : comparaison du WER

Le Hugging Face Open ASR Leaderboard teste les deux modèles sur les mêmes datasets en anglais. Le taux d'erreur de mots (WER) de Turbo reste à moins d'un demi-point de V3 sur chaque benchmark :

Dataset V3 Turbo WER V3 WER
LibriSpeech Clean 2.10% 2.01%
LibriSpeech Other 4.24% 3.91%
GigaSpeech 10.14% 10.02%
Earnings22 11.63% 11.29%
AMI 16.13% 15.95%
WER moyen 7.83% 7.44%

V3 est légèrement plus précis sur chaque dataset, mais l'écart est faible — 0,39 point de pourcentage en moyenne. Pour la plupart des transcriptions réelles, vous n'entendrez pas la différence.

Sur l'évaluation longue durée YouTube-commons (l'un des plus grands benchmarks ASR open source), Turbo obtient 13,40 % de WER contre 13,20 % pour V3 — tout en fonctionnant à un facteur temps réel de 129,5× contre 55,3×. C'est 2,3× plus rapide avec une précision quasi identique sur de l'audio réel.

Quelle est la précision de Turbo en coréen, en russe et dans d'autres langues ?

Les benchmarks ci-dessus concernent l'anglais. Selon la fiche de modèle d'OpenAI, le decoder élagué à 4 couches de Turbo coûte un peu plus de précision dans les langues autres que l'anglais, avec la plus forte dégradation sur les langues à faibles ressources. Pour le russe et la plupart des langues européennes, Turbo reste proche du Large-v3 complet — et si vous utilisez Whisper Notes, Parakeet V3 couvre le russe et 24 autres langues européennes à 10× la vitesse de Whisper.

Pour le coréen, le japonais, le chinois et le cantonais, un modèle spécialisé est à la fois plus rapide et mieux ponctué : SenseVoice transcrit le CJK à 52× le temps réel. Whisper Notes livre SenseVoice aux côtés de Turbo sur Mac comme sur iOS, pour que vous puissiez choisir le bon modèle par langue au lieu de tout faire passer par un seul.

Benchmarks communautaires : GPU et CPU

Des benchmarks indépendants des communautés faster-whisper et whisper.cpp montrent des résultats cohérents sur différents matériels. Transcription de 13 minutes d'audio avec faster-whisper sur GPU :

Modèle Précision numérique Temps Mémoire GPU WER
Large-v3 Turbo fp16 19.2 s 2,537 MB 1.92%
Large-v3 fp16 52.0 s 4,521 MB 2.88%
Large-v3 Turbo int8 19.6 s 1,545 MB 1.92%
Distil-Large-v3 fp16 26.1 s 2,409 MB 2.39%

Source : benchmark faster-whisper sur GPU NVIDIA, split de validation propre de LibriSpeech. Turbo int8 n'utilise que 1,5 Go de VRAM — il tient dans un GPU de 2 Go.

L'inférence par lots sur une RTX 3060 Laptop (6 Go VRAM, précision int8) amplifie encore l'avantage :

Modèle Séquentiel Par lots (10) WER par lots
Large-v3 Turbo 46.1 s 18.7 s 7.7%
Large-v3 230.8 s 43.0 s 7.9%
Large-v2 178.3 s 43.2 s 8.8%
Medium 113.3 s 26.3 s 8.9%

Source : benchmark NilaierMusic, Intel i7-12650H + RTX 3060 Laptop 6 Go, audio en français, précision int8.

Avec le traitement par lots, Turbo obtient le meilleur WER de tous les modèles testés (7,7 %) tout en étant le plus rapide. C'est le point d'équilibre évident pour une utilisation en production.

Turbo vs Medium vs toutes les tailles de modèle Whisper

Avant Turbo, Medium était le compromis habituel : une précision acceptable à une vitesse tolérable. Turbo rend cet arbitrage obsolète — avec 809M de paramètres, il est à peine plus gros que Medium (769M), tout en offrant une précision de classe large à plusieurs fois sa vitesse. Voici toute la famille de modèles côte à côte :

Modèle Paramètres Taille sur disque Vitesse relative Niveau de précision
tiny 39M ~75 MB ~10× Le plus bas
base 74M ~142 MB ~7× Bas
small 244M ~466 MB ~4× Modéré
medium 769M ~1.5 GB ~2× Élevé
large-v3 1,550M ~2.9 GB 1× (référence) Le plus élevé
large-v3-turbo 809M ~1.6 GB ~5× sur Apple Silicon Quasi maximal

Publié le 30 septembre 2024, Turbo compte 809M de paramètres. Si vous choisissiez Medium pour économiser de l'espace disque ou gagner en vitesse, Turbo le bat désormais à la fois en précision et en vitesse pour une empreinte à peu près équivalente.

Limitations connues (et comment Whisper Notes les gère)

Pas de traduction intégrée

Turbo a été entraîné sans données de traduction. Il ne transcrit que dans la langue source — contrairement à Large-v3, qui supporte la traduction audio vers anglais.

Whisper Notes — Apple Intelligence traduit automatiquement les transcriptions dans la langue de votre choix, vous offrant une sortie bilingue quel que soit le modèle utilisé.

Plus d'hallucinations sur l'audio bruité

Les retours de la communauté indiquent que Turbo hallucine davantage sur les clips très courts ou les enregistrements bruités par rapport à V3. Prévisible vu le decoder réduit (4 couches vs 32).

Whisper Notes — exécute Pyannote VAD avant la transcription, détectant les segments de parole et éliminant le silence et le bruit pour que le modèle ne traite que de la voix réelle.

Quel modèle devriez-vous utiliser ?

Anglais / Européen Parakeet V3 — 10× plus rapide que Whisper, meilleure précision
Chinois / Japonais / Coréen SenseVoice — conçu pour le CJK, vitesse 52×
Autres langues Whisper Large V3 Turbo — plus de 100 langues, haute précision, plus lent

FAQ Whisper Large-v3 Turbo

Quelle est la différence entre Whisper Large-v3 et Large-v3 Turbo ?

Large-v3 Turbo conserve l'encoder de Large-v3 mais réduit le decoder de 32 couches à 4. C'est pourquoi il est beaucoup plus rapide tout en restant proche de la précision de Large-v3 pour la transcription. La contrepartie est que Turbo ne supporte pas la tâche de traduction intégrée de Whisper.

faster-whisper supporte-t-il Large-v3 Turbo ?

Oui. faster-whisper supporte Large-v3 Turbo via des conversions CTranslate2, et les benchmarks communautaires montrent que Turbo est un excellent choix quand la VRAM est limitée. Dans le benchmark ci-dessus, Turbo int8 a utilisé environ 1,5 Go de VRAM.

whisper.cpp supporte-t-il Large-v3 Turbo ?

Oui. whisper.cpp peut exécuter des versions GGML/GGUF converties de Whisper Large-v3 Turbo. Si vous construisez votre propre pipeline de transcription locale, Turbo est souvent plus facile à faire tenir sur du matériel grand public que le Large-v3 complet.

Où télécharger openai/whisper-large-v3-turbo ?

Les poids officiels du modèle sont disponibles auprès d'OpenAI sur Hugging Face. Les utilisateurs de Whisper Notes n'ont pas besoin de les télécharger manuellement : l'app Mac gère la configuration du modèle local via son interface.

Vous comparez toutes les options locales ? Chaque modèle de reconnaissance vocale sur appareil — les variantes de Whisper, Parakeet V3, SenseVoice et Voxtral — est comparé côte à côte sur notre page de comparaison des modèles Whisper. Vous découvrez Whisper ? Commencez par le guide de transcription Whisper — ce qu'est le modèle, toutes les façons de l'exécuter et ce que cela coûte.