日本語ほか 30 言語を実測:Qwen3-ASR vs Whisper Large V3 Turbo(Mac ベンチマーク)

2026年8月25日
·
11 min read
·Whisper Notes Team

確かめたかったことは、ひとつだけでした。あなたの言語を Whisper Large V3 より正確に文字起こしできるローカルモデルはあるのか?そこで、FLEURS データセットでこれらのモデルを比較しました。

FLEURS は 102 言語の朗読音声を集めた Google のデータセットです。各言語から約 75 文を取り出し、まったく同じ音声を同じ順番で、次の 5 つのモデルに通しました:

  • Parakeet V3
  • Whisper Large V3 Turbo
  • SenseVoice Small
  • Whisper Small
  • Qwen3-ASR 1.7B

結果はこうなりました。

Qwen3-ASR 1.7B と Whisper Large V3 Turbo の比較。自社で回した FLEURS、M5 MacBook Air 1 台、朗読音声、短いクリップ。

Qwen3-ASR 1.7B Whisper Large V3 Turbo
対応言語 30 101
明確に優位な言語 広東語、ヒンディー語、タイ語、ベトナム語、フランス語(5 言語) フィンランド語、ハンガリー語、ギリシャ語など 11 言語
速度 実時間の 8.7 倍 実時間の 2.4 倍
ピークメモリ 2.43 GiB 1.87 GiB
ダウンロード 約 2.5 GB 約 1.6 GB

それぞれが得意とする言語を外れると、精度の差はわずかです。

Whisper Large V3 と Qwen3-ASR の詳細比較

30 言語すべてを、Qwen が最も勝っている行から、最も負けている行への順に並べました。どちらの列も、数値が低いほど良い結果です。

自社で回した FLEURS、M5 MacBook Air 1 台、朗読音声。中国語・広東語・日本語・韓国語・タイ語は文字誤り率(CER)、それ以外は単語誤り率(WER)。緑は 95% 誤差範囲を超えた差を示します。

言語 Qwen3-ASR 1.7B Whisper Large V3 Turbo
広東語 6.00 37.97
ヒンディー語 13.67 30.42
タイ語 5.92 12.95
ベトナム語 5.07 9.79
ペルシャ語 26.98 30.03
アラビア語 14.14 15.75
インドネシア語 4.97 6.50
フランス語 3.98 5.39
中国語 5.69 6.88
英語 5.07 5.92
ドイツ語 3.51 4.10
日本語 5.39 5.71
韓国語 3.51 3.70
スペイン語 3.60 3.76
イタリア語 2.98 3.05
ロシア語 5.98 5.51
ポルトガル語 5.64 4.91
マケドニア語 17.81 16.64
マレー語 11.60 10.18
オランダ語 7.65 5.63
トルコ語 8.34 5.53
デンマーク語 20.12 14.92
ポーランド語 12.78 5.32
ルーマニア語 18.97 8.22
フィリピノ語 20.44 9.37
スウェーデン語 20.04 8.72
チェコ語 23.92 11.15
ギリシャ語 30.20 12.97
フィンランド語 26.08 6.54
ハンガリー語 36.35 13.66

同じクリップを突き合わせた自社計測。FLEURS テスト分割のリビジョン 70bb2e84、1 言語あたり約 75 文、M5 MacBook Air 1 台。

Qwen3-ASR 1.7B が明確に勝った 5 言語。誤り率(%、Qwen 対 Turbo):広東語(6.0 対 38.0)、ヒンディー語(13.7 対 30.4)、タイ語(5.9 対 13.0)、ベトナム語(5.1 対 9.8)、フランス語(4.0 対 5.4)。広東語とタイ語は文字単位、残りは単語単位で採点しています。Qwen の強みは文字単位で採点する言語に集まりました。中国語・広東語・日本語・韓国語・タイ語の平均は 5.3%、Turbo は 13.4%。単語単位で採点した残り 25 言語では向きが逆になり、Qwen が平均 14.0%、Turbo が 10.2% です。

Whisper Large V3 Turbo が明確に勝った 11 言語。誤り率(%、Qwen 対 Turbo)、いずれも単語単位:ハンガリー語(36.4 対 13.7)、ギリシャ語(30.2 対 13.0)、フィンランド語(26.1 対 6.5)、チェコ語(23.9 対 11.2)、フィリピノ語(20.4 対 9.4)、デンマーク語(20.1 対 14.9)、スウェーデン語(20.0 対 8.7)、ルーマニア語(19.0 対 8.2)、ポーランド語(12.8 対 5.3)、トルコ語(8.3 対 5.5)、オランダ語(7.7 対 5.6)。

差が小さい、または並んだ 14 言語。英語(5.1 対 5.9)、ドイツ語(3.5 対 4.1)、スペイン語(3.6 対 3.8)、イタリア語(3.0 対 3.1)、ロシア語(6.0 対 5.5)、ポルトガル語(5.6 対 4.9)。中国語(5.7 対 6.9)、日本語(5.4 対 5.7)、韓国語(3.5 対 3.7)は文字単位の採点です。ほかにアラビア語、インドネシア語、ペルシャ語、マレー語、マケドニア語。このグループの差はどれも小さく、95% の範囲に収まります。今回のデータでは 2 つのモデルを分けられません。

判断が変わる行は広東語だけです。同じ音声で、Whisper Large V3 Turbo は文字誤り率 37.97%、これまで広東語向けに勧めてきた SenseVoice Small は 36.71%。どちらも 37% 前後です。Qwen3-ASR 1.7B は 6.00% でした。この朗読音声では前の 2 つが広東語を支えきれないので、以前の推奨にはこの但し書きが付きます。

Qwen3-ASR 1.7B はどのくらい速いのか

5 つのエンジンを、同じ計測環境・同じ 1 台(M5 MacBook Air)で測りました。少なくとも互いに比べられる数字です。

同じ FLEURS 実行における、各エンジンが対応する言語での実時間倍率の中央値。M5 MacBook Air 1 台、朗読音声。

エンジン 言語数 今回の速度の中央値(短いクリップ)
SenseVoice Small 6 言語 161.0 倍
Parakeet TDT 0.6B v3 25 82.9 倍
Qwen3-ASR 1.7B 公称 30 8.7 倍
Whisper Small 101 6.4 倍
Whisper Large V3 Turbo 101 2.4 倍

これは短いクリップでの計測値で、同じエンジンが長い録音で出す数字より低く出ます。この列は、この 1 回の実行のなかでエンジン同士を比べるためだけに使ってください。

同じ計測環境では、Parakeet V3SenseVoice Small が Qwen3-ASR よりおよそ 1 桁速く動きます。短いクリップではなく長いファイルでは、Parakeet が M4 Pro で実時間の 103 倍、SenseVoice が 52 倍以上を記録しました。音声も測り方も違いますが、示す向きは同じです。

Qwen3-ASR は中間に位置します。今回の短いクリップで最も遅かったのは Whisper Large V3 Turbo で、Qwen ではありません。ただし言語による振れ幅はどのエンジンより大きく、ギリシャ語の 2.7 倍から日本語の 12.4 倍まで開きます。

Qwen3-ASR はメモリとディスクをどれだけ使うのか

ピークメモリは、同じ FLEURS 実行の各項目で観測したプロセスの最大使用量。M5 MacBook Air 1 台、朗読音声、短いクリップ。

エンジン ダウンロード 今回のピークメモリ
Parakeet TDT 0.6B v3 465 MB 0.09 GiB
Whisper Small 600 MB 0.87 GiB
SenseVoice Small 827 MB 0.95 GiB
Whisper Large V3 Turbo 約 1.6 GB 1.87 GiB
Qwen3-ASR 1.7B 約 2.5 GB 2.43 GiB

2 つの軸のどちらでも、Qwen3-ASR は 5 つのなかで最も重いモデルです。ダウンロードは約 2.5 GB、今回のプロセスのピークメモリは 2.43 GiB。Whisper Large V3 Turbo は約 1.6 GB と 1.87 GiB でした。

メモリ 8 GB の Mac には、もっと軽い選択肢があります。Parakeet V3 は 465 MB と 0.09 GiB で 25 言語、Whisper Small は 600 MB と 0.87 GiB で 101 言語をカバーします。

計測方法:FLEURS、30 言語、Mac 1 台

Qwen3-ASR 1.7B は MLX の 8-bit ビルド、Whisper Large V3 Turbo は Metal 上で動く whisper.cpp の ggml ビルドを使いました。データは Google FLEURS のテスト分割、リビジョン 70bb2e84(CC-BY-4.0)です。102 言語のうち 83 言語、各言語およそ 75 文・15 分ぶんを、すべてのモデルに同じ音声・同じ順番で通しました。ペアで比べたのは Qwen が公称する 30 言語です。単語で区切る言語は単語誤り率、中国語・広東語・日本語・韓国語・タイ語は文字誤り率で測り、1 つの数値にまとめていません。誤差範囲は項目単位のブートストラップを 10,000 回。機材は M5 MacBook Air 1 台、32 GB、macOS 26.5。どちらのモデルにも空の出力や失敗はありませんでした。

FLEURS は朗読音声で、会議でも口述でもありません。朗読音声の順位は、私たちの検証でも実際の音声を前に 2 回崩れました。だから長い録音には外挿しません。これらの表でわかるのは、そのモデルがあなたの言語で使いものになりそうかどうかであって、実際に得られる精度ではありません。Qwen3-ASR 1.7B を実際の会議で評価した結果は、別の記事にします。

Whisper Large V3 の代わりに Qwen3-ASR を使うべきか

Mac 版 Whisper Notes のなかで言うなら、言語ごとの答えはこうなります。

  • 広東語、ヒンディー語、タイ語、ベトナム語、フランス語を文字起こしするなら:Qwen3-ASR 1.7B を選んでください。
  • 中国語、日本語、韓国語、英語、ドイツ語、スペイン語、イタリア語なら:わずかに前に出ただけで、主張できるのもそのわずかな差だけです。どちらのモデルでも構いません。ペルシャ語、アラビア語、インドネシア語、ロシア語、ポルトガル語、マケドニア語、マレー語も同じです。
  • フィンランド語、ハンガリー語、ギリシャ語、チェコ語、スウェーデン語、デンマーク語、ポーランド語、ルーマニア語、フィリピノ語、トルコ語、オランダ語なら:Whisper Large V3 Turbo のままで。この 11 言語はすべて明確に勝っています。
  • 速度やディスク容量が大事なら:このエンジンは向きません。同じ計測環境で Parakeet V3SenseVoice Small が 1 桁速く、ダウンロードサイズもごく一部で済みます。Whisper Small は 600 MB で 101 言語をカバーし、今回は 6.4 倍でした。
  • iPhone 版か Mac App Store 版を使っているなら:このエンジンはまだ届いていません。その 2 つでは広東語に SenseVoice を使ってください。

これは Mac 版 Whisper Notes が、アリババのオープンな Qwen3-ASR を端末上に移植したものです。公開された重みを Apple MLX の 8-bit に変換し、あなたの Mac 自身の GPU で動かします。音声がアリババのサーバーに送られることはありません。Direct Download(DMG)1.5.0 で SenseVoice が置き換えた 0.6B とは別のモデルです。

使い方(Mac の Direct Download、DMG 1.6.0 以降):設定 → 文字起こしモデル → Qwen3-ASR 1.7B。モデルは初回利用時にアプリ内でダウンロードされ、サイズは約 2.5 GB です。Apple silicon の macOS 15 以降が必要で、メモリは 16 GB を推奨します。アプリのそれ以外の部分は macOS 14 でも動きます。エンジンごとの対応言語は言語対応ページにあります。ローカルの CLI と MCP サーバーは qwen、qwen3、qwen3-asr の 3 つの名前を受け付けます。

切り替えたくなければ、何も変える必要はありません。Parakeet V3 は今もデフォルトのままです

よくある質問

Qwen3-ASR は Whisper Large V3 Turbo より正確ですか?

言語によります。そして勝敗はほぼ五分です。Mac 版 Whisper Notes で自社実施した FLEURS の計測では、両モデルが共通で対応する 30 言語のうち、Qwen3-ASR 1.7B が 15 言語、Whisper Large V3 Turbo が 15 言語で上回りました。Qwen が明確に勝ったのは広東語(文字誤り率 6.00% 対 37.97%)、ヒンディー語(単語誤り率 13.67% 対 30.42%)、タイ語、ベトナム語、フランス語です。Turbo が明確に勝ったのはフィンランド語(単語誤り率 6.54% 対 26.08%)、ハンガリー語、ギリシャ語、チェコ語、スウェーデン語、デンマーク語、ポーランド語、ルーマニア語、フィリピノ語、トルコ語、オランダ語です。30 のうち 14 の差は誤差範囲に収まるので、引き分けと読むべきです。自分の言語が Qwen の勝ち列にあり、Whisper Notes の Mac Direct Download(DMG)版を使っているなら Qwen3-ASR を、それ以外の場合と Qwen の 30 言語に入らない言語には Whisper Large V3 Turbo を選んでください。Whisper は 101 言語すべてをカバーします。

iPhone や Mac App Store 版で Qwen3-ASR を使えますか?

今のところ、Whisper Notes の Mac Direct Download(DMG)版 1.6.0 以降に入っています。Mac App Store 版も後のリリースで新しいエンジンを取り込む予定ですが、時期は未定です。それまでは、iPhone アプリと Mac App Store 版に Whisper、Parakeet V3、SenseVoice の 3 系統があり、Qwen が認識する言語はすべてそこの Whisper でもカバーされます。モデル数で数えると、Mac App Store 版は今日 4 つ、Direct Download 版は 5 つです。Whisper が Small と Large V3 Turbo の 2 つで入っているためです。iPhone で広東語が必要なら、そこでは SenseVoice を使ってください。

中国語・日本語・韓国語には Qwen3-ASR と SenseVoice のどちらですか?

精度は近く、速度は大きく離れています。今回の FLEURS では、Qwen3-ASR の文字誤り率は中国語 5.69%、日本語 5.39%、韓国語 3.51%。SenseVoice Small は同じ音声で 7.06%、6.85%、7.82% でした。ただし同じ実行で SenseVoice の実時間倍率の中央値は 161 倍、Qwen は 8.7 倍。ダウンロードは 827 MB と約 2.5 GB です。SenseVoice は iPhone と 2 つの Mac 版のどちらでも使えます。広東語を文字起こしする場合を除いて、SenseVoice を選んでください。広東語では Qwen3-ASR が文字誤り率 6.00%、SenseVoice が 36.71% で、待つ価値のある差があります。

Qwen3-ASR 1.7B の動作条件は何ですか?

Apple silicon の Mac で macOS 15 以降、メモリは 16 GB を推奨、モデル用にディスク約 2.5 GB が必要です。Mac 版 Whisper Notes のほかの部分より条件は高く、アプリ本体は macOS 14 以降で動きます。今回のベンチマークでは、プロセスのピークメモリが 2.43 GiB と 5 つのエンジンで最も高い値でした。メモリ 8 GB の Mac なら、Whisper Small が 600 MB で同じ 101 言語を、Parakeet V3 が 465 MB で 25 のヨーロッパ言語をカバーします。

Qwen3-ASR を使うと音声は Mac の外に出ますか?

出ません。アリババは Qwen3-ASR をクラウドサービスとしても提供していて、DashScope のリアルタイム API とファイル転写 API では音声が同社のサーバーにアップロードされます。Whisper Notes はそれらを使いません。公開された重みを MLX の 8-bit モデルとして、あなたの Mac の GPU でローカルに実行します。アカウントも API キーも不要で、ネットワークを切っていても文字起こしできます。これはアプリのどのエンジン系統でも、どの配布チャネルでも変わりません。

この数字が自分の録音での精度と合わないのはなぜですか?

FLEURS が短く、雑音のない朗読音声だからです。あなたの録音はそうではありません。今回は公開データセットでの較正です。1 言語あたり約 75 文、M5 MacBook Air 1 台、すべてのモデルに同じ音声。あるモデルがその言語で使いものになりそうかを問うには役立ちますが、会議や雑音の多い音声、なまりのある話し方、2 時間のファイルでの精度を予測するものではありません。

試してみる

Qwen3-ASR 1.7B は Mac 版 Whisper Notes 1.6.0 以降、Direct Download(DMG)版にだけ入っています。設定 → 文字起こしモデルから選べます。無料トライアルは 10,000 語まで使えるので、自分の言語を通して上の表に反論するには十分です。

私たちの数字があなたの実感と合わない言語があれば、mac@whispernotes.app までメールをください。更新内容の全文は whispernotes.app/changelog にあります。

ここまでの出典:Google FLEURS テスト分割リビジョン 70bb2e84 での自社実行、Qwen3-ASR 1.7B のモデルカード、そして言語対応ページのエンジン別言語表です。この表はアプリのソースから生成しています。