Apple Speech vs Whisper: czy SpeechAnalyzer obsługuje polski?

1 września 2026
·
8 min read
·Whisper Notes Team

Od macOS 26 i iOS 26 Apple dostarcza nową generację rozpoznawania mowy na urządzeniu — SpeechAnalyzer i SpeechTranscriber, dalej w skrócie Apple Speech. Jest ona wyraźnie dokładniejsza od starego silnika dyktowania. Chcieliśmy więc sprawdzić: czy wbudowane rozpoznawanie mowy Apple jest już na tyle dobre, że można całkiem zrezygnować z aplikacji do transkrypcji? I jak daleko mu do otwartych modeli działających na urządzeniu w Whisper Notes — Whisper, Parakeet, SenseVoice i Qwen3-ASR? Przeprowadziliśmy rygorystyczny test. Oto wyniki. W dziesięciu przetestowanych językach Apple Speech ani razu nie miał najniższego współczynnika błędów, w koreańskim, japońskim i chińskim mieścił się w granicy 1,5 punktu od lidera, a dla niderlandzkiego, rosyjskiego i polskiego w ogóle nie ma modelu.

Jak daleko Apple Speech jest od pobieranych modeli?

Język Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Angielski 8,80 4,49 5,49 7,04 6,89 8,46
Niemiecki 6,26 2,85 4,05 8,67 6,26
Niderlandzki 7,36 5,69 16,75 8,58
Rosyjski 5,65 5,13 11,37 7,12
Polski 12,59 5,45 15,81 8,30
Japoński 6,36 5,74 5,30 11,37 6,78
Koreański 4,31 3,54 4,25 7,30 7,85
Francuski 7,61 4,57 5,97 13,24 5,83
Chiński 7,97 6,49 7,97 20,50 7,69
Hiszpański (Ameryka Łacińska) 5,41 3,38 3,62 6,22 4,86

Dziesięć spośród najczęściej używanych języków, jeden silnik w każdej kolumnie. Każda komórka pokazuje współczynnik błędów danego silnika — im niżej, tym lepiej; zielony oznacza najniższy wynik w wierszu, biały drugi najniższy. CER dla japońskiego, koreańskiego i chińskiego, WER dla pozostałych; nigdy nie łączymy ich w jedną liczbę. Nasz własny przebieg FLEURS, wykonany przez zespół Whisper Notes, na jednym M5 MacBook Air, mowa czytana.

Nazwy skrócone: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Kreska oznacza, że silnik nie ma modelu dla danego języka.

Qwen3-ASR 1.7B ma najniższy współczynnik błędów w sześciu z dziesięciu języków, a Whisper Large V3 Turbo w pozostałych czterech. Apple Speech traci do lidera wiersza 0,77 punktu w koreańskim, 1,06 w japońskim i 1,48 w chińskim, gdzie remisuje z Whisper Large V3 Turbo wynikiem 7,97. W siedmiu obsługiwanych językach traci do lidera od 0,8 do 4,3 punktu; najwięcej w angielskim — 8,80 wobec 4,49. Dla niderlandzkiego, polskiego i rosyjskiego nie ma wyniku Apple Speech.

Jakie języki obsługuje Apple Speech?

W tym przebiegu Apple Speech zwrócił wyniki dla 21 z 83 konfiguracji językowych. Oba modele Whisper obejmują wszystkie 83, Qwen3-ASR 1.7B — 30, a Parakeet V3 — 25. Z dziesięciu języków powyżej nie ma modelu dla niderlandzkiego, polskiego ani rosyjskiego. Nie istnieje stała lista do przytoczenia: zasoby językowe należą do macOS, dlatego aplikacja w czasie działania pyta o to, co jest dostępne na danym komputerze.

Język Apple Speech Qwen3-ASR Whisper Large Whisper Small Parakeet SenseVoice
Włoski 4,39 2,58 2,58 7,64 3,43
Kantoński 8,69 6,44 36,75 119,01 37,23
Portugalski (Brazylia) 9,35 5,17 5,44 8,61 6,49
Hindi 101,50 13,19 29,64 61,26
Telugu 101,63 81,74 103,19
Urdu 101,69 23,39 38,83
Pendżabski 101,75 92,05 103,40
Bengalski 102,00 83,52 117,37
Nepalski 102,13 88,59 118,84
Malajalam 102,18 107,34 167,16
Marathi 102,23 82,69 109,95
Kannada 103,83 72,07 116,10
Gudżarati 104,52 75,31 108,91
Tamilski 113,01 71,28 79,77

Pozostałe czternaście języków, dla których Apple Speech zwrócił wynik, w kolejności według własnego współczynnika błędów. Kolumny, kolory i nazwy skrócone jak wyżej; CER dla kantońskiego, WER dla reszty. Współczynnik błędów może przekroczyć 100 %, ponieważ wstawienia także wchodzą do licznika.

W ostatnich jedenastu wierszach, od hindi do tamilskiego, Apple Speech odpowiedział transliteracją łacińską zamiast rodzimym pismem. Jego współczynnik błędów mierzy tam więc niezgodność pisma, a nie dokładność rozpoznawania, i te komórki nie uczestniczą w rankingu wiersza; wartości pozostałych silników w tych wierszach to zwykłe pomiary.

Jak działa SpeechAnalyzer

Apple ma API rozpoznawania mowy od iOS 10. Poprzednie, SFSpeechRecognizer, jest silnikiem starej ścieżki dyktowania. SpeechAnalyzer je zastępuje: został wprowadzony w macOS 26 i iOS 26 i jest dostępny na każdej platformie Apple poza watchOS.

API opiera się na sesji. Tworzysz SpeechAnalyzer, przekazujesz mu jeden lub więcej modułów i dostarczasz dźwięk; SpeechTranscriber to moduł zamieniający mowę na tekst. Dźwięk trafia jako sekwencja asynchroniczna, którą sam zapełniasz, wyniki wracają jako druga, a obie zwykle działają w różnych zadaniach. Analizator przyjmuje jedną sekwencję wejściową naraz. Każdy bufor i wynik ma znacznik czasu względem własnej osi czasu dźwięku, więc wynik można umieścić z powrotem tam, skąd pochodzi.

Schemat Apple z WWDC25 pokazujący współbieżność SpeechAnalyzer: zadanie wejściowe przekazuje wejściową AsyncSequence do SpeechAnalyzer i SpeechTranscriber w zadaniu analizy, które wysyłają AsyncSequence wyników do zadania wynikowego i interfejsu użytkownika

Jedna sesja, trzy zadania: dźwięk trafia jako AsyncSequence, SpeechAnalyzer i SpeechTranscriber go analizują, a wyniki wracają jako druga AsyncSequence odczytywana przez interfejs. Źródło: Apple, sesja WWDC25 nr 277.

Wyniki przychodzą dwukrotnie. Wszystko w zakresie, który Apple nazywa zmiennym, może jeszcze zostać zastąpione lepszym wynikiem; wszystko poza nim jest ostateczne. Dzięki temu aplikacja pokazuje wstępną transkrypcję, gdy jeszcze mówisz, a potem ją poprawia.

Apple podaje pięć celów projektowych modelu SpeechTranscriber: długie nagrania, mowę konwersacyjną, odległych mówców, małe opóźnienie i prywatność, czyli działanie na urządzeniu. Na tym modelu opierają się Notatki, Dyktafon, Dziennik i podsumowania rozmów.

Slajd Apple z WWDC25 z możliwościami modelu SpeechTranscriber: długie nagrania, mowa konwersacyjna, odlegli mówcy, małe opóźnienie, prywatność

Pięć celów projektowych modelu SpeechTranscriber deklarowanych przez Apple. Źródło: Apple, sesja WWDC25 nr 277.

Modele nie są częścią żadnej aplikacji. Pobiera się je z serwerów Apple przez AssetInventory, system je przechowuje i aktualizuje, a aplikacje współdzielą. Nie zwiększają rozmiaru pobierania aplikacji ani pamięci jej procesu, a dekodowanie odbywa się poza procesem wywołującym. Gdy SpeechTranscriber nie ma modelu dla języka lub urządzenia, zadanie przejmuje DictationTranscriber z tymi samymi modelami co dyktowanie systemowe.

Jak to mierzyliśmy

Każdy silnik w tym wpisie transkrybował te same nagrania, w tej samej kolejności, po jednym naraz, na M5 MacBook Air (32 GB, macOS 27.0). Dźwięk pochodzi ze zbioru testowego Google FLEURS w rewizji 70bb2e84: około 150 zdań i 30 minut na język. Stały skrót własnych identyfikatorów pozycji zbioru ustala ich kolejność, a my bierzemy najkrótszy ciąg całych pozycji, który przekracza trzydzieści minut; żaden wynik modelu nie miał wpływu na ten wybór. Każdą komórkę odtworzyliśmy z jej własnego potwierdzenia i ponownie sprawdziliśmy; wszystkie 285 przeszło kontrolę.

Wyniki to WER tam, gdzie słowa rozdzielają spacje, oraz CER dla japońskiego, koreańskiego, chińskiego i kantońskiego. FLEURS to mowa czytana, nie spotkanie ani dyktowanie. Te tabele mówią, czy silnik jest wiarygodnym kandydatem dla Twojego języka, a nie jaki wynik uzyskasz na własnych nagraniach.

O ile lepszy jest od starego dyktowania Apple?

Apple dostarcza dwa tryby pracy transkrypcji i zmierzyliśmy oba. SpeechTranscriber to nowy, w tym wpisie nazywany Apple Speech. DictationTranscriber to tryb zgodności, czyli ścieżka dyktowania, którą Mac miał wcześniej.

Język Dyktowanie Apple Apple Speech
Koreański 7,11 4,31
Włoski 6,93 4,39
Hiszpański (Ameryka Łacińska) 8,43 5,41
Niemiecki 12,69 6,26
Japoński 9,37 6,36
Francuski 17,10 7,61
Chiński 10,28 7,97
Kantoński 10,18 8,69
Angielski 13,83 8,80
Portugalski (Brazylia) 10,85 9,35

Wszystkie języki zmierzone poprawnie przez oba tryby Apple, uporządkowane według współczynnika błędów Apple Speech; zielony oznacza lepszą wartość w wierszu. Ten sam przebieg, te same nagrania, ten sam Mac. CER dla japońskiego, koreańskiego, chińskiego i kantońskiego, WER dla reszty.

Apple Speech jest dokładniejszy we wszystkich dziesięciu. W języku medianowym usuwa około jednej trzeciej błędów, we francuskim i niemieckim ponad połowę, a w portugalskim brazylijskim i kantońskim około jednego błędu na siedem.

To porównanie z własną przeszłością Apple. Wobec modeli, które pobierasz, jego najlepsze miejsce w poprawnie zmierzonym języku to drugie w kantońskim. Dyktowanie obejmuje więcej języków: 33 konfiguracje wobec 21 w tym przebiegu, w tym wszystkie trzy języki, których brakuje tu nowemu silnikowi.

Co daje wbudowany silnik?

Silnik Szybkość Szczytowe zużycie pamięci Pobieranie
SenseVoice Small 162,3× szybciej niż w czasie rzeczywistym 0,95 GiB 827 MB
Parakeet V3 75,6× szybciej niż w czasie rzeczywistym 0,09 GiB 465 MB
Apple Speech 30,8× szybciej niż w czasie rzeczywistym nie podajemy pakiet językowy pobiera macOS, nie aplikacja
Qwen3-ASR 1.7B 11,1× szybciej niż w czasie rzeczywistym 2,43 GiB około 2,5 GB
Whisper Small 7,9× szybciej niż w czasie rzeczywistym 0,87 GiB 600 MB
Whisper Large V3 Turbo 3,0× szybciej niż w czasie rzeczywistym 1,87 GiB około 1,6 GB

Szybkość to mediana każdego silnika dla trzynastu języków poprawnie mierzonych w tym wpisie, z uwzględnieniem tylko tych, które uruchomił — przepustowość przetwarzania pojedynczych pozycji, pomiar diagnostyczny, a nie opóźnienie produktu. Szczytowe zużycie pamięci to maksimum grupy procesów w tym przebiegu. Apple Speech dekoduje wewnątrz usługi macOS, której nie posiada aplikacja wywołująca, więc żadna wartość nie znaczyłaby tam tego samego co dla pozostałych pięciu.

Zasoby językowe Apple Speech są raz pobierane przez system i współdzielone przez wszystkie aplikacje. Nic nie trafia do samej aplikacji ani nie jest przydzielane w jej własnym procesie. Usługa systemowa nadal używa pamięci podczas pracy, ale nie możemy jej dokładnie przypisać, dlatego zamiast zera nie podajemy tam żadnej liczby. Silnik działał 30,8× szybciej niż w czasie rzeczywistym, wolniej niż Parakeet V3 i SenseVoice Small.

Whisper Large V3 Turbo wygrywa cztery z dziesięciu wierszy i jest tu najwolniejszym silnikiem, około dziesięć razy wolniejszym od Apple Speech, zajmując około 1,6 GB na dysku. Qwen3-ASR 1.7B wygrywa pozostałe sześć przy około 2,5 GB i 2,43 GiB pamięci. Parakeet V3 wymaga 465 MB i 0,09 GiB, wyprzedza Turbo we francuskim, przegrywa z nim w polskim i nie ma japońskiego, koreańskiego, chińskiego ani kantońskiego. Whisper Small jest najbliższym porównaniem przy 600 MB, a Apple Speech był dokładniejszy w ośmiu z dziesięciu języków poprawnie zmierzonych przez oba.

Czy używać Apple Speech zamiast pobranego modelu?

Język po języku:

  • Angielski: niezbyt dobry wybór. Apple Speech uzyskał 8,80; Qwen3-ASR 1.7B (4,49) albo Whisper Large V3 Turbo (5,49) jest wyraźnie dokładniejszy.
  • Niemiecki: niezbyt dobry wybór. Apple Speech uzyskał 6,26; Qwen3-ASR 1.7B (2,85) albo Whisper Large V3 Turbo (4,05) jest wyraźnie dokładniejszy.
  • Niderlandzki, rosyjski i polski: Apple Speech nie ma modelu dla tych trzech języków. Whisper Large V3 Turbo był najdokładniejszy w każdym z nich: 5,69, 5,13 i 5,45.
  • Japoński: nadaje się. Apple Speech uzyskał 6,36, za Whisper Large V3 Turbo z wynikiem 5,30.
  • Koreański: nadaje się. Apple Speech uzyskał 4,31, za Qwen3-ASR 1.7B z wynikiem 3,54.
  • Francuski: niezbyt dobry wybór. Apple Speech uzyskał 7,61; Qwen3-ASR 1.7B (4,57) albo Parakeet V3 (5,83) jest wyraźnie dokładniejszy.
  • Chiński: nadaje się. Apple Speech uzyskał 7,97, tyle samo co Whisper Large V3 Turbo; najdokładniejszy był Qwen3-ASR 1.7B z wynikiem 6,49.
  • Hiszpański: niezbyt dobry wybór. Apple Speech uzyskał 5,41; Qwen3-ASR 1.7B (3,38) albo Whisper Large V3 Turbo (3,62) jest wyraźnie dokładniejszy.

Apple Speech to używana w tym wpisie skrócona nazwa SpeechTranscriber od Apple, API działającego na urządzeniu, które każda aplikacja na Maca może wywołać w macOS 26 lub nowszym. Nie jest to jeden z modeli pobieranych przez Whisper Notes na Maca: w wersji do bezpośredniego pobrania na Maca (DMG) są to Whisper, Parakeet V3, SenseVoice i Qwen3-ASR, a na iPhonie i w wersji z Mac App Store — Whisper, Parakeet V3 i SenseVoice. Tabela według silników znajduje się na naszej stronie obsługiwanych języków.

Nic z tego nie zmienia dzisiejszego działania Whisper Notes na Maca: Parakeet V3 nadal jest domyślny.

Najczęściej zadawane pytania

Czy Apple Speech jest równie dokładny jak Whisper?

Nie w większości języków obsługiwanych przez oba. W naszym przebiegu FLEURS, w siedmiu z tych dziesięciu języków obsługiwanych przez Apple Speech, Whisper Large V3 Turbo był dokładniejszy w sześciu, a w chińskim oba uzyskały dokładnie 7,97 % CER. W porównaniu z Whisper Small kolejność się odwraca: Apple Speech prowadził w sześciu z siedmiu i przegrał tylko angielski, 8,80 % wobec 7,04 % WER. Nie prowadzi w żadnym poprawnie zmierzonym języku w tym przebiegu, a najbliżej jest w koreańskim: 4,31 % CER wobec 3,54 % lidera wiersza. Kantoński jest jedynym poprawnie zmierzonym językiem, w którym pokonał Whisper Large V3 Turbo: 8,69 % wobec 36,75 % CER. Użyj wbudowanego silnika, gdy obsługuje Twój język i wolisz, aby macOS zarządzał pakietem językowym; dla najdokładniejszego wyniku albo gdy Twój język jest jednym z trzech brakujących tutaj w Apple Speech, wybierz Whisper Large V3 Turbo.

Jakie języki obsługuje Apple Speech?

Listę ustala macOS, nie aplikacja. W tym przebiegu Apple Speech dał wyniki w 21 z 83 testowanych konfiguracji językowych, oba warianty Whisper w 83, Qwen3-ASR 1.7B w 30, a Parakeet V3 w 25. Z dziesięciu najczęściej używanych języków w głównej tabeli ma angielski, niemiecki, japoński, koreański, francuski, chiński i hiszpański, ale nie ma niderlandzkiego, polskiego ani rosyjskiego. Druga tabela zawiera pozostałe czternaście konfiguracji: włoski, kantoński, portugalski brazylijski oraz jedenaście języków, w których odpowiedział transliteracją łacińską zamiast rodzimym pismem. Aplikacja musi w czasie działania zapytać macOS, jakie języki ma dany komputer. Jeśli brakuje Twojego języka, Whisper obejmuje każdy język z listy aplikacji na każdym kanale.

Apple Speech czy Parakeet V3 — co wybrać?

Parakeet V3 w każdym europejskim języku obsługiwanym przez oba. Uzyskał 6,89 wobec 8,80 w angielskim, 5,83 wobec 7,61 we francuskim, 4,86 wobec 5,41 w hiszpańskim, 3,43 wobec 4,39 we włoskim i 6,49 wobec 9,35 w portugalskim brazylijskim; w niemieckim oba mają 6,26. Parakeet V3 nie ma japońskiego, koreańskiego, chińskiego ani kantońskiego, więc tam Apple Speech jest jedynym z tej dwójki, który istnieje, i mieści się w granicy 1,5 punktu od lidera wiersza w japońskim, koreańskim i chińskim. Parakeet V3 ma 465 MB do pobrania i działał 75,6× szybciej niż w czasie rzeczywistym ze szczytem 0,09 GiB; pakiet językowy Apple Speech pobiera macOS, a silnik działał 30,8× szybciej niż w czasie rzeczywistym przy pamięci, której nie podajemy.

Czym jest SpeechAnalyzer i czy to to samo co dyktowanie Apple?

SpeechAnalyzer to nadrzędne API, które Apple przedstawiło na WWDC 2025 i wydało w macOS 26 i iOS 26. SpeechTranscriber to znajdujący się w nim tryb pracy transkrypcji — właśnie jego zmierzyliśmy i w tym wpisie nazywamy Apple Speech. Dyktowanie to tryb zgodności, który również uruchomiliśmy: Apple Speech był dokładniejszy we wszystkich dziesięciu językach poprawnie obsłużonych przez oba, usuwając około jednej trzeciej błędów w języku medianowym i ponad połowę we francuskim i niemieckim. Dyktowanie obejmuje więcej języków, 33 konfiguracje wobec 21, jest więc silnikiem systemowym dla niderlandzkiego, polskiego lub rosyjskiego, jeśli akceptujesz 17,34 %, 13,50 % i 13,13 % WER. Whisper Large V3 Turbo uzyskał na tych samych nagraniach 5,69 %, 5,45 % i 5,13 %.

Czy dźwięk opuszcza mojego Maca, gdy używam Apple Speech?

Apple opisuje SpeechTranscriber jako rozpoznawanie mowy na urządzeniu: macOS pobiera zasoby językowe raz, a rozpoznawanie działa lokalnie. Mierzyliśmy dokładność i szybkość, nie zachowanie sieci, dlatego tę część opisujemy tak jak Apple. Silniki pobierane przez Whisper Notes — Whisper, Parakeet V3, SenseVoice i Qwen3-ASR — działają na GPU lub Neural Engine Twojego Maca bez konta i API key, a transkrypcja działa przy wyłączonej sieci na każdym kanale.

Dlaczego te liczby nie zgadzają się z dokładnością, jaką uzyskuję na swoich nagraniach?

Bo FLEURS to krótka, czysta mowa czytana, a Twoje nagrania takie nie są. Nasz przebieg to kalibracja na publicznym zbiorze: około 150 zdań i 30 minut dźwięku na język, jeden M5 MacBook Air, te same nagrania dla każdego silnika. Mówi, czy silnik jest wiarygodnym kandydatem dla języka, a nie jaki wynik uzyskasz na spotkaniu, w hałasie, przy mowie z akcentem lub na dwugodzinnym pliku.

Dlaczego inne testy mówią, że Apple Speech wygrywa z Whisper?

Porównują go z Whisper Small i tylko w angielskim. W naszym przebiegu wychodzi to samo: wobec Whisper Small Apple Speech był lepszy w ośmiu z dziesięciu języków poprawnie zmierzonych przez oba. Angielski jest jednym z dwóch przegranych, 8,80 wobec 7,04. Na Whisper Large V3 Turbo to się nie przenosi: z nim Apple Speech przegrał w ośmiu z tych samych dziesięciu języków, zremisował w chińskim przy 7,97 i wygrał tylko w kantońskim. O nagłówku decyduje to, który Whisper bierze udział w porównaniu.

Wypróbuj

Wszystkie pięć pobieranych modeli — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small i Qwen3-ASR 1.7B — znajdziesz w bezpośrednim pobraniu Whisper Notes na Maca (DMG) pod ścieżką Ustawienia → Model transkrypcji.

Jeśli nasze liczby nie zgadzają się z Twoim doświadczeniem w danym języku, napisz na mac@whispernotes.app. Pełne informacje o wydaniach: whispernotes.app/changelog.

Źródła: nasz przebieg na zbiorze testowym Google FLEURS w rewizji 70bb2e84, dokumentacja Apple dotycząca SpeechAnalyzer oraz wcześniejszy przebieg Qwen3-ASR w trzydziestu językach.