Sedan macOS 26 och iOS 26 erbjuder Apple en ny generation taligenkänning på enheten — SpeechAnalyzer och SpeechTranscriber, nedan kallade Apple Speech. Den är märkbart mer träffsäker än den gamla dikteringsmotorn. Därför ville vi veta: är Apples inbyggda taligenkänning nu bra nog för att du helt ska kunna avstå från en transkriberingsapp? Och hur långt ligger den från de lokala öppna modellerna i Whisper Notes — Whisper, Parakeet, SenseVoice och Qwen3-ASR? Vi genomförde ett strikt test. Här är resultaten. På de tio språk vi testade hade Apple Speech aldrig lägst felfrekvens, låg inom 1,5 poäng från den bästa på koreanska, japanska och kinesiska, och saknar helt modell för nederländska, ryska och polska.
Hur långt ligger Apple Speech från modellerna du laddar ner?
| Språk | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Engelska | 8,80 | 4,49 | 5,49 | 7,04 | 6,89 | 8,46 |
| Tyska | 6,26 | 2,85 | 4,05 | 8,67 | 6,26 | — |
| Nederländska | — | 7,36 | 5,69 | 16,75 | 8,58 | — |
| Ryska | — | 5,65 | 5,13 | 11,37 | 7,12 | — |
| Polska | — | 12,59 | 5,45 | 15,81 | 8,30 | — |
| Japanska | 6,36 | 5,74 | 5,30 | 11,37 | — | 6,78 |
| Koreanska | 4,31 | 3,54 | 4,25 | 7,30 | — | 7,85 |
| Franska | 7,61 | 4,57 | 5,97 | 13,24 | 5,83 | — |
| Kinesiska | 7,97 | 6,49 | 7,97 | 20,50 | — | 7,69 |
| Spanska (Latinamerika) | 5,41 | 3,38 | 3,62 | 6,22 | 4,86 | — |
Tio av de mest använda språken, en motor per kolumn. Varje cell är motorns felfrekvens; lägre är bättre. Grönt markerar lägst i raden, vitt näst lägst. CER för japanska, koreanska och kinesiska, WER för övriga, aldrig sammanslagna till en enda siffra. Vår egen FLEURS-körning, gjord av teamet bakom Whisper Notes, på en M5 MacBook Air, uppläst tal.
Kortnamn: Qwen3-ASR = Qwen3-ASR 1.7B, Whisper Large = Whisper Large V3 Turbo, Parakeet = Parakeet V3, SenseVoice = SenseVoice Small. Ett streck betyder att motorn saknar modell för språket.
Qwen3-ASR 1.7B har lägst felfrekvens på sex av de tio språken, Whisper Large V3 Turbo på de andra fyra. Apple Speech ligger 0,77 efter radens bästa på koreanska, 1,06 på japanska och 1,48 på kinesiska, där den ligger jämnt med Whisper Large V3 Turbo på 7,97. Över de sju språk den stöder ligger den 0,8 till 4,3 poäng efter radens bästa, längst efter på engelska med 8,80 mot 4,49. För nederländska, polska och ryska finns inget resultat för Apple Speech.
Vilka språk stöder Apple Speech?
Apple Speech gav resultat för 21 av de 83 språkkonfigurationerna i den här körningen. Båda Whisper-modellerna täcker alla 83, Qwen3-ASR 1.7B 30 och Parakeet V3 25. Av de tio språken ovan saknar den modell för nederländska, polska och ryska. Det finns ingen fast lista att hänvisa till: språkresurserna tillhör macOS, så en app frågar vid körning vad som finns på en viss dator.
| Språk | Apple Speech | Qwen3-ASR | Whisper Large | Whisper Small | Parakeet | SenseVoice |
|---|---|---|---|---|---|---|
| Italienska | 4,39 | 2,58 | 2,58 | 7,64 | 3,43 | — |
| Kantonesiska | 8,69 | 6,44 | 36,75 | 119,01 | — | 37,23 |
| Portugisiska (Brasilien) | 9,35 | 5,17 | 5,44 | 8,61 | 6,49 | — |
| Hindi | 101,50 | 13,19 | 29,64 | 61,26 | — | — |
| Telugu | 101,63 | — | 81,74 | 103,19 | — | — |
| Urdu | 101,69 | — | 23,39 | 38,83 | — | — |
| Punjabi | 101,75 | — | 92,05 | 103,40 | — | — |
| Bengaliska | 102,00 | — | 83,52 | 117,37 | — | — |
| Nepali | 102,13 | — | 88,59 | 118,84 | — | — |
| Malayalam | 102,18 | — | 107,34 | 167,16 | — | — |
| Marathi | 102,23 | — | 82,69 | 109,95 | — | — |
| Kannada | 103,83 | — | 72,07 | 116,10 | — | — |
| Gujarati | 104,52 | — | 75,31 | 108,91 | — | — |
| Tamil | 113,01 | — | 71,28 | 79,77 | — | — |
De övriga fjorton språken som Apple Speech gav resultat för, ordnade efter den egna felfrekvensen. Samma kolumner, färger och kortnamn som ovan; CER för kantonesiska, WER för övriga. En felfrekvens kan överstiga 100 % eftersom infogningar också räknas i täljaren.
På de sista elva raderna, från hindi till tamil, svarade Apple Speech med latinsk translitterering i stället för språkets eget skriftsystem. Felfrekvensen där mäter därför en skillnad i skriftsystem snarare än träffsäkerheten i igenkänningen, och de cellerna lämnas utanför radens rangordning. De andra motorernas värden på de raderna är vanliga mätningar.
Så fungerar SpeechAnalyzer
Apple har haft ett API för taligenkänning sedan iOS 10. Det API:t, SFSpeechRecognizer, är motorn bakom den gamla dikteringsvägen. SpeechAnalyzer ersätter det, introducerades i macOS 26 och iOS 26 och finns på alla Apple-plattformar utom watchOS.
API:t är uppbyggt kring en session. Du skapar en SpeechAnalyzer, ger den en eller flera moduler och matar in ljud; SpeechTranscriber är modulen som omvandlar tal till text. Ljudet går in som en asynkron sekvens som du själv fyller, resultaten kommer tillbaka som en andra sekvens, och de två körs vanligen i olika uppgifter. Analysatorn tar en indatasekvens i taget. Varje buffert och varje resultat får en tidskod mot ljudets egen tidslinje, så att ett resultat kan placeras tillbaka där det hör hemma.
En session, tre uppgifter: ljud går in som en AsyncSequence, SpeechAnalyzer och SpeechTranscriber analyserar det, och resultaten kommer tillbaka som en andra AsyncSequence som gränssnittet kan läsa. Källa: Apple, WWDC25-session 277.
Resultaten kommer två gånger. Allt inom det Apple kallar det flyktiga intervallet kan fortfarande ersättas av ett bättre resultat; allt utanför är slutgiltigt. På så vis kan en app visa en preliminär transkription medan du fortfarande talar och rätta den efteråt.
Apple anger fem designmål för SpeechTranscriber-modellen: långa ljudupptagningar, samtalstal, talare på avstånd, låg latens och integritet, vilket betyder att den körs på enheten. Anteckningar, Röstmemon, Dagbok och samtalssammanfattningar bygger på den.
Apples fem angivna designmål för SpeechTranscriber-modellen. Källa: Apple, WWDC25-session 277.
Modellerna ingår inte i någon app. De laddas ner från Apples servrar genom AssetInventory, lagras och uppdateras av systemet och delas mellan appar. De ökar varken appens nedladdningsstorlek eller minnesutrymme i dess egen process, och avkodningen sker utanför den anropande processen. Där SpeechTranscriber saknar modell för ett språk eller en enhet tar DictationTranscriber över med samma modeller som systemdikteringen.
Så mätte vi
Varje motor i det här inlägget transkriberade samma klipp i samma ordning, ett i taget, på en M5 MacBook Air (32 GB, macOS 27.0). Ljudet är testdelen i Google FLEURS vid revision 70bb2e84, ungefär 150 meningar och 30 minuter per språk. En fast hash av datamängdens egna objekt-ID:n bestämmer ordningen, och vi tar den kortaste följden av hela objekt som passerar trettio minuter; ingen modellutdata påverkade det valet. Varje cell byggdes om från sitt eget mätkvitto och kontrollerades igen, och alla 285 godkändes.
Poängen är ordfelfrekvens där ord skiljs åt med mellanslag och teckenfelfrekvens för japanska, koreanska, kinesiska och kantonesiska. FLEURS är uppläst tal, inte ett möte och inte diktering. Tabellerna säger om en motor är rimlig för ditt språk, inte vilket resultat du får på dina egna inspelningar.
Hur mycket bättre än gamla Apple Dictation?
Apple erbjuder två arbetspunkter för transkribering och vi mätte båda. SpeechTranscriber är den nya, den som det här inlägget kallar Apple Speech. DictationTranscriber är kompatibilitetsalternativet, den dikteringsväg som en Mac hade tidigare.
| Språk | Apple Dictation | Apple Speech |
|---|---|---|
| Koreanska | 7,11 | 4,31 |
| Italienska | 6,93 | 4,39 |
| Spanska (Latinamerika) | 8,43 | 5,41 |
| Tyska | 12,69 | 6,26 |
| Japanska | 9,37 | 6,36 |
| Franska | 17,10 | 7,61 |
| Kinesiska | 10,28 | 7,97 |
| Kantonesiska | 10,18 | 8,69 |
| Engelska | 13,83 | 8,80 |
| Portugisiska (Brasilien) | 10,85 | 9,35 |
Alla språk som mättes utan problem med båda Apple-arbetspunkterna, ordnade efter felfrekvensen för Apple Speech; grönt markerar radens bättre värde. Samma körning, samma klipp, samma Mac. CER för japanska, koreanska, kinesiska och kantonesiska, WER för övriga.
Apple Speech är mer träffsäker på alla tio. För medianspråket försvinner ungefär en tredjedel av felen, för franska och tyska mer än hälften, och för brasiliansk portugisiska och kantonesiska ungefär ett av sju fel.
Det är en jämförelse med Apples eget förflutna. Mot modellerna du laddar ner är dess bästa placering på ett språk med tillförlitliga mätvärden en andraplats, på kantonesiska. Dictation täcker fler språk: 33 konfigurationer mot 21 i den här körningen, inklusive alla tre som den nya motorn saknar här.
Vad ger den inbyggda motorn dig?
| Motor | Hastighet | Högsta minnesanvändning | Nedladdning |
|---|---|---|---|
| SenseVoice Small | 162,3× realtid | 0,95 GiB | 827 MB |
| Parakeet V3 | 75,6× realtid | 0,09 GiB | 465 MB |
| Apple Speech | 30,8× realtid | redovisas inte | språkpaketet laddas ner av macOS, inte av appen |
| Qwen3-ASR 1.7B | 11,1× realtid | 2,43 GiB | cirka 2,5 GB |
| Whisper Small | 7,9× realtid | 0,87 GiB | 600 MB |
| Whisper Large V3 Turbo | 3,0× realtid | 1,87 GiB | cirka 1,6 GB |
Hastigheten är varje motors median över de tretton språk som mättes utan problem i det här inlägget, med bara de språk motorn faktiskt körde — genomströmning vid isolerad bearbetning av enskilda objekt, ett diagnostikvärde och inte produktlatens. Högsta minnesanvändning är processgruppens topp i körningen. Apple Speech avkodar i en macOS-tjänst som den anropande appen inte äger, så ingen siffra där skulle betyda samma sak som för de andra fem.
Språkresurserna för Apple Speech laddas ner en gång av systemet och delas av alla appar. Själva appen innehåller ingen modell, och inget minne allokeras för den i appens egen process. Systemtjänsten använder fortfarande minne medan den arbetar, och det kan vi inte hänföra exakt. Därför redovisar vi ingen siffra där i stället för en nolla. Den körde i 30,8× realtid, efter Parakeet V3 och SenseVoice Small.
Whisper Large V3 Turbo vinner fyra av de tio raderna och är den långsammaste motorn här, ungefär tio gånger långsammare än Apple Speech, för cirka 1,6 GB på disken. Qwen3-ASR 1.7B vinner de andra sex, för cirka 2,5 GB och 2,43 GiB minne. Parakeet V3 kostar 465 MB och 0,09 GiB, slår Turbo på franska, ligger efter på polska och saknar japanska, koreanska, kinesiska och kantonesiska. Whisper Small är den närmaste jämförelsen på 600 MB, och Apple Speech var mer träffsäker på åtta av de tio språk som mättes utan problem med båda.
Ska du använda Apple Speech i stället för en nedladdad modell?
Språk för språk:
- Engelska: inget bra val. Apple Speech fick 8,80; Qwen3-ASR 1.7B (4,49) eller Whisper Large V3 Turbo (5,49) är klart mer träffsäker.
- Tyska: inget bra val. Apple Speech fick 6,26; Qwen3-ASR 1.7B (2,85) eller Whisper Large V3 Turbo (4,05) är klart mer träffsäker.
- Nederländska, ryska och polska: Apple Speech saknar modell för de här tre. Whisper Large V3 Turbo var mest träffsäker på alla tre, med 5,69, 5,13 och 5,45.
- Japanska: användbar. Apple Speech fick 6,36, efter Whisper Large V3 Turbo på 5,30.
- Koreanska: användbar. Apple Speech fick 4,31, efter Qwen3-ASR 1.7B på 3,54.
- Franska: inget bra val. Apple Speech fick 7,61; Qwen3-ASR 1.7B (4,57) eller Parakeet V3 (5,83) är klart mer träffsäker.
- Kinesiska: användbar. Apple Speech fick 7,97, jämnt med Whisper Large V3 Turbo; mest träffsäker var Qwen3-ASR 1.7B på 6,49.
- Spanska: inget bra val. Apple Speech fick 5,41; Qwen3-ASR 1.7B (3,38) eller Whisper Large V3 Turbo (3,62) är klart mer träffsäker.
Apple Speech är det här inläggets kortnamn för Apples SpeechTranscriber, det lokala API som alla Mac-appar kan anropa på macOS 26 eller senare. Det är inte en av modellerna som Whisper Notes för Mac laddar ner: i Mac-versionen för direkt nedladdning (DMG) är de Whisper, Parakeet V3, SenseVoice och Qwen3-ASR, och på iPhone och i Mac App Store-versionen Whisper, Parakeet V3 och SenseVoice. Tabellen per motor finns på vår sida om språkstöd.
Inget av detta ändrar vad Whisper Notes för Mac gör i dag: Parakeet V3 är fortfarande standard.
Vanliga frågor
Är Apple Speech lika träffsäker som Whisper?
Inte på de flesta språk som båda täcker. I vår egen FLEURS-körning var Whisper Large V3 Turbo mer träffsäker på sex av de sju av dessa tio språk som Apple Speech stöder; på kinesiska var de exakt lika med 7,97 % CER vardera. Mot Whisper Small vänds ordningen: Apple Speech låg före på sex av sju och förlorade bara engelska, 8,80 % mot 7,04 % WER. Den leder inte på något språk med tillförlitliga mätvärden i den här körningen och är närmast på koreanska, 4,31 % CER mot radledarens 3,54 %. Kantonesiska är det enda språket med tillförlitliga mätvärden där den slog Whisper Large V3 Turbo, 8,69 % mot 36,75 % CER. Använd den inbyggda motorn när den täcker ditt språk och du hellre låter macOS hantera språkpaketet; använd Whisper Large V3 Turbo för det mest träffsäkra resultatet eller när ditt språk är ett av de tre som Apple Speech saknar här.
Vilka språk stöder Apple Speech?
macOS bestämmer listan, inte en app. I den här körningen gav Apple Speech resultat för 21 av de 83 språkkonfigurationer vi testade, mot 83 för båda Whisper-versionerna, 30 för Qwen3-ASR 1.7B och 25 för Parakeet V3. Av de tio mest använda språken i huvudtabellen har den engelska, tyska, japanska, koreanska, franska, kinesiska och spanska, men inte nederländska, polska eller ryska. Den andra tabellen innehåller de övriga fjorton konfigurationerna: italienska, kantonesiska, brasiliansk portugisiska och elva språk där den svarade med latinsk translitterering i stället för det egna skriftsystemet. En app måste vid körning fråga macOS vilka språk en viss dator har. Om ditt språk saknas når Whisper alla språk i appens lista på alla kanaler.
Apple Speech eller Parakeet V3 — vilken ska du välja?
Parakeet V3, på alla europeiska språk som båda täcker. Den fick 6,89 mot 8,80 på engelska, 5,83 mot 7,61 på franska, 4,86 mot 5,41 på spanska, 3,43 mot 4,39 på italienska och 6,49 mot 9,35 på brasiliansk portugisiska; på tyska ligger de lika på 6,26. Parakeet V3 saknar japanska, koreanska, kinesiska och kantonesiska, så där är Apple Speech den enda av de två som finns och ligger högst 1,5 poäng från radledaren på japanska, koreanska och kinesiska. Parakeet V3 är en nedladdning på 465 MB och körde i 75,6× realtid med en topp på 0,09 GiB; språkpaketet för Apple Speech laddas ner av macOS, och den körde i 30,8× med minne som vi inte redovisar.
Vad är SpeechAnalyzer, och är det samma som Apple Dictation?
SpeechAnalyzer är det övergripande API som Apple presenterade på WWDC 2025 och gav ut i macOS 26 och iOS 26. SpeechTranscriber är arbetspunkten för transkribering inuti det; det är den vi mätte och som inlägget kallar Apple Speech. Dictation är kompatibilitetsalternativet, som vi också körde: Apple Speech var mer träffsäker på alla tio språk där båda gav tillförlitliga mätvärden. För medianspråket försvann ungefär en tredjedel av felen och för franska och tyska mer än hälften. Dictation täcker fler språk, 33 konfigurationer mot 21, och är därför systemmotorn för nederländska, polska eller ryska om du kan acceptera 17,34 %, 13,50 % och 13,13 % WER. Whisper Large V3 Turbo fick 5,69 %, 5,45 % och 5,13 % på samma klipp.
Lämnar ljudet min Mac när jag använder Apple Speech?
Apple beskriver SpeechTranscriber som taligenkänning på enheten: macOS laddar ner språkresurserna en gång, och igenkänningen körs lokalt. Vi mätte träffsäkerhet och hastighet, inte nätverksbeteende, så vi återger den delen så som Apple beskriver den. Motorerna som Whisper Notes själv laddar ner — Whisper, Parakeet V3, SenseVoice och Qwen3-ASR — körs på din egen Macs GPU eller Neural Engine, utan konto och utan API key. Transkriberingen fungerar med nätverket avstängt på alla kanaler.
Varför stämmer inte siffrorna med träffsäkerheten på mina inspelningar?
För att FLEURS är kort, rent, uppläst tal och dina inspelningar inte är det. Vår körning är en kalibrering på en offentlig datamängd: ungefär 150 meningar och 30 minuter ljud per språk, en M5 MacBook Air och samma klipp för varje motor. Den säger om en motor är rimlig för ett språk, inte vad du får i ett möte, på brusigt ljud, med en brytning eller i en två timmar lång fil.
Varför säger andra benchmarks att Apple Speech slår Whisper?
De jämför den med Whisper Small, och bara på engelska. För Whisper Small stämmer vår körning med det: av de tio språk där båda gav tillförlitliga mätvärden slog Apple Speech den på åtta. Engelska är ett av de två den förlorade, 8,80 mot 7,04. Mot Whisper Large V3 Turbo håller det inte: där låg Apple Speech efter på åtta av samma tio språk, jämnt på kinesiska med 7,97 och ledde bara på kantonesiska. Vilken Whisper som står i jämförelsen avgör rubriken.
Prova själv
De fem nedladdningsbara modellerna här — Whisper Small, Whisper Large V3 Turbo, Parakeet V3, SenseVoice Small och Qwen3-ASR 1.7B — finns alla i Whisper Notes för Mac som direkt nedladdning (DMG), under Inställningar och sedan Transkriptionsmodell.
Om våra siffror inte stämmer med din erfarenhet av ett språk, mejla mac@whispernotes.app. Fullständiga versionsanteckningar: whispernotes.app/changelog.
Källor: vår körning på testdelen i Google FLEURS vid revision 70bb2e84, Apples SpeechAnalyzer-dokumentation, samt Qwen3-ASR-körningen över trettio språk dessförinnan.