Mistral hat mit Voxtral seine erste Modellfamilie für Transkription und Audioverständnis mit offenen Gewichten veröffentlicht. Die offiziellen Benchmarks zeigen eine starke mehrsprachige Spracherkennung und Audio-Q&A. Die beiden Modellgrößen stellen jedoch sehr unterschiedliche Anforderungen an die Hardware. Hier erfährst du, was die Veröffentlichung tatsächlich unterstützt und warum Whisper Notes auf Apple-Geräten weiterhin kleinere, auf Transkription spezialisierte Modelle einsetzt.
Zwei Modelle
Mistral veröffentlichte im Juli 2025 zwei Checkpoints unter der Apache-2.0-Lizenz:
Voxtral Small 24B
- •24 Milliarden Parameter
- •Transkription, Übersetzung, Audio-Q&A und Zusammenfassungen
- •Kontextfenster mit 32.000 Token
- •Etwa 55 GB GPU-Speicher in bf16/fp16
Voxtral Mini 3B
- •3 Milliarden Parameter
- •Dieselbe Familie von Audio- und Textaufgaben in einem kleineren Checkpoint
- •Von Mistral für lokale und Edge-Bereitstellung vorgesehen
- •Etwa 9,5 GB GPU-Speicher in bf16/fp16
Offene Gewichte und Lizenz
Beide Checkpoints aus dem Jahr 2025 sind unter Apache 2.0 verfügbar. Du kannst die Gewichte herunterladen und selbst betreiben:
- ✓Vollständige Modellgewichte stehen zum Download bereit
- ✓Selbsthosting und Anpassungen sind im Rahmen der Apache-2.0-Lizenz möglich
- ✓Beim Selbsthosting fällt keine Mistral-API-Gebühr an; die eigene Rechenleistung kostet weiterhin Geld
- ✓Audio kann auf der eigenen Infrastruktur verarbeitet werden
Quellen: Mistrals Voxtral-Veröffentlichung, die offizielle Modellkarte von Voxtral Small und die offizielle Modellkarte von Voxtral Mini.
Benchmarks richtig einordnen
Mistral vergleicht die makrogemittelte Wortfehlerrate auf englischen Kurz- und Langform-Datensätzen sowie auf Mozilla Common Voice, FLEURS und Multilingual LibriSpeech. In den von Mistral veröffentlichten FLEURS-Ergebnissen liegt Voxtral Small bei jeder ausgewerteten Aufgabe vor Whisper. Eine niedrigere WER ist besser.
FLEURS-WER aus Mistrals Einführungsbenchmarks im Verhältnis zum geschätzten API-Preis; Ergebnisse und Preise können sich ändern
FLEURS bildet nur einen Teil der Transkriptionsqualität ab. Die Werte stammen vom Anbieter. Prüfe daher die veröffentlichten Benchmarkdefinitionen und teste deine eigenen Sprachen, Mikrofone und Aufnahmebedingungen.
Voxtral oder Whisper: Was passt besser?
Benchmarks erzählen nur einen Teil der Geschichte. Für den praktischen Einsatz zählen auch Sprachabdeckung und Hardwarebedarf:
| Voxtral Small | Voxtral Mini | Whisper Large V3 | Whisper Large V3 Turbo | |
|---|---|---|---|---|
| Sprachen | 8 primäre Sprachen | 8 primäre Sprachen | 100+ | 100+ |
| Offene Gewichte | Ja | Ja | Ja | Ja |
| Modellgröße | 24B; ca. 55 GB GPU-Speicher in bf16/fp16 | 3B; ca. 9,5 GB GPU-Speicher in bf16/fp16 | 1,55 Milliarden Parameter | 809 Millionen Parameter; ca. 1,6 GB |
| Praktisch auf einem normalen Mac | In voller Präzision meist nicht | Mit kompatibler Laufzeit möglich, aber schwerer als Turbo | Ja | Ja |
Voxtral Small verbindet starke gemeldete WER-Ergebnisse mit Audioverständnis, das Whisper nicht anbietet. Voxtral Mini ist für lokale und Edge-Nutzung gedacht, benötigt laut Modellkarte in bf16/fp16 aber rund 9,5 GB GPU-Speicher. Für eine Transkriptions-App auf Consumer-Hardware lässt sich Whisper Large V3 Turbo leichter ausliefern und deckt deutlich mehr Sprachen ab. Deshalb kombiniert Whisper Notes derzeit Whisper Turbo mit Parakeet V3 und SenseVoice.
API-Kosten und Selbsthosting
Am 10. Juli 2026 listete Mistrals Modellkarte für Voxtral Small 0,004 US-Dollar pro Audiominute. Bei Audioverständnis werden Texteingabe und erzeugter Text zusätzlich abgerechnet. Beim Selbsthosting der Apache-2.0-Gewichte entfällt die Mistral-API-Gebühr, Hardware und Betrieb zahlst du selbst.
Mistral API
Selbst gehostete Gewichte
So funktioniert Voxtral
Die offiziellen Modellkarten beschreiben Voxtral als Sprachmodell mit Audio-Encoder und einem eigenen Transkriptionsmodus. Für die Praxis sind vor allem die konkreten Grenzen wichtig:
1. Audio und Text in einem Modell
Voxtral verarbeitet Audio und Text innerhalb derselben Unterhaltung und ist damit mehr als ein reiner Sprache-zu-Text-Decoder:
- •Eigener Modus für direkte Transkription
- •Fragen zum Audio und strukturierte Zusammenfassungen
- •Mehrere Audiodateien und mehrstufige Audio-Unterhaltungen
Grenze für lange Aufnahmen
Das 32k-Kontextfenster unterstützt bis zu 30 Minuten Audio für Transkription oder 40 Minuten für umfassenderes Audioverständnis.
2. Sprachen und Auswertung
Mistral nennt acht primäre Sprachen mit automatischer Erkennung:
- •Englisch, Spanisch, Französisch, Portugiesisch, Hindi, Deutsch, Niederländisch und Italienisch
- •Die Benchmarks umfassen FLEURS, Mozilla Common Voice und Multilingual LibriSpeech
- •Kurze und lange englische Aufnahmen werden getrennt ausgewertet
3. Anforderungen für die Bereitstellung
Offene Gewichte bedeuten nicht, dass jeder Checkpoint auf jedem Gerät klein genug ist:
- •Voxtral Small benötigt laut Modellkarte etwa 55 GB GPU-Speicher in bf16/fp16
- •Voxtral Mini ist der 3B-Checkpoint für lokale und Edge-Bereitstellung
- •Mistral empfiehlt vLLM zum Bereitstellen der veröffentlichten Checkpoints
4. Wichtige Funktionen
Audioverständnis
Beantwortet Fragen und erstellt Zusammenfassungen direkt aus Audio innerhalb des 32k-Kontextfensters.
Mehrsprachigkeit
Erkennt und transkribiert acht primäre Sprachen automatisch.
Umgang mit Störgeräuschen
Die offizielle Auswertung nutzt unterschiedliche Sprachdatensätze, verspricht aber keine gleichbleibende Qualität für jede verrauschte Aufnahme.
Lokale Bereitstellung
Voxtral Mini ist die lokale Option; die offizielle Modellkarte nennt rund 9,5 GB GPU-Speicher in bf16/fp16.
5. Architektur auf hoher Ebene
- 1. Audio-Encoder: Wandelt die Wellenform in gelernte Audiorepräsentationen um
- 2. Projektor: Überträgt die Audiorepräsentationen in den verborgenen Raum des Sprachmodells
- 3. Sprachmodell: Erzeugt Transkripte, Antworten, Zusammenfassungen oder Werkzeugaufrufe
So kann Voxtral mehr als nur transkribieren. Gleichzeitig sind die Sprachmodellgewichte deutlich größer als bei einem auf Transkription spezialisierten Modell wie Whisper Turbo.
Warum Whisper Notes trotzdem sinnvoll bleibt
Voxtral und Whisper Notes lösen unterschiedliche Probleme. Voxtral verbindet Transkription mit Audioverständnis; Whisper Notes konzentriert sich auf private Transkription auf gewöhnlicher Apple-Hardware.
Was Whisper Notes bietet
Datenschutz
- •Vollständig lokale Verarbeitung
- •Kein Hochladen der Aufnahmen
- •Keine Cloud-Abhängigkeit für die Transkription
Leistung
- •Drei lokale Sprachmodelle zur Auswahl
- •Für Apple Silicon optimiert
- •Zeitstempel und direkte Bearbeitung
Kosten
- •Einmalkauf; Preis laut Kaufkanal; auf dem Mac 10.000 Wörter kostenlos testen
- •Keine Minutengebühren
- •Keine laufende Abo-Gebühr
Bedienung
- •Einfache Oberfläche
- •Modelle werden in der App eingerichtet
- •Regelmäßige Aktualisierungen
Speicherbedarf
Voxtral Small ist in voller Präzision ein Servermodell: Die offizielle Modellkarte nennt rund 55 GB GPU-Speicher. Voxtral Mini ist für lokale Nutzung gedacht, benötigt in bf16/fp16 aber immer noch etwa 9,5 GB GPU-Speicher. Der Download von Whisper Turbo in Whisper Notes ist mit rund 1,6 GB besser für das aktuelle Produkt geeignet.
Whisper Notes nutzt Whisper Large V3 Turbo, Parakeet V3 und SenseVoice. Diese Auswahl balanciert Sprachabdeckung, Geschwindigkeit und Speicherbedarf für den Alltag.
Voxtral ist interessant, wenn Audio-Q&A, Zusammenfassungen oder ein selbst gehosteter Server wichtig sind. Whisper Notes richtet sich an Einzelpersonen, die private Transkription ohne laufendes Abonnement möchten.
Was daraus folgt
Voxtral ist ein wichtiger Schritt über reine Spracherkennung hinaus, weil die Modelle Audio nicht nur transkribieren, sondern auch inhaltlich auswerten können.
Für private Offline-Transkription auf Mac und iPhone lassen sich kleinere Spezialmodelle weiterhin einfacher und verlässlicher ausliefern.
Einen direkten Vergleich der lokalen Optionen — Whisper, Parakeet V3, SenseVoice und Voxtral — findest du auf unserer Seite zu Whisper-Modellen.
Häufig gestellte Fragen
Was ist Mistral Voxtral?
Voxtral ist Mistrals Modellfamilie mit offenen Gewichten für Transkription und Audioverständnis. Die Veröffentlichung vom Juli 2025 umfasst Voxtral Small 24B für serverseitige Aufgaben und Voxtral Mini 3B für lokale und Edge-Bereitstellung. Beide Checkpoints stehen unter Apache 2.0.
Kann Voxtral lokal auf einem Mac laufen?
Die Gewichte lassen sich selbst betreiben, die Anforderungen unterscheiden sich aber stark. Voxtral Small benötigt in bf16/fp16 rund 55 GB GPU-Speicher. Für Voxtral Mini nennt die Modellkarte etwa 9,5 GB. Die tatsächliche Geschwindigkeit und Speichernutzung auf einem Mac hängen von Laufzeit und Quantisierung ab.
Verwendet Whisper Notes Voxtral?
Nein. Whisper Notes nutzt derzeit Parakeet V3, Whisper Large V3 Turbo und SenseVoice. Diese Modelle bieten für Apple-Hardware ein günstigeres Verhältnis aus Geschwindigkeit, Speicherbedarf und Sprachabdeckung.
Wie viele Sprachen unterstützt Voxtral?
Die offiziellen Modellkarten nennen acht primäre Sprachen mit automatischer Erkennung: Englisch, Spanisch, Französisch, Portugiesisch, Hindi, Deutsch, Niederländisch und Italienisch. Mistral wertet in FLEURS zusätzlich Arabisch aus, führt es dort aber nicht als primäre Modellsprache.
Wann wurde Voxtral veröffentlicht?
Mistral veröffentlichte Voxtral am 15. Juli 2025. Die ersten Checkpoints unter Apache 2.0 waren Voxtral Small 24B und Voxtral Mini 3B.