Qwen3-TTS 1.7B (Base)

Qwen3-TTS 1.7B (Base) ist in der Stufe Q4_K_M eine Datei von 1,0 GB. Wie viel Speicher es beim Laufen zusätzlich braucht, nennt keine Quelle, die wir gelesen haben. Deshalb rechnen wir es für kein Gerät aus.

Wie schnell es arbeitet, rechnen wir nicht. Bei Audio zählt, wie viele Minuten Aufnahme in einer Minute fertig werden, und dafür haben wir noch keine eigene Messung.

Art
Vorlesen (Text zu Sprache)
Anbieter
Qwen
Parameter
1.700 Mio.
Auf Hugging Face seit
21. Januar 2026
Lizenz
Apache 2.0
Deutsch
laut Anbieter ja (Beleg unten)
Sprachen
10 Sprachen
Stimmen
eigene Stimme aus einer Aufnahme (3 Sekunden)
Laufzeit
llama.cpp (llama-tts)
Ollama
führt dieses Modell nicht

So starten Sie es

Mit llama.cpp, gebaut laut Anleitung. Beim ersten Aufruf lädt -hf das Modell und den Projektor von Hugging Face; --tts-lang de legt die Sprache fest. Für eine eigene Stimme hängen Sie eine kurze Aufnahme als WAV an.

Text vorlesen lassen

$ llama-tts -hf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF -p 'Guten Tag, das ist ein Test.' --tts-lang de --output ausgabe.wav

Mit eigener Stimme vorlesen lassen

$ llama-tts -hf ggml-org/Qwen3-TTS-12Hz-1.7B-Base-GGUF -p 'Guten Tag, das ist ein Test.' --tts-lang de --tts-speaker-file stimme.wav --output ausgabe.wav

Lizenz

Laut Anbieter steht das Modell unter Apache 2.0. Die Quelle sagt dazu wörtlich:

license: apache-2.0
https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base, gelesen am 11. Oktober 2026

Das ist keine Rechtsberatung. Maßgeblich ist der Lizenztext selbst.

Deutsch

Der Anbieter nennt Deutsch ausdrücklich. Wie gut es Deutsch versteht oder spricht, haben wir nicht geprüft.

Qwen3-TTS covers 10 major languages (Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, and Italian)
https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base

Sprachen

Laut Quelle spricht es 10 Sprachen:

Chinesisch, Deutsch, Englisch, Französisch, Italienisch, Japanisch, Koreanisch, Portugiesisch, Russisch, Spanisch

Wie gut es eine einzelne Sprache kann, haben wir nicht geprüft.

Belegt mit:

Qwen3-TTS covers 10 major languages (Chinese, English, Japanese, Korean, German, French, Russian, Portuguese, Spanish, and Italian)
https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base

Eigene Stimme

Feste Stimmen bringt das Modell nicht mit. Es spricht mit der Stimme aus einer kurzen Aufnahme, die Sie mitgeben; laut Anbieter genügen 3 Sekunden. Ohne Aufnahme wählt es selbst eine Stimme.

Nehmen Sie nur Ihre eigene Stimme oder die einer Person, die zugestimmt hat. Wie natürlich die Stimme klingt, haben wir nicht beurteilt.

Belegt mit:

Base model capable of 3-second rapid voice clone from user audio input
https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base

Stufen

Größe der Datei je Stufe und, wo belegt, der Speicher beim Laufen.

StufeDateiSpeicher beim Laufen
Q4_K_M1,0 GBnicht gerechnet
Q8_01,8 GBnicht gerechnet
BF163,5 GBnicht gerechnet

Zu jeder Stufe gehört eine zweite Datei: Projektor (mmproj) Q8_0, 0,4 GB.

Quelle: https://huggingface.co/Qwen/Qwen3-TTS-12Hz-1.7B-Base

Weitere Ratgeber