Qwen3-ASR (0.6B / 1.7B) + Qwen3-ForcedAligner
Native Transformers (-hf repos) support added 2026-06-26. Hosted ASR is now Qwen-Audio-3.x-ASR (see qwen-audio-3-1-asr).
- Input
- audio
- Output
- text
- License
- apache-2.0
- Verified
- 2026-09-29
How to call it
| Provider | Model id | Endpoint / URL | Docs |
|---|---|---|---|
| Hugging Face | Qwen/Qwen3-ASR-1.7B | huggingface.co/Qwen/Qwen3-ASR-1.7B | — |
| Hugging Face | Qwen/Qwen3-ASR-0.6B | huggingface.co/Qwen/Qwen3-ASR-0.6B | — |
| Hugging Face | Qwen/Qwen3-ForcedAligner-0.6B | huggingface.co/Qwen/Qwen3-ForcedAligner-0.6B | — |
| GitHub | — | github.com/QwenLM/Qwen3-ASR | — |
Notable capabilities (2)
- 52 languages/dialects incl. singing and music: Language ID + ASR for 30 languages and 22 Chinese dialects, robust on songs/music; built on Qwen3-Omni audio understanding; vLLM batch and streaming inference, timestamp prediction via ForcedAligner. source
- Beats Whisper-large-v3 on Chinese: Self-reported WER e.g. AISHELL-2 2.71 vs 5.06 (Whisper-large-v3); Cantonese CV-yue 7.57 vs 11.36 (GPT-4o-Transcribe). source
Apache-2.0 speech recognition models for self-hosting.
Sources: https://github.com/QwenLM/Qwen3-ASR
Timeline entry
- Alibaba open-sources Qwen3-TTS (voice design, 3-second cloning, 97 ms streaming) and, a week later, Qwen3-ASR ★★★
On 2026-01-22 Alibaba's Qwen team released Qwen3-TTS under Apache-2.0 (0.6B and 1.7B checkpoints plus a 12 Hz tokenizer). It offers voice design from text descriptions, voice cloning from about 3 s of audio in 10 languages, and ~97 ms streaming latency. On 2026-01-29 Qwen3-ASR followed (0.6B/1.7B…
Other Alibaba (Qwen) models
Qwen-Audio-3.1-ASR (Flash) · Qwen-Audio-3.1-Realtime (Plus) · Qwen-Audio-3.1-TTS-Next · Qwen3.8-LiveTranslate (Flash Realtime) · Qwen3.8-Omni-Flash · Qwen3.8-27B · Qwen3.8-Flash · Qwen3.8-Max · Qwen-Image-3.0 (Pro) · Qwen3.7-Plus · Qwen3-TTS (open weights 0.6B / 1.7B; API qwen3-tts-flash)