--- pipeline_tag: text-generation license: apache-2.0 base_model: Qwen/Qwen3-8B library_name: zeromodels language: - en tags: - keras - zeromodels - qwen3 - qwen3-dense - text-generation - pytorch - jax - tf --- # Run Qwen3 with Keras 3: JAX, PyTorch, or TensorFlow [![GitHub](https://img.shields.io/badge/GitHub-ZeroModels-181717?logo=github)](https://github.com/IMvision12/ZeroModels) [![Docs](https://img.shields.io/badge/Docs-Qwen3-1f6feb)](https://imvision12.github.io/ZeroModels/qwen3/) [![HuggingFace](https://img.shields.io/badge/HuggingFace-Qwen3-ffd21e?logo=huggingface&logoColor=black)](https://huggingface.co/collections/zeromodels/qwen3-6a8eae26d6249f084e68731c) # zeromodels/qwen3-8b Pure-**Keras 3** conversion of [`Qwen/Qwen3-8B`](https://huggingface.co/Qwen/Qwen3-8B) for [zeromodels](https://github.com/IMvision12/ZeroModels). One implementation runs unmodified on **TensorFlow / Torch / JAX**. This is a **dense** Qwen3; weights are stored in **bfloat16**. For model details, license, and usage terms, see the upstream [model card](https://huggingface.co/Qwen/Qwen3-8B). Paper: [Qwen3 Technical Report (arXiv:2505.09388)](https://arxiv.org/abs/2505.09388) · [HF Papers](https://huggingface.co/papers/2505.09388) Paper: [YaRN: Efficient Context Window Extension of Large Language Models (arXiv:2309.00071)](https://arxiv.org/abs/2309.00071) · [HF Papers](https://huggingface.co/papers/2309.00071) ## ✨ Quick start ```python import os os.environ["KERAS_BACKEND"] = "torch" # or "jax" / "tensorflow" from zeromodels.models.qwen3 import Qwen3TextGenerate, Qwen3Tokenizer model = Qwen3TextGenerate.from_weights("zeromodels/qwen3-8b") tokenizer = Qwen3Tokenizer.from_weights("zeromodels/qwen3-8b") inputs = tokenizer("Give me a short introduction to large language models.") outputs = model.generate(**inputs, max_new_tokens=128) print(tokenizer.decode(outputs[0])) ``` Load any Qwen3 variant the same way with `from_weights("zeromodels/")`: | Variant | Hub | | --- | --- | | `qwen3-0.6b` | [zeromodels/qwen3-0.6b](https://huggingface.co/zeromodels/qwen3-0.6b) | | `qwen3-0.6b-base` | [zeromodels/qwen3-0.6b-base](https://huggingface.co/zeromodels/qwen3-0.6b-base) | | `qwen3-1.7b` | [zeromodels/qwen3-1.7b](https://huggingface.co/zeromodels/qwen3-1.7b) | | `qwen3-1.7b-base` | [zeromodels/qwen3-1.7b-base](https://huggingface.co/zeromodels/qwen3-1.7b-base) | | `qwen3-4b` | [zeromodels/qwen3-4b](https://huggingface.co/zeromodels/qwen3-4b) | | `qwen3-4b-base` | [zeromodels/qwen3-4b-base](https://huggingface.co/zeromodels/qwen3-4b-base) | | `qwen3-8b` | [zeromodels/qwen3-8b](https://huggingface.co/zeromodels/qwen3-8b) | | `qwen3-8b-base` | [zeromodels/qwen3-8b-base](https://huggingface.co/zeromodels/qwen3-8b-base) | | `qwen3-14b` | [zeromodels/qwen3-14b](https://huggingface.co/zeromodels/qwen3-14b) | | `qwen3-14b-base` | [zeromodels/qwen3-14b-base](https://huggingface.co/zeromodels/qwen3-14b-base) | | `qwen3-32b` | [zeromodels/qwen3-32b](https://huggingface.co/zeromodels/qwen3-32b) | | `qwen3-30b-a3b` | [zeromodels/qwen3-30b-a3b](https://huggingface.co/zeromodels/qwen3-30b-a3b) | | `qwen3-30b-a3b-instruct-2507` | [zeromodels/qwen3-30b-a3b-instruct-2507](https://huggingface.co/zeromodels/qwen3-30b-a3b-instruct-2507) | ## Special Thanks A huge thank you to the Qwen team at Alibaba for creating and releasing these models. License: Apache 2.0.