Huihui-Qwen3-Coder-Next-abliterated-fp8

FP8-quantized version of huihui-ai/Huihui-Qwen3-Coder-Next-abliterated.

vLLM

vllm serve gueraf/Huihui-Qwen3-Coder-Next-abliterated-fp8     --quantization fp8     --dtype float16     --host 127.0.0.1     --port 8000     --trust-remote-code     --gpu-memory-utilization 0.90     --max-model-len 32768     --max-num-seqs 512
Downloads last month
286
Safetensors
Model size
80B params
Tensor type
F32
BF16
F8_E4M3
Inference Providers NEW
This model isn't deployed by any Inference Provider. 馃檵 Ask for provider support