🤗
HF-Mirror Engineering Guide
端侧轻量 🕒 阅读时间:约 11 分钟 📅 2026-03 深度精选

端侧轻量级小模型崛起:SmolLM2 与 LLaMA 3.2 嵌入式端侧部署 (llama.cpp / WebGPU)

1B~3B 参数端侧轻量小模型凭借极低硬件门槛与毫秒级首字延迟正在掀起终端革命。本文介绍 SmolLM2 与 LLaMA 3.2 1B/3B 的镜像拉取、GGUF 量化与 llama.cpp 极速嵌入式部署。

📱 一、端侧小模型崛起与高能数据精炼

Hugging Face 官方发布的 SmolLM2(包含 135M、360M、1.7B)与 Meta 的 LLaMA 3.2 1B/3B 证明了在海量精炼数据(如 FineMath、Cosmopedia v2)训练下,1B~3B 小模型完全具备优秀的指令遵循、文本摘要与简单逻辑推理能力,显存/内存占用仅需 1GB~2GB!

⚡ 二、镜像拉取与 llama.cpp 极致轻量部署

编译与端侧极速运行
# 镜像拉取 SmolLM2 1.7B 指令版本
export HF_ENDPOINT="https://hf-mirror.net"
huggingface-cli download HuggingFaceTB/SmolLM2-1.7B-Instruct \
  --local-dir /data/models/SmolLM2-1.7B-Instruct \
  --local-dir-use-symlinks False

# 使用 llama.cpp 编译并在 CPU 上以 150+ tokens/s 极速生成
./llama-cli -m /data/models/SmolLM2-1.7B-Instruct/smollm2-1.7b-q4_k_m.gguf \
  -p "Hello! Please summarize the advantages of edge AI." -n 128
← 专栏目录 查看全部 32 篇开源大模型工程实录 动手配置 → 5分钟零门槛配置与高速拉取教程