MLLM + 硬件:端侧部署、NPU、专用芯片¶
更新日期:2026-04-17
一、MLLM 部署硬件全景¶
flowchart LR
cloud["云端推理<br/>H100/H200<br/>500-2000W"]
edge["边缘<br/>Jetson Orin<br/>15-60W"]
pc["AI PC<br/>Intel/AMD<br/>15-40W"]
mobile["手机 NPU<br/>骁龙 8 Elite<br/>5-15W"]
apple["Apple<br/>统一内存<br/>20-40W"]
cloud --> edge --> pc
pc --> apple
pc --> mobile
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class cloud,edge,pc,mobile,apple stage
按可承载模型规模递减:云(千亿)→ 边缘(百亿)→ PC(数十亿)→ 手机(数 B 量化)。每档跨越的关键限制是内存带宽(不是算力)。
二、端侧部署需求¶
| 设备 | CPU | NPU (TOPS) | 内存 | 适合模型 | 能跑什么规模的模型 |
|---|---|---|---|---|---|
| iPhone 16 Pro | A18 Pro (6 核, 2 性能 + 4 能效) | 38 TOPS — 足够加速 3-4B 模型的矩阵乘法,但对 7B+ 模型力不从心 | 8GB (与系统共享,实际可用约 5-6GB) | 3-4B 多模态 | INT4 量化下可流畅运行 MiniCPM-V 3B、Phi-3-mini 等;7B 模型因内存不足基本无法加载完整权重,除非极端量化 (2-bit) |
| 骁龙 8 Gen 3 手机 | Kryo CPU (1+3+4 核) | 45 TOPS — Hexagon NPU 支持 INT4/INT8 混合精度,推理效率高于纯 GPU 方案 | 12-16GB (LPDDR5X,带宽约 77GB/s,带宽是端侧推理的核心瓶颈) | 7B 模型 | 16GB 版本可运行 Qwen2.5-7B INT4 (~4GB),留有系统余量;MiniCPM-V 8B INT4 (~5GB) 可运行但较紧张;13B 模型勉强可加载但推理极慢 |
| 骁龙 8 Elite 手机 | Oryon CPU (自研架构,大幅提升单核性能) | 75+ TOPS — NPU 算力几乎翻倍,支持更大模型的实时推理,INT4 吞吐约为上一代 1.7x | 12-24GB (LPDDR5X 9600MHz,带宽提升至约 90GB/s) | 7B+ 多模态 | 24GB 版本可流畅运行 13B INT4 模型 (~7GB);7B 多模态模型 (视觉编码器 + LLM) 可达 15+ tok/s;理论上可尝试 Qwen2.5-32B 的极端量化版本但体验不佳 |
| MacBook M4 | M4 系列 (高性能核 + 能效核) | 38 TOPS (ANE) — 但 Mac 的真正优势不在 NPU 而在统一内存架构:CPU/GPU/NPU 共享同一内存池,无需数据拷贝 | 16-128GB (统一内存,带宽 100-546GB/s,M4 Max 达 546GB/s) | 32B+ 模型 (取决于内存) | 16GB 版可跑 7-13B INT4;32GB 版可跑 32B INT4 (~18GB);64GB 版可跑 70B INT4 (~40GB) 约 10-15 tok/s;128GB M4 Max 甚至可加载 Llama-3 405B 的量化版,是消费级设备中独一无二的大模型平台 |
| AI PC (Copilot+) | Intel Core Ultra / AMD Ryzen AI (均集成 NPU) | 40-50 TOPS — 满足微软 Copilot+ PC 的最低要求 (40 TOPS),但生态和驱动成熟度不如手机 NPU | 16-64GB (DDR5,CPU/GPU/NPU 内存分离,不如 Mac 统一内存高效) | 7-32B | 16GB 可稳定运行 7B INT4;32GB 可运行 13-32B INT4;但 Windows 上 NPU 利用率目前不如 GPU 直接推理 (CUDA/DirectML),实际多数用户仍用独显跑模型 |
| Jetson Orin | ARM Cortex-A78AE (12 核) | 275 TOPS (稀疏) / 138 TOPS (密集) — 专为边缘 AI 设计,支持完整 CUDA 生态 | 64GB (共享 LPDDR5,带宽 204.8GB/s) | 大模型可运行 | 边缘设备中的 "小型服务器":可运行 70B INT4 模型 (~40GB),支持多模态 VLA 推理;功耗仅 15-60W,适合机器人/自动驾驶场景;是 NVIDIA 机器人 (Isaac) 和自动驾驶 (DRIVE) 平台的核心硬件 |
三、MiniCPM-V: 手机端 MLLM 的里程碑¶
MiniCPM-V 8B 是首个在手机上实现 GPT-4V 级别多模态能力的模型。参考 MiniCPM-V (Yao et al., 2024)。
3.1 关键技术¶
| 技术 | 作用 |
|---|---|
| AnyRes 动态分辨率 | 输入图任意尺寸,按 14×14 patch 切块,最高 1.8M px |
| InternViT-300M 视觉编码器 | 比 SigLIP-400M 小但精度持平,部署友好 |
| Token 压缩 (Resampler) | 1296 视觉 token → 64,减 20× 计算 |
| INT4 量化训练(QAT) | 推理时仅 ~5GB 显存(vs 16GB FP16) |
| 多图理解 + 视频理解 | 同一模型支持单图 / 多图 / 视频 |
3.2 性能¶
| Benchmark | MiniCPM-V 2.6 | GPT-4V |
|---|---|---|
| OCRBench | 852 | 656 |
| MathVista | 60.6% | 49.9% |
| MMMU | 49.8% | 56.8% |
| Real-World QA | 65.0% | 61.4% |
| 推理速度(骁龙 8 Gen 3) | ~7 tok/s | — |
| 推理速度(M4 Max) | ~30 tok/s | — |
→ 在 OCR / 数学等结构化视觉任务上反超 GPT-4V,参数仅 8B vs 千亿,是端侧 MLLM 的代表作。
四、移动端 NPU 编程¶
4.1 主流 NPU 编程接口¶
| 平台 | 接口 | 框架 | 备注 |
|---|---|---|---|
| iOS / Mac | Core ML / MLX | Swift / Python | Apple 统一栈 |
| Android | NNAPI(已废弃)/ AICore | Java / Kotlin | Google 在切 AICore |
| Qualcomm | QNN / Hexagon SDK | C++ / Python | 通过 AI Hub 部署 |
| MTK | Neuron SDK | C++ | 联发科自研 |
| Huawei | HiAI | C++ | 仅鸿蒙生态 |
| Intel | OpenVINO | Python / C++ | 通用 PC NPU |
| AMD | ROCm + RyzenAI | Python | 进展较慢 |
跨平台抽象层(推荐):
- MLC-LLM:TVM 编译 → 任意硬件
- llama.cpp + GGUF:CPU + GPU 量化推理
- ONNX Runtime + DirectML(Windows)
4.2 通用端侧部署路径¶
flowchart LR
train["训练好的<br/>模型"]
quant["量化<br/>INT4/INT8"]
convert["格式转换<br/>GGUF/CoreML/<br/>ONNX/MLX"]
compile["编译<br/>TVM/MLC"]
deploy["端侧部署<br/>iOS/Android/PC"]
train --> quant --> convert --> compile --> deploy
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class train,quant,convert,compile,deploy stage
实操建议:
- iOS/Mac:Apple MLX(最快上手)→ 进阶 Core ML
- Android:MLC-LLM(GGUF backend)或 Qualcomm AI Hub
- Windows AI PC:MLC-LLM 或 ONNX Runtime DirectML
- 跨平台 demo:MLC-LLM 一份编译跑全平台(含 Web)
4.3 MLC-LLM (最通用方案)¶
# MLC-LLM 用 TVM 编译模型到各种硬件
# 支持: iOS/Android/Mac/Windows/Linux/Web (WebGPU)
# 示例:
# 1. 编译 Qwen2.5-3B 到 iOS
mlc_llm compile \
--model Qwen/Qwen2.5-3B-Instruct \
--quantization q4f16_1 \
--target iphone-a18 \
--output qwen2_5_3b_ios.tar
# 2. 在 iOS App 中加载运行
# Swift 代码:
let model = MLCModel(path: "qwen2_5_3b_ios.tar")
let response = model.chat(prompt: "你好")
五、Apple Silicon 生态¶
Mac 的 M 系列芯片统一内存架构特别适合大模型推理。M4 Max 可以有 128GB 统一内存。
5.1 Apple MLX 框架¶
# MLX: Apple 官方的机器学习框架, 专为 Apple Silicon 优化
import mlx.core as mx
import mlx.nn as nn
# 加载模型
from mlx_lm import load, generate
model, tokenizer = load("mlx-community/Qwen2.5-32B-Instruct-4bit")
# 推理
response = generate(
model, tokenizer,
prompt="Explain MoE architecture",
max_tokens=500
)
# 优势:
# - 统一内存: CPU/GPU 共享, 零拷贝
# - 量化支持好
# - 针对 Metal 优化
# 速度: M4 Max 跑 32B INT4 可达 30+ tok/s
六、专用 AI 芯片¶
6.1 推理优化芯片¶
| 芯片 | 公司 | 路线 | 适合规模 | 速度(70B) |
|---|---|---|---|---|
| LPU | Groq | SRAM-only 确定性 | 7B-70B | 500 tok/s/user |
| WSE-3 | Cerebras | 单晶圆超大芯片 | 任意(晶圆即内存) | 450 tok/s(70B) |
| TPU v5p | systolic array | 任意 | ~150 tok/s | |
| Trainium2 | AWS | systolic + MoE 优化 | 70B-1T MoE | — |
| Etched Sohu | Etched | Transformer-only ASIC | 70B+ | 500K tok/s 总吞吐(声明) |
| Maia 100 | Microsoft | 推理通用 | 7B-70B | — |
各家共同点:砍掉训练特性 + cache 简化 换吞吐与延迟。Groq 是当前消费者最快推理。
6.2 Groq 的推理优势¶
Groq LPU (Language Processing Unit):
- 确定性执行 (无缓存不确定性)
- 超低延迟: <1ms per token
- 吞吐: LLaMA-70B 达 500+ tok/s per user (消费者最快!)
- 缺点: 只做推理, 成本高, 不支持训练
七、华为昇腾生态¶
中国最大的 AI 芯片, DeepSeek 等模型可在昇腾上运行。
7.1 MindSpore + 昇腾¶
# 华为的 MindSpore 框架
import mindspore as ms
from mindformers import AutoModel
model = AutoModel.from_pretrained("deepseek-v3", device="ascend")
# 类似 PyTorch API, 但底层是 CANN
八、世界模型与机器人硬件¶
8.1 机器人 AI 硬件趋势¶
flowchart LR
cloud["云训练<br/>H100/H200"]
edge["边缘推理<br/>Jetson Thor"]
onb["On-device<br/>RTX 5070 Mobile"]
actuator["执行器<br/>实时控制"]
cloud --> edge --> onb --> actuator
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
class cloud,edge,onb,actuator stage
| 平台 | 用途 | 算力 | 功耗 |
|---|---|---|---|
| Jetson Thor (NVIDIA, 2025) | 机器人主控 | 2000 TOPS | 100W |
| Jetson Orin Nano | 小型移动机器人 | 40 TOPS | 7-15W |
| 高通 Robotics RB7 | 工业 / 物流 | 15 TOPS | 5-12W |
| Tesla FSD HW4 | 自动驾驶 | 144 TOPS | 250W |
| Mobileye EyeQ Ultra | 自动驾驶 | 176 TOPS | 待核实 |
| Wayve / 华为昇腾车规 | 自动驾驶 | 200-400 TOPS | 100-300W |
趋势:从"通用 GPU + 改驱动"过渡到"机器人专用 SoC(Thor / Orin)",核心需求是实时 VLA 推理(视觉 → 语言 → 动作)。
8.2 VLA (Vision-Language-Action) 模型¶
Google RT-2, Figure AI 等使用的模式:VLM 输出动作指令。
代表工作:
- RT-2 (Google 2023):PaLM-E + 动作 head,把动作 token 化进 LM vocab
- OpenVLA (Stanford 2024):开源 7B VLA,在 7-DoF 机械臂上 work
- Pi-0 (Physical Intelligence 2024):3B 模型 + flow matching action head
- Figure 01/02(Figure AI):人形机器人,VLA + 强化学习联合
VLA 部署对硬件的特殊要求:
- 视觉编码 + LM + 动作解码必须在 <100ms 端到端
- 需要 INT4 量化 VLM 才能塞进 Jetson Thor 推理
- 动作连续性比 token throughput 重要(10-30 Hz 控制频率)
九、硬件选型决策¶
flowchart TB
start["要部署 LLM/MLLM"]
q1{"哪个用户群"}
q2{"模型大小"}
start --> q1
q1 -->|"消费者手机"| mobile["MLC-LLM + GGUF<br/>骁龙 8 Elite / iPhone 16+"]
q1 -->|"AI PC / 桌面"| pc["MLC-LLM / Apple MLX /<br/>llama.cpp"]
q1 -->|"边缘 / 机器人"| edge["Jetson Orin/Thor<br/>+ TensorRT-LLM"]
q1 -->|"低延迟生产 API"| q2
q2 -->|"≤70B"| groq["Groq LPU<br/>500 tok/s/user"]
q2 -->|">70B / MoE"| h["H100/H200 + vLLM<br/>或 Trainium2"]
classDef stage fill:#fff,stroke:#cc785c,color:#1a1a1a;
classDef decision fill:#f5f3eb,stroke:#bdb9ab,color:#1a1a1a;
class start,mobile,pc,edge,groq,h stage
class q1,q2 decision
简化口诀:
- 想要"跑得动" → MLC-LLM(跨平台一份代码)
- 想要"跑得快" → Apple MLX(Mac)/ Groq(云)
- 想要"塞进设备" → INT4 + GGUF + llama.cpp
- 想要"机器人实时" → Jetson Thor + TensorRT-LLM
参考文献¶
-
[1] Yao et al. MiniCPM-V. 2024. 论文
-
[2] MLC-LLM
-
[3] Apple MLX
-
[4] Qualcomm AI Hub
-
[5] Groq
-
[6] Cerebras
-
[7] NVIDIA Jetson
-
[8] Efficient GPT-4V level MLLM for Edge Deployment. 2025. Nature
↑ 上级 · F. 多模态 VLM