OS挑战赛 Proj 59 · 中山大学

80B MoE 大模型
在 8GB 内存设备上流畅运行

// SLIM-ARC

Synergistic LLM Integration with Memory-Aware Runtime Co-Optimization — 利用操作系统虚拟内存机制作为 MoE 稀疏性的天然接口

slim-arc@edge-device: ~
# 80B MoE 模型(38GB)跑在 32GB RAM 上,mmap 按需加载
llama-server -m Qwen3-Next-80B-IQ4_XS.gguf \
    -fa auto -ctk q4_0 -ctv q4_0 --no-repack \
    -t 8 --host 0.0.0.0 --port 8080

[OK] model loaded (38 GB, mmap on-demand)
[OK] server listening on http://0.0.0.0:8080
[OK] active experts: 10/512 (sparse 98%)
[OK] decode: 5.16 tokens/s
64.5×
累计加速
5.16
tokens/s
+71%
FlashAttn
2GB
RSS
// 核心成果

数据说话

在三档受限环境下验证 SLIM-ARC 的优化效果,所有数据可溯源至原始日志

850%
8GB 环境解码加速
0.08 → 0.76 t/s
98%
物理内存节省
MADV_RANDOM
75%
GSM8K 精度保持
Qwen3-4B Q4_K_M
30+
引用论文
NeurIPS / ICLR
// 技术亮点

OS × MoE 协同优化

三类优化协同工作:内核协同释放内存 → 量化压缩降低需求 → 计算融合加速推理

🧠

MoE 稀疏性 × OS 虚拟内存

通过 posix_madvise(MADV_RANDOM) 让内核 demand paging 与 MoE Router 2% 激活率天然匹配,仅加载被激活的专家权重。

FlashAttention 集成

IO-aware tiling 融合,将 attention 的 QKT 和 softmax(P)V 合并为单 kernel,decode 吞吐 +71.4%。

💾

StreamingLLM KV Eviction

sink + sliding window 驱逐策略,KV 内存从 O(L) 降至 O(1),80B decode +9.6%。

📊

量化精度边界发现

首次用 GSM8K ALEM 协议发现 IQ4_XS 保持语言流畅但推理崩溃,为端侧模型选择提供指导。

// 优化链

0.08 → 5.16 t/s

逐步叠加优化技术,累计实现 64.5× 加速

Baseline
0.08 t/s
+MADV
0.42 t/s
+KV q4
0.76 t/s
+IQ4_XS
2.45 t/s
+FA
5.16 t/s
// 演示视频

看看它如何运行

B站项目介绍与 Demo 视频,展示 80B MoE 在端侧的流畅推理

在 B站观看 ↗

// 深入了解

探索更多