// SLIM-ARC
Synergistic LLM Integration with Memory-Aware Runtime Co-Optimization — 利用操作系统虚拟内存机制作为 MoE 稀疏性的天然接口
在三档受限环境下验证 SLIM-ARC 的优化效果,所有数据可溯源至原始日志
三类优化协同工作:内核协同释放内存 → 量化压缩降低需求 → 计算融合加速推理
通过 posix_madvise(MADV_RANDOM) 让内核 demand paging 与 MoE Router 2% 激活率天然匹配,仅加载被激活的专家权重。
IO-aware tiling 融合,将 attention 的 QKT 和 softmax(P)V 合并为单 kernel,decode 吞吐 +71.4%。
sink + sliding window 驱逐策略,KV 内存从 O(L) 降至 O(1),80B decode +9.6%。
首次用 GSM8K ALEM 协议发现 IQ4_XS 保持语言流畅但推理崩溃,为端侧模型选择提供指导。
逐步叠加优化技术,累计实现 64.5× 加速
B站项目介绍与 Demo 视频,展示 80B MoE 在端侧的流畅推理