摘要:开源项目 TurboFieldfare 通过把混合专家模型的大部分权重存放在 SSD 中,仅在需要时加载对应专家,让 Gemma 4 26B-A4B 在约 2GB 内存占用下运行。这展示了端侧模型部署的一条新路线。
在本地运行大模型,通常先看内存和显存。
模型权重有多大,设备就需要准备相近规模的存储空间。一个十几 GB 的量化模型,很难在 8GB 内存的普通电脑上运行。
开源项目 TurboFieldfare 换了一种方法。
它在 Apple Silicon 设备上运行 Gemma 4 26B-A4B 时,只把共享核心和 KV 缓存放进内存,将大部分专家权重保存在 SSD 中。每生成一个 Token,系统根据路由结果读取当前需要的专家。
项目作者称,这种方式能够把内存占用控制在约 2GB,并在配备 8GB 内存的 Mac 上运行模型。
混合专家模型提供了条件
Gemma 4 26B-A4B 是一款混合专家模型。
它拥有约 260 亿总参数,每次生成 Token 时只使用其中一部分专家。大量权重在当前计算步骤中处于闲置状态。
传统推理框架仍会把完整模型加载到内存或显存中,以便随时调用。
TurboFieldfare 则把模型分成两部分。
约 1.35GB 的共享核心常驻内存,包含注意力层和所有 Token 都会使用的参数。专家权重留在 SSD,路由器决定调用哪些专家后,系统再按需读取。
这种设计类似大型仓库。
常用工具放在工作台,低频使用的设备存放在仓库。任务需要时再取出,用完后释放内存。
SSD速度成为推理瓶颈
减少内存占用需要付出速度代价。
GPU 显存带宽远高于 SSD。每生成一个 Token 都从硬盘读取专家权重,会增加等待时间。
TurboFieldfare 使用 Swift 和 Metal 开发,并通过预取和并行读取减少停顿。社区测试显示,部分 M 系列设备能够达到每秒数个 Token,较新的高端芯片速度更高。
这样的速度可以支持个人问答、文档分析和低频本地任务,还难以替代云端高吞吐推理服务。
长时间运行也会产生大量 SSD 读取。设备温度、功耗和硬盘寿命需要进一步测试。
端侧AI不再只靠压缩模型
过去端侧模型部署主要依赖量化和裁剪。
量化把参数从 16 位压缩到 8 位、4 位甚至更低精度。裁剪则直接删除一部分网络结构。
TurboFieldfare 展示了另一种思路:模型可以保持较大总容量,只调整权重存放位置和加载时间。
这种方式特别适合混合专家模型。
每次计算只需要少数专家,系统无需为大量闲置参数长期占用内存。
未来还可能出现分层存储架构:常用专家放在内存,低频专家放在 SSD,罕见专家通过局域网从另一台设备读取。
工业边缘设备可以借鉴这条路线
工业现场部署 AI 时,经常受到硬件条件限制。
边缘计算机需要长期运行,设备升级周期较长,也不一定能够安装高功率 GPU。
如果行业模型采用混合专家架构,可以根据工厂、设备和岗位提前缓存常用专家。
例如,设备维修场景主要调用机械、电气和故障诊断专家;工艺优化场景主要使用材料、参数和仿真专家。其他模块可以保存在本地存储中,需要时再加载。
这会降低内存要求,也方便在不同岗位之间复用同一套大模型权重。
当前项目仍有明显局限
TurboFieldfare 目前针对 Gemma 4 26B-A4B 和 Apple Silicon 进行了专门优化。
它还不是能够运行所有模型的通用框架。
模型结构变化、专家数量变化或路由方式变化,都可能需要重新开发内核。实际运行速度也高度依赖 SSD 和芯片型号。
因此,“26B 模型只需要 2GB 内存”不能简单理解为任何 260 亿参数模型都能在低配电脑上流畅运行。
这项项目更像一次工程验证。
它说明模型权重无需始终全部驻留内存,推理系统可以根据计算需要重新安排存储层级。
当端侧 AI 进入手机、汽车、机器人和工业设备后,这类内存、硬盘与计算协同设计会越来越重要。