本地跑大模型,以前通常意味着两条路:要么内存够大(32GB 起步),要么花大价钱买显卡。最近一个叫 TurboFieldfare 的开源项目把这件事的硬件门槛拉低了不少——它让 260 亿参数的 Gemma 4 26B 模型,在约 2GB 内存预算下运行,8GB 内存的 Mac 也能跑。

TurboFieldfare 本地运行 Gemma 4 26B 大模型

TurboFieldfare 在 Mac 上运行 Gemma 4 26B 的界面示意

一、它是怎么做到的

TurboFieldfare 是一个用 Swift + Metal 编写的运行时,针对 Gemma 4 26B-A4B 指令微调模型做了专门优化。它不会把整个约 14.3GB 的模型一次性加载进内存,而是常驻约 1.35GB 的共享权重和 FP16 KV 缓存,再按 token 从 SSD 流式加载所需的专家层——这就是"专家流式加载"思路,也是它能在 8GB 内存 Mac 上运行的原因。项目地址:github.com/drumih/turbo-fieldfare

二、运行要求

  • Apple Silicon Mac(M1–M5 系列);
  • macOS 26 及以上(需要 Metal 4);
  • Xcode 26 与 Swift 6.2;
  • 首次下载模型约需 14.3GB 磁盘空间,运行时依赖 SSD 读取速度。

三、上手步骤

  1. 克隆仓库:git clone https://github.com/drumih/turbo-fieldfare.git 并进入目录;
  2. 编译:swift build -c release(首次会下载并编译依赖,需要等待几分钟);
  3. 启动应用:.build/release/TurboFieldfareMac
  4. 在应用内选择 Download 下载并整理模型(约 14.3GB);
  5. 下载完成后点击 Load Model,输入提示词即可对话。

四、性能参考

项目 README 中给出的实测数据:8GB 内存的 M2 MacBook Air 约为 5.1–6.3 token/秒,可流畅对话;24GB 内存的 M5 Pro 约为 31–35 token/秒。这些是作者单机实测的参考值,实际速度受提示词长度、生成长度、SSD 状态与具体硬件影响,请以自己机器上的结果为准。

五、进阶用法与安全边界

  • 本地 OpenAI 兼容 API:项目附带 TurboFieldfareServer,提供 Chat Completions 兼容接口,可接入自己的应用做开发调试;
  • Function calling:本地服务接受函数工具声明并返回模型生成的工具调用,但执行需要客户端授权,模型本身不会擅自执行;
  • 安全提醒:本地服务默认绑定 127.0.0.1 且无鉴权,只应在本机使用,切勿通过代理或隧道暴露到公网;
  • 数据本地:模型权重和对话都在本机,不依赖云端 API;
  • 许可边界:项目本体采用 Apache-2.0 许可;所运行的 Gemma 4 模型权重受 Google 的 Gemma 使用条款约束,商用、衍生与再分发前请阅读对应条款。

六、现实提醒

  • 模型下载需要约 14.3GB 空间,且依赖 SSD 流式加载,机械硬盘或空间不足的机器体验会明显下降;
  • "约 2GB 内存"指权重与缓存占用,系统本身仍需正常内存,8GB 机器属于刚好够用的状态;
  • 当前仅支持 Apple Silicon + macOS 26 环境;其他平台可考虑 Ollama、LM Studio 等通用方案;
  • 本地 26B 模型的能力与旗舰云端模型仍有差距,复杂任务请按需评估。