伯克利与 MIT 公开的 FreeToken 引擎,声称能在 8GB 显存笔记本上以约 39 token/s 跑 35B MoE 模型。我们拆解它的三个机制、适用边界与成本账。
2026 年 8 月 17 日,伯克利与 MIT 团队把论文《FreeToken: Efficient Edge-Native MoE Serving with Bandwidth-Adaptive Execution》挂上 arXiv(编号 2608.16157),系统从 flashml.ai 下载。论文给出的卖点很直接:35B 参数的专家混合模型可以跑在 8GB 显存笔记本上,宣传解码约 39 token/s。
先给结论:这类引擎解决的是"显存放不下时别整段卡死",不是"消费卡跑出 A100 的吞吐"。它把本地推理从"玩具演示"推到"能当生产力工具试用"的档位,但企业要不要换方案,取决于你的上下文长度、工具调用密度和并发要求。

MoE 模型的推理有个特点:每个 token 只激活少量专家,理论计算量不大,但全部专家权重必须随时可读。显存装不下时,常规做法是把"冷"专家卸到主机内存。
问题出在传输通道:数据中心里 GPU 之间走 NVLink,带宽接近 900GB/s;消费级机器只有 PCIe,4.0 x16 约 32GB/s,还要和主机内存延迟打交道。静态卸载方案下,某个 token 需要的专家恰好不在显存,就得停下当前计算,跨 PCIe 拉权重,解码速度断崖下跌。
论文把个人电脑当作"异构资源弹性推理平台"而非"一块小 GPU"来处理,整个卸载策略不写死,而是持续把计算和模型状态映射到当下可用资源上。这是它与传统卸载方案最根本的分歧。
围绕"带宽自适应"这个目标,项目公开了三个设计,正好对应本地推理的三个痛点。
三个机制的共同点:把"卸载"从一次性配置改成每个 token 都在做的在线决策。代价是调度本身有开销,所以它对短 prompt、小模型未必划算——这是它的边界之一。
本地跑模型最常见的真实负载不是聊天,而是 agent:改提示词、插入工具输出、再改再插。传统引擎只要输入前缀一变,整段注意力状态重算,等于把前面几百个 token 的活白干一遍。
FreeToken 提出语义锚点检查点:当 agent 频繁改动提示词或插入工具结果时,引擎识别未变化的子序列,复用其状态,只重算真正变化的部分。论文明确点名"coding and tool-using agents"是目标负载,并为此保留了运行时内存管理接口。
对要落地私有 coding agent 的团队,这一条比峰值 token/s 更重要:它决定的是"每轮工具调用之间要不要干等",也就是体感是否可用。
39 token/s 大致落在:代码补全流畅、单文件代码审查可用、日常问答无压力;不够做:超长文档生成、需要全局上下文的大规模重构。
论文与项目宣传中与 llama.cpp、Ollama 的静态卸载对比,声称解码快 3-4 倍。这个数字成立的前提是"模型放不进显存 + 专家反复换入换出";一旦模型整体塞进显存,传统引擎本来就不慢,差距会被抹平。选型时别把宣传数字当绝对性能,要按自己的平均上下文长度复测。
硬件跨度方面,项目称支持 20 余款 MoE 模型,覆盖从 8GB 笔记本 GPU 到单张工作站 GPU:35B 级在笔记本上可用,284B 级能上游戏台式机,753B 的 GLM-5.2 在单张工作站 GPU 上可跑。这条阶梯给企业留了清晰的升级路径。
我们早期在客户现场验证过"GGUF 量化 + 静态专家卸载"的组合:短 prompt 一切正常,一旦进入长上下文、模型每 token 都要换专家,输出变成"说几句、停几秒、再说几句",段落之间明显的停顿感直接劝退试用者。量化省下的显存,被卸载抖动吃了回去。
FreeToken 的思路解决的是这类抖动,但本地部署不等于免费。部署后真正磨人的往往不是推理速度,而是环境与输出一致性——我们另一篇工程复盘记录了 大模型本地部署输出不一致的 6 个工程解法,那篇更贴近"上线第一天会遇到什么"。
给企业评估用一张表收口:
| 评估维度 | 倾向本地部署 | 倾向调用 API |
|---|---|---|
| 数据合规 | 代码与日志不能出内网 | 可接受云端处理 |
| 用量曲线 | token 量大且稳定 | 用量小或波动大 |
| 峰值突发 | 并发低、可排队 | 需要秒级弹性扩容 |
| 维护成本 | 有专职团队调优硬件 | 不想养推理运维人力 |
本地省的是随用量增长的 API 费,花的是硬件折旧与调优人力;API 省的是运维,花的是单 token 单价与数据出网风险。两条路都有真实账单,别只看单价。
想拿你的真实模型与机型做一轮本地推理压测,可以把硬件清单发到联系页;我们过去交付的端侧与私有化项目,在案例页有完整时间线与结果。
论文与系统已公开,下载入口与版本说明在 flashml.ai。代码随论文发布,作者名单含 Matei Zaharia、Ion Stoica、Song Han、Kurt Keutzer 等系统与高效 AI 方向研究者。
能,前提是专家混合模型:每个 token 只激活少量专家,未激活的专家可以放主机内存。引擎用双缓冲把搬运藏在计算背后,用带宽换显存容量,代价是总吞吐不如全显存方案。
模型能整体进显存时没必要换;显存放不下且上下文长、工具调用频繁时,FreeToken 的调度与状态复用优势才明显。3-4 倍是宣传前提下的数字,生产选型要拿自己的负载复测。