编辑 | 泽南
「这个结果太疯狂了。」
本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。
Codex 生产 trace 的中位 decode 速度是 33 token/s,笔记本 RTX 4060 跑 Qwen3.6-35B 的 39.3 token/s 已经超过了这个数。
来自 UC Berkeley、MIT 等机构的联合团队开源了名为 FreeToken 的全新开源边缘端推理系统。并列一作杨硕(Shuo Yang)是伯克利 EECS 博士生,范晓泽(Xiaoze Fan)在 UT Austin,两人本科均毕业于上海交通大学。FreeToken 的作者还包括 Ion Stoica、Matei Zaharia、Kurt Keutzer、韩松等顶尖学者。
该系统专门针对 MoE(混合专家)大模型在消费级硬件上的本地部署进行了全栈协同设计,打破了大规模前沿模型必须依赖数据中心集群的硬件门槛。
FreeToken 现在已经提供了 Windows / Linux 桌面 App(带 GUI),CLI 一行 uv pip install "freetoken [accel]" 即可载入。
消费级硬件能跑什么?
传统的 CPU-GPU 权重卸载(Offloading)方案往往因为 PCIe 带宽瓶颈导致推理速度极慢(每秒几 token 甚至卡顿),而 FreeToken 实现了「交互级实用速度」的本地推理。
除了每秒 Token 速度,在处理长 Prompt(如 4-16k 上下文)时,传统 Offloading 方案因逐层从系统内存拉取 Expert 导致严重 I/O 阻塞。FreeToken 将首 Token 延迟(TTFT)降低了 42-58%。
针对如今常见的 Agent 工具,如 Claude Code、OpenClaw 等循环交互、逐步追加上下文的场景,在多次工具调用与思维链(CoT)迭代中,由于 FreeToken 引入的 Token 边界轻量级检查点与状态复用,后续多轮交互的 TTFT 减少了 65-80%。
论文在不同 PCIe 规格(PCIe 3.0 x8、PCIe 4.0 x16、PCIe 5.0 x16)及不同 CPU(如 Intel i7、AMD Ryzen 9、Threadripper)下进行了测试,当系统后台有其他高 I/O 任务抢占总线时,算法可以自动提升 CPU 端分流计算比例;当总线空闲时则提升 GPU 载入比例。
也就是说,无论处于何种总线带宽受限环境,系统均能稳定收敛至该硬件拓扑下的理论最大吞吐上限。
论文作者还做了压力测试,模拟用户在后台开启 3D 渲染、游戏导致可用显存骤降 4-8GB 的场景。传统方案会直接触发 CUDA Out of Memory (OOM) 崩溃退出,FreeToken 可以在 0 停机开销下无缝收缩 GPU 驻留的 LRU Cache 大小,将更多未命中 Expert 转交 CPU 计算,保证推理服务平滑降级而不中断。
可以说,现在跑大模型不需要死磕模型 100% 上显存了。
对于 MoE 这类稀疏激活架构,只要通过软硬件协同的「动态带宽感知 + 双缓冲数据流 + 状态复用」,完全可以利用 PC 上较为常见的 DDR5 大内存 + PCIe 高带宽通道 + 消费级单卡,以极高性价比获得可以日常个人使用的体验。
当然这意味着显存不够,内存来凑。比如 DeepSeek V4 Flash 的专家池约 140GB,就需要 32GB 显存(RTX 5090)加上最好有 192GB 的内存来跑才比较稳。
为什么 FreeToken 能做到?
如今,大模型开放权重解决的是谁能拿到模型,没解决「谁能跑得起模型」。 Kimi-K3、GLM-5.2、DeepSeek-V4-Flash 的能力已经逼近闭源第一梯队,但跑它们仍然默认要数据中心。结果就是能力的差距在快速收窄,可及性的差距还是很大。
如果以游戏平台 Steam 观之,大家的电脑约 72% 有 N 卡,其中最常见的单卡是笔记本版的 RTX 4060,如果大模型能把它们用起来情况就会大不一样。那么就需要一个能把 GPU、CPU、主机内存、互连当成一个统一平台来调度的服务系统。
MoE 恰好给了我们这个机会,以目前最火的 DeepSeek-V4-Flash 为例,它有 284B 总参数、43 层、每层 256 个路由专家选 6 个,单 token 只激活 13B。在部署精度下,活跃参数量塞得进 RTX 5090 的 32GB。
但稀疏只减少了计算,没有等比例减少内存,完整专家池仍然远超显存。当前的瓶颈在于,Prefill 会摧毁 MoE 的稀疏性:单个 token 只走 k 个专家,但一个长 prompt 里所有 token 路由的并集,几乎覆盖每层的全部专家。于是每次 prefill 都要把接近完整的专家池流过 PCIe 一遍。
在 DeepSeek-V4-Flash 的部署上,FP4 部署要搬约 140GB 专家权重,RTX 5090 需要额外的两秒钟,按需取专家的引擎,会把这整段暴露成 GPU 空转。
雪上加霜的是 Agent 每轮工具调用都会改上下文。而 Qwen3.6-35B 用 gated DeltaNet、Kimi-K3 用 KDA 这类循环层,会把整段前缀压成一个演化状态,不能局部复用,只能靠 checkpoint。一个 checkpoint 占的内存相当于几百 token 的 KV,所以引擎只能存少量。上下文一改,改动点之后的 checkpoint 全部失效,只能回退到上一个有效点,重算几千 token。而 RTX 5090 的 dense BF16 吞吐只有 H100 的约 1/5、B200 的约 1/10,扛不住这种重复劳动。
FreeToken 的解法是重新定义了端侧异构硬件的协同调度逻辑:
其中面向 Agent 的机制非常有趣,这么做可以说是真的是瞄准如今热门的 Agent 任务在优化了。
结语
FreeToken 证明了让大模型走向普及的关键,不仅在于开源模型权重,更在于端侧调度软件系统的工程设计与算法重构。
通过将个人电脑的 CPU、系统内存、PCIe 总线与 GPU 作为一个统一的弹性计算平台,开发者和个人用户今后完全可以在本地笔记本或游戏 PC 上跑起顶尖 MoE Agent,极大降低了本地部署高智能模型的成本。
好了,现在就差个传说中的 Qwen3.8-A3B 了。