深信号· DEEPSIGNAL
深信号· DEEPSIGNALRSS
SIGNAL DEEP-DIVE

一张 4060 跑 35B:FreeToken 想拆掉的,是本地大模型的最后一道墙

2026-09-08·InfoQ·模型推理推理优化开源消费级硬件本地部署
▮ SIGNAL SUMMARY · 摘要快读

伯克利与 MIT 联合开源的 FreeToken,号称 RTX 4060 上能以每秒约 39 token 跑 35B 模型。这则情报看起来只是又一个"低显存推理"项目,但它踩中的位置——消费级显卡与开源大模型的交汇点——值得单独拆开看。

一张 4060 跑 35B:FreeToken 想拆掉的,是本地大模型的最后一道墙

过去两年,开源大模型一直在"变强"和"变大"之间拉扯:模型参数从 7B 涨到 70B、100B+,而普通人的显卡显存几乎没动过——RTX 4060 的 8GB 在 2023 年是甜点位,在 2026 年已经是门槛线。跑得起的模型追不上最强的模型,是本地部署社区最熟悉的那种憋屈。

FreeToken 想改的正是这道墙:一个由伯克利与 MIT 联合开源的项目,官方口径是能在 RTX 4060 上运行 35B 级模型,速度约每秒 39 个 token。目标明确——把大模型推理的硬件门槛压下来,让"消费级显卡跑大模型"从噱头变成日常。

综述

先把事实摆清楚:FreeToken 是开源项目,主攻低显存、高吞吐的推理,宣传的落点是"RTX 4060 跑 35B、每秒约 39 token"。信息里的三个关键词——8GB 显存、35B 参数、39 tok/s——构成了它全部的宣传卖点。

注意它的措辞边界:39 tok/s 不是"飞快",是"能跑"。这个速度做聊天和文档处理够用,做代码补全和长文生成会明显感觉"等一下"。所以 FreeToken 的定位不是替代云端大模型,而是把"本地有没有"这个二元问题,从"没有"变成"凑合能用"。

这类项目能立住,通常靠三件事:显存不够时把权重放到内存/磁盘分层调度量化压缩权重以及更聪明的计算调度。FreeToken 的具体工程路线尚未完全公开,这决定了它需要被长期观察——低显存推理此前已有不少先例,真正罕见的不是想法,而是把想法做到"真能日常用"的完成度。

专业分析

FreeToken 出现的位置,恰好在三条技术线的交汇处。

第一条线:量化与内存分层已把"显存墙"推后了一代。 llama.cpp 生态把 GGUF 量化变成事实标准,4-bit 下 35B 模型权重约 18-20GB,依旧超过 8GB 显存,但远超显存、逼近内存总量时,新的瓶颈转移到内存带宽与 CPU-GPU 搬运开销——这正是"能不能跑"与"跑多快"的分水岭。

第二条线:MoE(混合专家)把"总参数"和"单次激活参数"解耦。 35B 如果是总参数、实际激活只有 A3B 级别的稀疏模型,单 token 真正需要的权重远小于 35B,这让消费级推理在架构上第一次"够得着"。近期多个模型走 MoE 路线,本身就在为这一天铺路。

第三条线:每秒 39 token 这个数字,恰好卡在"可用性"的临界带。 行业经验里,对话流畅大致需要 20-30+ tok/s 起步;39 tok/s 意味着它越过了"能用"线,但没到"无感"。换句话说,FreeToken 如果复现成立,卖的不是体验,而是"你的数据不出你的机器"这种主权

它的隐含成本也要算进去:低显存方案往往伴随更高内存占用、更长首 token 延迟或更复杂的部署配置。"跑得动"和"跑得顺"之间,隔着一整层工程化——这也是为什么这类项目开源价值高、但直接劝退非技术用户。

关联信息与影响

单看 FreeToken 是孤例,放进这一周的情报里它就成了信号:同期有 Iris 搜索智能体、AWS 开源 Kiro Crew 让 Agent 并行化、世界模型预训练项目 OpenWAM 开源。合起来看,开源社区这一轮不再只卷"榜单分数",而是在卷系统层——其中"让模型更便宜地跑起来"是底座中的底座。

更直接的相关变量有几个:

影响上是双向的:对云端推理厂商,它动的是"长尾便宜需求";对本地生态,它可能把一批原本跑 7B-13B 的用户,直接推向 30B+ 档位。

未来展望

对 FreeToken 的判断,应该分三层看。

短期(复现期):看它是否经得起第三方复现。低显存推理项目最常见的问题是"跑分存活、日常翻车",所以未来一两个月最有价值的信息不是新闻稿,而是社区实测——内存占用曲线、长上下文表现、并发下的退化程度。

中期(生态期):如果复现成立,最可能看到的是它被整合进 llama.cpp 系工具链与各类一键部署包,同时带动一波"4060 档位"的模型评测。到这一步,它就不再是一个项目,而是一个生态部件。

长期(架构期):真正决定它命运的,是未来开源模型对"消费级硬件"的态度——是继续往大参数狂奔、让低显存方案永远追着跑,还是出现更多"为 8GB 而生"的架构设计。FreeToken 能做的,是让后一种选择变得可行,从而反哺模型设计。

信号强度

大模型厂商:开源阵营会重新评估"模型规格与目标硬件"的匹配策略——既然 35B 能下探到 8GB,参数量就不再是本地版唯一的叙事工具;闭源厂商的"轻量版"定价可能因此承压。

研究者:获得一个低门槛的推理研究平台,验证新架构不必先租 A100;量化、调度、内存分层方向的论文会更容易被复现。

开发者:本地 Agent、私有 RAG、代码助手可以升级模型档位,而不必改硬件预算;但要为更复杂的部署与调优买单——配置文档会决定社区能走多远。

内容创作者:视频、音频、长文处理类 AI 工具的本地运行门槛下降,意味着素材不出机器、隐私风险更低;39 tok/s 对短文本工具够用,对实时场景仍需等一等。

关联产业链:内存厂商与整机厂商是隐性受益方(低显存方案往往把压力转给内存带宽与容量);二手显卡市场可能因"4060 还能战"叙事而更保值;而云厂商的低端推理实例,将最先感受到压力。

把这条情报放回它自己的问题里:本地大模型真正缺的从来不是"又一个能跑的框架",而是让"能跑"变得无需折腾。FreeToken 若能做到后者,它就配得上这一周的关注。

SIGNAL FILE · 情报档案

llm/FreeToken(AI 情报库 2026-09-06 收录)

本文基于 AI 情报库收录的条目展开深析;事实性信息以原始报道为准,分析与展望为编辑观点。

原始报道:https://www.infoq.cn/article/tij5T0vJ1Yk0s7Uov7SE(InfoQ)

RELATED SIGNALS · 关联信号