Meta Superintelligence Labs 在 2026 年 8 月 10 日发布 Muse Glimmer,并以 Apache 2.0 许可证开放模型权重。官方用语是 open weights,指的是权重可下载、可修改、可商用,而不是整个项目连训练数据和训练代码一起公开。
真正会改变一部分人日常的是一个数字:4-bit 量化把语言模型权重压到 20GB 以下,官方还提供了一个 K-Quant-17GB 版本,并称 24GB 或 32GB 的内存空间足够同时放下权重、KV cache、视觉编码器和推测解码用的 drafter。这意味着一台带 24GB 显存的消费级显卡,或一台内存足够的 Mac,理论上可以在完全离线的状态下跑一个 300 亿参数级别的 Agent 模型。
Muse Glimmer 的模型卡写明它是约 296 亿参数的稠密因果 Transformer,外挂约 18 亿参数的视觉编码器,输入吃文本和图片、输出只有文本,上下文标注为 131,072+,知识截止 2026 年 1 月 4 日,训练覆盖 100 多种语言,能力来自对 Muse Spark 的蒸馏。Meta 给它划定的场景很具体:本地 Agent、函数调用、本地编码、LLM-as-a-judge。
配套的加速手段是一个基于 DFlash 的轻量 drafter,一次先猜 16 个 token,再交由主模型并行验证对错。在 Meta 自己的 batch size 1、greedy decoding 测试里,K-Quant-17GB 加上量化 DFlash 让 RTX 5090 的生成速度从 74.9 tok/s 升到 233.4 tok/s,M4 Max 从 23.7 升到 37.8 tok/s,M5 Max 从 26.6 升到 50.2 tok/s。三倍提速只出现在 5090 这一条配置上,两台 Mac 的收益是 1.5 到 1.8 倍——这本身就说明推测解码的效果高度依赖硬件带宽和算力配比,不是一个能直接搬到自己机器上的承诺。
官方基准里就藏着它的短板
把 Meta 公布的同尺寸对比逐项看完,结论会比发布日的社区情绪冷静得多。SWE-Bench Pro 上 Muse Glimmer 拿到 51.2,高于 Gemma4-31B 的 36.9 和 Qwen3.6-27B 的 50.2;但 SWE-Bench Verified 的 76.0 略低于 Qwen3.6-27B 的 77.2,TerminalBench 2.1 的 51.7 明显落后于 Qwen 的 60.7,OSWorld-Verified 的 65.9 也不及 Qwen 的 75.6。这些都是 Meta 在特定 harness 与推理模式下的测试结果,彼此之间的差距还需要第三方复现,但至少可以确定一件事:这不是一份全面领先的成绩单,尤其在终端操作和图形界面操作这类真实 Agent 场景里。
这种混合结果和它的定位是自洽的。Meta 明确表示 Muse Glimmer 的能力低于闭源的 Muse Spark,不属于其 AAISF 框架对「Frontier AI」的定义,相关网络与失控风险被评为 Moderate 或更低。这套评估出自 Meta 自身,也正好解释了为什么它能被开放出来:真正的能力上限留在了云端产品里,被放到 Hugging Face 上的是那个蒸馏出来、够用且风险可控的版本。上周 Meta 刚发布的 Muse Code 与 Muse Spark 1.2 走的是另一条路:闭源、在线、常驻后台跑长任务。两者放在一起,Meta 的分工比任何一句战略表态都清楚。
模型卡也没有把限制藏起来:不支持音频输入和输出,多步推理在新场景中仍可能出错,训练数据涉及的语言并未全部完成评测。另有一条容易被误读的披露——训练数据包括公开数据、第三方提供的数据、来自 Meta 产品与服务的信息,以及由外部供应商网络和 Meta 人员整理增强的数据。模型运行时确实不需要联网或云端,但这只关乎推理隐私,和训练语料的来源是两件事。
本地跑得起来,和跑得顺是两回事
发布后的公开讨论几乎全部围着内存打转。r/unsloth 一条约 753 赞的帖子问的就是 30B 模型能不能在约 18GB、单张消费级 GPU 上跑起来,回复里同时有人质疑发帖者过早断言它是同尺寸最强 Agent 模型并要求给出来源。r/LocalLLaMA 上关于 GGUF 量化包的讨论约 439 赞,关注点是量化版本、Mac 与消费显卡兼容性和真实任务表现,其中有用户报告 CSV 提取效果不错——这是个人测试,不构成普遍结论。
更值得留意的是另一条部署帖:有用户报告在当前 vLLM 镜像里,基础模型能跑,但官方给出的 DFlash 推测解码配置报错,需要打多处补丁。这是单个环境下的个案,不能推及所有 vLLM 部署;不过它指向一个反复出现的规律——权重上线是一瞬间的事,推理框架、量化包和文档对齐往往要再等几天到几周。那三倍提速的数字,恰恰依赖最晚就位的那一环。
对想用它替掉一部分 API 调用的开发者来说,需要核的不是跑分表,而是三件事:自己那块卡在装完 KV cache、视觉编码器和 drafter 之后还剩多少空间,K-Quant-17GB 相对全精度那 1.0% 的平均准确率损失(Meta 以 15 个基准的平均值衡量,K-Quant-Dynamic 的损失为 0.2%)在自己的任务上会放大成什么,以及所用推理栈什么时候才能稳定跑通 DFlash。全精度部署的目标仍是 64GB VRAM,这个门槛没有因为量化版本的存在而消失。
接下来一两周值得看的是第三方在 TerminalBench 2.1 和 OSWorld-Verified 上的独立复现,以及主流推理框架把 DFlash 路径合进正式版本的时间。在那之前,Meta 公布的加速倍数和落后项都只算厂商测试。

TopsTip