有钛度的 AI 观察 — 每周更新 EST. 2026 · GETAITI.COM
深度 · 原创 · 周更 WEEKLY · 有钛度

归档 / NO.006 · 本地 AI · 开源模型 · 实测

Qwen3.8-27B 实测:128GB 的 MacBook,才刚喂饱它

不聊参数,聊体验。一个开源 27B 模型在 MacBook 里住了一个多月:喂过 20 万 token、干了两天真活之后的一些真实感受。

作者 Jeffrey Hu 2026.09.17 约 4,800 字 阅读 8 分钟
本文章节 · CONTENTS 10
  1. 01 先用大白话说说它是个什么模型
  2. 02 分数是真的,但别太迷信
  3. 03 Reddit 上这一个多月,大家都在聊什么
  4. 04 我这台机器上的真实数字
  5. 05 我把 20 万 token 塞了进去
  6. 06 让它干了两天真活
  7. 07 128GB 到底买到了什么
  8. 08 27B dense 还值得跑吗
  9. 09 写在最后
  10. 10 参考资料

Qwen3.8-27B:27B dense,发布时 AA 指数 52,原生 262K 上下文,M4 Max 128GB 实测 45 tok/s

8 月 14 日晚上,阿里把 Qwen3.8-27B 挂上了 Hugging Face。三天后,我的时间线上全是同一张截图:发布时的榜单上,它拿了 52 分,和 GPT-5.6 Luna 持平,离当时最强的几个模型只差 1 分。

而它是一个 27B 的开源模型,协议随便商用,一台大内存的电脑就能装下。

我发布第四天就开始折腾了,之后一个多月,它一直住在我这台 128GB 的 MacBook Pro M4 Max 上。这篇文章不讲参数,就说说一个开源「准旗舰」长期放在个人电脑里,到底是什么感觉。

先用大白话说说它是个什么模型

现在流行的模型大多是 MoE 架构:参数总量很大,但每生成一个字只激活其中一小部分,相当于「省电模式」。Qwen3.8-27B 不是,它是 dense(稠密)模型——每生成一个字,整个模型都要在内存里完整过一遍。所以它费内存、也吃带宽,这是后面所有体验的根源。

它还能看图、看长视频,不只是文字模型。训练时还自带了一个「加速外挂」(MTP:一次猜好几个字,猜对了一起收下),后来社区的各种提速方案,全是建立在这个设计上。

它的长上下文(原生 26 万 token)也是靠取巧:64 层里只有 16 层需要保存完整的注意力记忆,其余 48 层用一种几乎不占内存的替代结构。所以开满长上下文,缓存也只占 16GB——27B 敢标 262K,底气在这。

最后两条实用信息:协议是 Apache 2.0,商用没问题;官方只放了「原味」大权重,大家平时跑的压缩版全是社区做的——所以同样叫 Qwen3.8-27B,换一个版本、换一个软件,体验可能差很远。

分数是真的,但别太迷信

「编程能力超越 Qwen3.7-Plus」这个说法我核对过官方表格,基本属实:编程和 Agent 这类任务上(比如真实终端任务测试 Terminal-Bench 73.0 对 64.0),这个装进电脑的 27B,确实压过了阿里自家上一代云端付费版。

但要分清楚:它赢的是编程和 Agent,不是什么都赢。通用知识类测试它还是输给上一代云端版。而且那些分数是官方自己跑的,用了自家工具链和自建评测,听听就好。

还有个小插曲:我写文章时再去查那个 52 分,发现榜单方法这一个月里已经更新,今天的排名已经不是发布那天那个 52 了。榜单这东西,描述的是「发布那一周」,不是永恒真理。

Reddit 上这一个多月,大家都在聊什么

这个模型在 r/LocalLLaMA 刷屏了一个多月。最热闹的是一个「你跑出了多少速度」的帖子,385 条评论,变成了一份民间速度对照表:RTX 3090 跑 30–45 tok/s,Mac 这边从 M4 Pro 24GB 的 11 到 M1 Max 的 16 不等。我这台 M4 Max 的 45 tok/s,在 Mac 里算快的,但社区有人用更硬核的玩法在同款机器上跑到 70 多——省事路线不是极限路线。

好评集中在编程和 Agent:有人说它是「第一个真正愿意长期留在本地干活的模型」;有位用户修好工具调用的配置之后,Agent 任务成功率从 67% 跳到了 92.5%。

最大的槽点是「太爱想」。有人实测:一个编程请求,它先闷头思考了 142 秒才开始回答;同一个问题关掉思考模式,28 秒给出能用的代码。但关了思考,大家又普遍反映它明显变笨——两头堵。

我的体验和社区几乎一样,这两个点后面都会讲到。

我这台机器上的真实数字

运行时我用的是最省事的 Ollama。它不是最快的路,但我平时就这么用,这篇文章的数字也不想换一个平时不会开的环境来跑。以下是 9 月 17 日上午重跑的结果:

场景Prefill解码速度备注
短上下文(约 20 token)44.5 – 45.4 tok/s三次重复取值稳定
约 1K 上下文249.7 tok/s42.0 tok/s
约 7.4K 上下文218.2 tok/s41.2 tok/s
约 14.8K 上下文212.4 tok/s39.0 tok/s
约 27.8K 上下文180.4 tok/s35.7 tok/s冷前缀
27.8K 之后追问前缀缓存命中34.0 tok/s首 token 约 3.2s

基准实测:解码与预填充速度(M4 Max 128GB,Ollama MLX nvfp4)

三个比数字本身更有意思的发现。

第一,45 tok/s 是「加速外挂」加持后的成绩。 按内存带宽算,纯解码上限也就三十多;日志里能看到 MTP 在持续工作,猜中率七八成。这也是社区有人关掉它只测到 24.6 的原因——我每天看到的 45,已经包含了这部分收益。

第二,笔记本上的真瓶颈不是吐字,是「吃文档」。 喂上下文的速度实测 180–250 tok/s,一份 6 万 token 的文档冷着喂进去要四分多钟。好在有前缀缓存:资料喂过一次,继续追问只算增量,秒级开口。长上下文体验好不好,一半看你会不会顺着这个脾气用。

第三,内存比「18GB」那个标签大得多。 软件启动就按最大上下文拿缓存空间,日常常驻 30GB 出头;上下文一大还会继续涨(后面说到 52GB)。128GB 无感,48GB 就得掂量了。

还有一个没弄明白的小问题:哪怕只有一句话的小请求,首字也要 2.5–3.3 秒,像是每次请求的固定开销,疑似和视觉模块有关,没深究。影响很明确——它当不了语音助手的大脑,但拿来干活,这个延迟无所谓。

我把 20 万 token 塞了进去

官方标称支持 26 万 token 上下文,我一直想试试往极限推。

翻 9 月 9 日晚上的日志,找到了那次实验:一个 20.5 万 token 的文档,分了八段才喂完,前缀缓存一节节往上爬,内存从 40GB 一路涨到 52.36GB。

结论有两层。塞得进去:一整本书的量,机器没崩,同时浏览器、IDE 照常开着——128GB 的意义就在这。但塞进去不等于用得好:它在这么长的内容里找东西,可靠性还达不到「托付」的程度。以后再看到「原生 262K」,我会自动拆成两个问题:能不能装,和装满之后还好不好用。

速度也是账:20 万 token 冷处理要 17 分钟,没有前缀缓存的话,这个长度在个人电脑上没法当普通交互用。

让它干了两天真活

比起跑分,我更愿意看一个模型能不能把真实项目做完。

9 月 8 日到 9 日,我让它做了一个完整项目:PyTurtle Studio——一个在浏览器里直接跑真 Python 的编程 IDE。代码是真正的 CPython 在浏览器里执行,海龟画图画在网页画布上,还带一个能输入输出的控制台。

PyTurtle Studio:Qwen3.8-27B 两天产出的浏览器 Python IDE,正在画十二瓣花

两天的日志统计:154 次请求,纯模型计算累计约 5 小时,最长一次 12 分钟。我的工作方式是把需求说清楚,让它自己做,过一会儿回来检查,不对再让它改。

最后交付 8 个文件、2300 行代码,开箱能用。

比行数更意外的是,它自己给项目配了一整套验证:画图模块有单元测试,有一个模拟全流程的自测脚本,还有在真实浏览器里逐像素检查画面的脚本,连「打包回单文件」都写了个小工具。Reddit 说它会主动写测试,这次我亲身验证了。

慢也是真的——那 12 分钟就是深度思考的时间。坐在屏幕前等它会很难受,但当「接个需求让它自己磨」的工人用,节奏反而舒服。连项目文档里的「已知缺陷」都是它自己老实写下来的。这一点,比跑分高几分更有说服力。

128GB 到底买到了什么

如果只问「能不能跑起来」,32GB 内存就有机会,没那么夸张。

但「跑起来」和「住进来」是两回事。模型占 30GB,实验时涨到 52GB,同时我的浏览器、IDE、终端照常开着,还能再挂一个小模型。电脑还是我的电脑,没有因为跑它变成一台什么都不敢动的专用机器。

至于速度——128GB 买不到速度(那由内存带宽决定),买到的是余量:不用做任何取舍的余量。到了这个档位,这个模型才算真正「住」进了电脑里。

27B dense 还值得跑吗

论坛上吵得最凶的就是这个:同样内存,为什么不跑更快的 MoE?

我一个月用下来的答案不是二选一,是分工:要快开口的事(语音、问答、补全)交给小模型和 MoE;要质量的重活(代码审查、长文档分析、Agent 干活)交给它。 一个月下来,重任务我已经习惯性先扔给它了。

还有一笔很现实的账:放在自己机器里的模型,调用一百次也不多一分钱。它不一定比云端聪明,但它让我敢放开手用——这一点,实际用过才知道有多重要。

写在最后

这篇文章写到最后,我印象最深的不是 128GB,也不是 45 tok/s。

而是这个变化本身:本地模型的进步,已经不只是「模型越做越大」——训练、后训练、压缩、推理软件、加速技巧,全都在同时往前走。

云端模型变强,我们感觉不到背后的区别;但本地不一样。我的电脑不会明年自动多一倍内存,可同样这台电脑,明年可能就跑一个明显更聪明的模型。硬件已经买回来了,接下来值得期待的,是还能往里装进多少新能力。

参考资料

  1. Qwen3.8 官方仓库与模型卡:https://github.com/QwenLM/Qwen3.8https://huggingface.co/Qwen/Qwen3.8-27B
  2. Artificial Analysis:Qwen3.8-27B:https://artificialanalysis.ai/models/qwen3-8-27b
  3. Simon Willison:Qwen3.8-27B scores 52(2026-08-17):https://simonwillison.net/2026/Aug/17/qwen-38-27b-scores-52/
  4. 凤凰网科技:阿里开源 Qwen3.8-27B(2026-08-15):https://tech.ifeng.com/c/8vbMNx17cfF
  5. 量子位:Qwen3.8-27B 开源:https://www.qbitai.com/2026/08/473379.html
  6. smeltcore:Qwen3.8-27B on Apple M4 Max:https://smeltcore.com/recipes/qwen3-8-27b-on-apple-m4-max-4-bit-mlx-vision-language-at-the-full-262k-context/
  7. Apple MacBook Pro 技术规格:https://support.apple.com/en-us/121553
  8. Ollama qwen3.8:https://ollama.com/library/qwen3.8
  9. mlx-community:https://huggingface.co/mlx-community/Qwen3.8-27B-4bit ;ggml-org:https://huggingface.co/ggml-org/Qwen3.8-27B-GGUF
  10. DFlash2:https://huggingface.co/incoai/Qwen3.8-27B-DFlash2https://inco.ai/blog/dflash2/
  11. MTPLX 社区改版:https://huggingface.co/Youssofal/Qwen3.8-27B-MTPLX-Optimized-Speed
  12. Reddit 实测帖:tok/s 晒机帖 https://www.reddit.com/r/LocalLLaMA/comments/1vqjeub/ ;量化评测 https://www.reddit.com/r/LocalLLaMA/comments/1vz3ieu/ ;M4 Pro 24GB 实测 https://www.reddit.com/r/ollama/comments/1vrqi3d/ ;M1 Max 对比 https://www.reddit.com/r/ollama/comments/1wa0feg/ ;Gemma4 vs Qwen 讨论 https://www.reddit.com/r/LocalLLaMA/comments/1vyzopv/
  13. oMLX + ANE + MTP 的 M4 Max 128GB 实测:https://github.com/Weschera/Qwen3.8-27B-oMLX-MTP-Mac
  14. Hacker News 发布讨论:https://news.ycombinator.com/item?id=49299605
  15. 本文实测原始日志与脚本:Ollama server log(2026-09-06 ~ 09-17)、自建基准脚本

写作声明:本文观点和实测由作者完成;AI 参与资料检索、数据整理和文字校对。官方 benchmark 均按官方口径引用;社区数据来自公开讨论,部分结果为发帖者自述,本文未逐项复现。

如果这篇文章对你有用,欢迎关注公众号「AITi智能」——每周更新。网站版同步发布:getaiti.com

订阅 · SUBSCRIBE

扫码关注公众号

文章每周更新,网站和公众号「AITi智能」同步发布。 想在微信里第一时间看到,扫码关注。

  1. 01 微信搜索「AITi智能」
  2. 02 关注并加星标
  3. 03 每周更新,不见不散
公众号「AITi智能」二维码

扫码关注 · 每周一篇