阿里开源 Qwen3.8-27B:270 亿参数、一张 4090 就能跑,SWE-bench Pro 反超 Claude Opus 4.6 Max

8 月 14 日,阿里千问开源了 Qwen3.8-27B。开发者蹲这个版本蹲了很久——原因很现实:自家电脑终于有机会带得动了。

270 亿参数,量化之后 24GB 显存的 RTX 3090/4090 就能整卡装下。大内存 Mac 也能跑。

一句话总结:这是一张消费级显卡就能跑的"Opus 级" Agent。

先看数据:多项榜单反超 Claude Opus 4.6 Max

官方 Benchmark 里,27B 在软件工程和 Agent 评测上把云端旗舰 Opus 4.6 Max 干翻了好几项:

  1. SWE-bench Pro(Agent 编程):高出 8.3 分
  2. QwenSWEBench(真实软件工程):领先扩大到 15.2 分
  3. CoWorkBench(计算机/金融/法律/医疗专业长任务):70.7 vs 68.2
  4. OSWorld-Verified(电脑操作):84.3 vs 72.7
  5. AndroidWorld(手机操作):81.9 vs 62.0
  6. WebArena-Verified(浏览器操作):从上一代 48.8 涨到 64.8

注意 4 和 5——电脑操作和手机操作,这是 Agent 落地最直接的场景,27B 反超幅度最明显。

为什么 27B 能打:架构和配置都没缩水

尺寸小了,配置没缩水:

  1. 原生多模态:看图、读 PDF、理解图表、处理视频,都行
  2. 262K 原生上下文:还能扩展到 100 万 token——吃下大工程没问题
  3. 架构:64 层里 48 层用 Gated DeltaNet 线性注意力 + 16 层完整 Attention,按"3 层线性 + 1 层完整"循环。线性注意力降长序列的计算和显存压力,完整注意力隔几层做充分信息交互——这是 262K 上下文还能本地跑的关键

社区实测也很硬:有人把 FP8 版放到单张 GH200 上,10 个并发请求、262K 上下文,首批流式 token 都在 10ms 内返回;还有人让它看一部 1935 年的 11 分钟老电影,识别 96 个带时间戳的事件,157 秒跑完,误差只有 2 秒。

怎么跑起来

官方已经接好了 Transformers、vLLM、SGLang、TokenSpeed:

  1. 生产环境/高吞吐:用 SGLang 或 vLLM
  2. 本地玩家:HuggingFace 有量化版本,用熟悉的工具链直接部署
  3. 手里有 4090 或大内存 Mac,基本可以开始折腾了

模型卡:huggingface.co/Qwen/Qwen3.8-27B

丑话也说在前面

  1. “Opus 级"是场景化的:反超集中在 Agent 执行、代码、操作类任务;复杂推理、长程深度的天花板,270 亿参数和 2.4 万亿的旗舰还是有差距
  2. 官方 benchmark 是厂商数据:落地前建议自己跑一遍真实任务
  3. 免费商用确认:Qwen 开源一贯 Apache 2.0 协议,商用没问题——这对做私有化部署的团队是实打实的价值

对程序员的直接意义

以前"本地跑 Opus 级 Agent"是想都不敢想的:旗舰模型都在云端,要么按量付费,要么数据出不了门。

Qwen3.8-27B 把门槛砸下来了:Agent 能力 + 多模态 + 262K 上下文,量化后 24GB 显存,免费商用,数据不出门。

对做私有化、做 toB、做数据敏感场景的人来说,这可能是 2026 年最值得关注的本地模型。

你准备用 27B 跑什么?评论区聊聊 👇

0%