Featured image of post 一张 4090 跑 Opus 级 Agent!阿里开源 Qwen3.8-27B,反超 Claude Opus

一张 4090 跑 Opus 级 Agent!阿里开源 Qwen3.8-27B,反超 Claude Opus

阿里开源 Qwen3.8-27B:270 亿参数,一张 RTX 4090 就能本地跑,原生多模态、262K 上下文、免费商用。在 SWE-bench Pro、OSWorld 等 Agent 评测反超 Claude Opus,私有化和数据敏感场景可上手。

8 月 14 日,阿里放出 Qwen3.8-27B,开发者蹲这个版本蹲了好久。

原因就一句话:现在,一张 4090 就能跑"Opus级"Agent 了。

270 亿参数,量化后刚好塞进 24GB 显存,RTX 3090/4090、大内存 Mac 都能跑,还免费商用。

先看数据:多项榜单反超 Claude Opus 4.6 Max

Qwen3.8-27B vs Claude Opus 4.6 Max 对比(自绘,数据源:阿里官方 Benchmark / 量子位)

官方 Benchmark 里,27B 在软件工程和 Agent 评测上把云端旗舰 Opus 4.6 Max 干翻了好几项:

  1. SWE-bench Pro(Agent 编程):高出 8.3 分
  2. QwenSWEBench(真实软件工程):领先扩大到 15.2 分
  3. CoWorkBench(计算机/金融/法律/医疗专业长任务):70.7 vs 68.2
  4. OSWorld-Verified(电脑操作):84.3 vs 72.7
  5. AndroidWorld(手机操作):81.9 vs 62.0
  6. WebArena-Verified(浏览器操作):从上一代 48.8 涨到 64.8

注意 4 和 5——电脑操作和手机操作,这是 Agent 落地最直接的场景,27B 反超幅度最明显。

为什么 27B 能打:架构和配置都没缩水

尺寸小了,配置没缩水:

  1. 原生多模态:看图、读 PDF、理解图表、处理视频,都行
  2. 262K 原生上下文:还能扩展到 100 万 token——吃下大工程没问题
  3. 架构:64 层里 48 层用 Gated DeltaNet 线性注意力 + 16 层完整 Attention,按"3 层线性 + 1 层完整"循环。线性注意力降长序列的计算和显存压力,完整注意力隔几层做充分信息交互——这是 262K 上下文还能本地跑的关键

社区实测也很硬:有人把 FP8 版放到单张 GH200 上,10 个并发请求、262K 上下文,首批流式 token 都在 10ms 内返回;还有人让它看一部 1935 年的 11 分钟老电影,识别 96 个带时间戳的事件,157 秒跑完,误差只有 2 秒。

怎么跑起来

官方已经接好了 Transformers、vLLM、SGLang、TokenSpeed:

  1. 生产环境/高吞吐:用 SGLang 或 vLLM
  2. 本地玩家:HuggingFace 有量化版本,用熟悉的工具链直接部署
  3. 手里有 4090 或大内存 Mac,基本可以开始折腾了

模型卡:huggingface.co/Qwen/Qwen3.8-27B

丑话也说在前面

先说清楚限制,别瞎吹:

  1. “Opus级"是场景限定的:反超集中在 Agent 执行、代码、操作类任务;复杂深度推理、超长上下文,270 亿参数和云端旗舰还是有差距,别拿"270 亿反超 Opus"标题党
  2. 这是官方厂商 benchmark:你拿自己的真实任务跑一遍,比什么都靠谱
  3. 开源协议放心:Apache 2.0,你可以商用,也可以改了再发,免费,这点阿里一直做的到位

说白了:对于做私有化、做数据敏感业务的人,这是天上掉馅饼;对于普通用户尝鲜,它也确实能让你在本地跑个像样的 Agent,不用再蹭云端 API。

对程序员的直接意义

以前"本地跑 Opus 级 Agent"是想都不敢想的:旗舰模型都在云端,要么按量付费,要么数据出不了门。

Qwen3.8-27B 把门槛砸下来了:Agent 能力 + 多模态 + 262K 上下文,量化后 24GB 显存,免费商用,数据不出门。

对做私有化、做 toB、做数据敏感场景的人来说,这可能是 2026 年最值得关注的本地模型。

你准备用 27B 跑什么?评论区聊聊 👇