2026 年 8 月 14 日晚,阿里巴巴千问团队正式开源 Qwen3.8-27B,这是一款原生多模态、270 亿参数的稠密架构大模型。模型公开次日,国产昇腾平台即完成适配,可依托 vLLM-Ascend 开源推理引擎在 Atlas 800 A3 与 Atlas 850E 超节点上做本地化推理部署。
对国产大模型生态来说,这次发布的看点有两个:一是模型本身在长上下文与 Agent 能力上的升级;二是国产算力平台对开源模型的适配速度第一次追到了「发布当日」。
上下文长度:原生 262K,可扩展到 1M token
Qwen3.8-27B 原生支持 262K tokens 的上下文长度,配合 YaRN 技术可扩展至最高 1M tokens。这一长度意味着模型可以一次读入整本长文档或超长代码库,而不必依赖外部检索拼接。
支撑长上下文的关键,是它在结构上改用了混合线性注意力:全模型共 64 层,其中 48 层采用 Gated DeltaNet 线性注意力,另 16 层保留标准全注意力机制。
传统注意力在处理长序列时,计算复杂度随长度呈平方级增长(O(n2)),序列一长成本就快速上升。混合方案把大部分层换成线性注意力,从结构上绕开这一瓶颈,在保持建模精度的同时,降低长文本处理的算力开销。
性能:全面超过前代,Agent 与编程基准明显提升
官方给出的对比对象是前代 Qwen3.6-27B 与同期的 Qwen3.7-Plus。结果是:Qwen3.8-27B 在编程与办公类任务中全面超过 Qwen3.6-27B,整体表现也优于 Qwen3.7-Plus。
两个具体基准数字:
- Agentic terminal coding:73.0 分,比前代提升 9.6 分;
- SWE-bench Pro:61.7 分,提升 8.2 分。
模型还新增了 reasoning_effort 机制,能根据任务复杂度自适应调整推理深度,在效果与算力之间做平衡。
昇腾适配:首日完成的国产化部署
昇腾平台针对模型特性做了几项针对性优化,使得开源次日即可部署:
- Prefill 阶段引入 GDN 融合算子,以分块方式处理超长序列,降低中间数据搬运与算子调度开销;
- 支持 W8A8 量化部署,把权重与激活值从 BF16 精度压缩到 8 位整型,释放昇腾 NPU 在 INT8 与 MXFP8 精度下的算力;
- 结合模型原生 MTP 投机推理,由 MTP 模块预测后续 token、主模型并行校验,减少主模型调用次数;
- Decode 阶段支持把计算逻辑编译为设备端执行图(ACLGraph),消除重复调度带来的性能损耗。
目前模型已在 Hugging Face 与魔搭社区(ModelScope)同步开放,昇腾平台也提供了完整部署指南。用户通过 vLLM-Ascend 即可完成本地化推理部署。
结语
Qwen3.8-27B 的定位很清楚:用混合线性注意力解决长文本的处理成本问题,同时把 Agent 与编程类基准再往上推一档。而昇腾在发布当日就完成适配,说明国产开源模型跑在国产算力上的链路已经缩短到可以「当天发布、当天可用」。对需要长上下文、又希望本地化部署的开发者而言,这是一个可以直接上手的选项。