2026 年 8 月 13 日深夜,中国 AI 公司 DeepSeek 发布了两样东西:大模型 V4 Pro 正式版,以及它的首款 Agent 框架 DeepSeek Harness。大模型(用海量文本训练出来、能理解和生成文字的 AI 程序)负责「想」,Harness 负责「做」——它是一套让 AI 智能体能自己读写文件、执行命令、调用工具的软件框架。上线不到一天,Harness 在 GitHub 上获得超过 3.7 万星标(相当于收藏点赞)。

它为什么值得关注:在终端操作测试 Terminal Bench 2.1 上,V4 Pro 得分 87.9,海外第一梯队的 Claude Fable 5 是 88.0,只差 0.1 分;输出价格却是每百万 token(AI 处理文本的最小单位,约等于一个词)50 美元对 0.87 美元,相差约 57 倍。框架采用 MIT 开源协议(允许任何人免费使用、修改、商用代码的宽松许可),可私有化部署(把代码装在自己服务器上、数据不出内网),还适配国产 GPU(图形处理器,AI 计算的核心芯片)。

Harness 是什么:模型负责想,框架负责做

智能体(Agent)指能独立规划并执行任务的 AI 程序,不只会聊天。一个完整的智能体由两半组成:模型负责思考,Harness 负责动手——读写文件、执行命令、调用工具、管理上下文。市面上常见的 Claude Code、OpenAI Codex 本质上都是同类框架,只是它们是厂商封装好的成品:模型固定、界面固定,想改改不了。

DeepSeek Harness 走的是另一条路:一切皆插件。模型、工具、技能、会话、沙箱、存储、循环,甚至界面,全部可以替换和组合。内核只有一个叫 Cordis 的元框架,只负责插件的装载、卸载和依赖管理,其他什么都不管。想换模型就换模型,想加工具就加工具,不用等官方更新。

一切皆插件:可拆卸、可回滚

插件化的难点在于「卸载要干净」。一个插件被卸掉后,它打开过的端口、注册过的监听、占用的内存都要完整撤销,系统不能留下垃圾状态;另一个插件被替换后,依赖它的部分要能自动感知并调整,不用重启整个程序。DeepSeek 还联合北京大学发了一篇 88 页论文,把这种「可逆副作用」从工程技巧提升到理论层面。

相比之下,VS Code 的扩展宿主无法单独卸载某个扩展,禁用就得重启编辑器;Claude Code 和 Codex 的能力则锁在封闭系统里,加一个工具都要等官方更新。这是 Harness 与它们在架构层面最大的不同。

创造模式:Agent 可以给自己装新能力

Harness 内置四种运行模式:标准、极简、PTC、创造。标准模式功能完整;极简模式只保留两个工具,适合省成本;PTC 模式让模型写一段程序一次组合多步操作;创造模式最特殊——Agent 可以检查自己正在运行的运行时,在内存里试验新插件,甚至现场编写一个新插件装到自己身上,装坏了还能回滚。

打个比方:Agent 发现自己手里没有扳手,就现场造了一把扳手装到手上继续干活。这种自进化的雏形能力,目前 Claude Code 和 Codex 都没有。

数据对比:分数差 0.1,价格差 57 倍

以下数据来自 DeepSeek 官方与独立研究机构 SemiAnalysis:

  • Terminal Bench 2.1(终端操作):V4 Pro 87.9 分,Claude Fable 5 88.0 分,差 0.1 分
  • Cybergym(网络安全攻防):V4 Pro 83.3 分,反超 Fable 5 的 83.1 分
  • DeepSWE(软件工程):V4 Pro 62.7 分,超过 Claude Opus 4.8 的 58.0 分
  • 平均分:V4 Pro 62.8,Claude Opus 4.8 62.6,基本打平
  • 输出价格:Fable 5 每百万 token 50 美元,V4 Pro 0.87 美元,差约 57 倍

SemiAnalysis 还独立验证:Terminal Bench 上 V4 Pro 领先英伟达 Nemotron 3 Ultra 达 34 分。按官方数据,Harness 单次任务成本约 0.2 元人民币。

对谁有用:开发者、企业、研究者

对开发者:内测期间社区贡献了约 300 个插件,可接入 OpenAI、Anthropic、Google、Kimi 等近 40 家模型,不绑定 DeepSeek 自家模型。

对企业:MIT 协议下代码与模型权重均可私有化部署,数据不出内网;Trajectory 视图能把每一步执行记录成可回放的轨迹,适合金融、政企等对审计有要求的行业。

对研究者:只追加的事件日志让智能体的运行过程可以像实验记录一样复盘。Harness 团队负责人崔添翼毕业于浙江大学计算机系,曾在华尔街量化机构 Jane Street 工作 9 年,量化系统「稳定执行、全流程留痕」的思路也被带进了这个框架。

上手与现状:10 分钟跑起来,仍是预览版

上手门槛不高:装好 Node.js,在项目目录运行一条命令 npx deepseek-ai/dsh web,浏览器打开 http://127.0.0.1:3080 即可使用;国内网络下载慢可先切换 npm 国内镜像源。

需要说明的是,Harness 目前是 v0.1 预览版,界面粗糙、术语多、上手门槛不低,官方也明确表示后续会有破坏性变更,不适合直接拿来做生产环境的主干工具。

结论:过去两年国产 AI 的主线是追赶海外大模型,而 Harness 是国产框架第一次在 Agent 底层运行时与海外第一梯队正面交锋——性能差距以 0.1 分计,价格差距以 57 倍计,且全开源、可私有化。模型决定智能体能力的上限,Harness 决定你能触达上限的多少:在模型之外,「执行层」的竞争已经开始,而 DeepSeek 选择了开放和便宜。