7月27日,月之暗面开放 Kimi K3 的完整模型权重,上线 Hugging Face 半小时即获超 4000 个点赞,登上该平台趋势榜第一。这是中国开源模型在三个月内的第三次关键发布。此前 DeepSeek 和智谱已先后出手,分别在价格与长任务能力上缩小了与美国闭源旗舰的差距。三次发布之后,围绕「开放权重还是封闭模型」的争论,从硅谷延伸到华盛顿的政策讨论。
三次发布各缩小一项差距
第一次来自 DeepSeek。4月24日,DeepSeek 发布 V4 预览版,并同步开放权重。所谓开放权重,即把模型的参数公开,让开发者可以自行下载、部署和修改,而不必只能通过官方接口付费调用。V4-Pro 总参数 1.6 万亿,每次调用激活 490 亿参数,支持 100 万 Token 上下文。Token 是按字数计费的文本单位,100 万 Token 意味着一次能处理很长的文本。在 DeepSeek 自测中,V4-Pro 最高推理强度下 SWE-bench Verified 得分 80.6%,与 Claude Opus 4.6 的 80.8% 几乎持平;BrowseComp 83.4%,高于 GPT-5.4 的 82.7%。这次发布集中在价格:5月23日,DeepSeek 把原本限时的 75% 折扣转为长期价格,每百万 Token 非缓存输入、输出分别收费 0.435 美元和 0.87 美元。开发者用美国闭源旗舰一小部分的费用,就能调用性能接近的开放模型。
第二次来自智谱。6月16日,智谱发布 GLM-5.2,同样支持 100 万 Token 上下文,以 MIT 许可证开放权重。它的重心从回答问题转向长时间干活——阅读大型代码库、反复调用工具,在数百轮操作中完成软件工程任务。按智谱汇总的各家测试结果,GLM-5.2 在 Terminal-Bench 2.1 拿到 82.7%,高于 Claude Opus 4.8 的 78.9%,略低于 GPT-5.5 的 83.4%。
第三次来自月之暗面 Kimi K3。7月27日,月之暗面开放 K3 完整权重,总参数 2.8 万亿,每次激活 1040 亿参数,同时支持图像、视频与 100 万 Token 上下文。月之暗面称,这是全球首个开放权重的 3 万亿参数级模型。K3 在 Terminal-Bench 2.1 拿到 88.3%,超过 Claude Fable 5 的 88.0%,距 GPT-5.6 Sol 的 88.8% 只差 0.5 个百分点;在月之暗面公布的超长软件工程测试 SWE-Marathon 中,K3 得 42 分,高于 GPT-5.6 Sol 的 39 分和 Claude Opus 4.8 的 40 分。
美国前沿模型公司就开放权重立场分化
中国开源模型越逼近美国旗舰,硅谷「开放还是封闭」的争论就越激烈。据《纽约时报》和 Axios 报道,K3 开放权重前夕,OpenAI 和 Anthropic 正向华盛顿表达关切,称中国公司可能通过大量调用美国模型、收集输出结果,蒸馏出成本更低的新模型。蒸馏指用大模型的输出去训练更小的模型。API 还能限制账户与地区,模型权重一旦公开,开发者便可下载、修改、自行部署,难以被原公司收回。
英伟达 CEO 黄仁勋表达了相反立场。7月22日,他对 Axios 表示,优秀的中国开放模型「应该被使用」,美国公司也「绝对应该获准」使用中国模型。7月24日,英伟达、微软、Meta 等 25 家公司和机构首批签署《开放权重与美国 AI 领导力》,要求华盛顿避免过早限制开放模型。OpenAI、Google、SpaceX 在周末陆续加入。截至 7 月 27 日,主要美国前沿模型公司中,Anthropic 仍未签署,其 CEO Dario Amodei 表示公司从未主张全面禁止开放权重模型,但仍支持打击工业级蒸馏、限制先进芯片流向中国。随后,英伟达又联合微软、IBM、Hugging Face、SpaceX AI 等成立「开放安全 AI 联盟」。
价格优势之外还有返工成本
企业选模型,要把 API 费用和返工时间一起算。DeepSeek V4-Pro 每百万 Token 非缓存输入、输出收费 0.435 美元和 0.87 美元,而 Claude Opus 5 为 5 美元和 25 美元,输出价差约 29 倍。这个优势很大,但长任务一旦做到最后失败,工程师要重新检查、修改、运行,省下的调用费会耗在返工上。
稳定性是尚未补齐的一块
这些测试成绩大多来自公司自测,部分比较还混用了不同的 Agent 工具与运行环境;同一型号在不同公司的测试里分数也会有差异,例如 Claude Opus 4.8 在月之暗面的 SWE-Marathon 测试里得 40 分,在智谱公布的同一测试里是 26 分。月之暗面在 K3 官方模型卡中承认,K3 整体使用体验与 Claude Fable 5、GPT-5.6 Sol 相比仍有「明显差距」。GLM-5.2 在 Terminal-Bench 2.1 达 82.7%,换到 SWE-Marathon 却只有 13 分。反复运行仍然稳定的工具调用、长上下文、多轮修改能力,是中国开放模型尚未补齐的一块。
下一款:DeepSeek V4 正式版
下一款是尚未发布的 DeepSeek V4 正式版。截至现在,DeepSeek 未公布正式版的具体规格。在与投资人的交流中,梁文锋称公司大概率仍会开放最强模型,商业化只追求「合理利润」。如果兑现,V4 正式版将继续采用「能力接近美国旗舰、价格低得多、同时开放权重」的组合。
OpenAI 和 Anthropic 的近期动作说明它们不想等到 V4 正式版发布再应对。K3 一开源,两家便推动华盛顿调查模型蒸馏、讨论制裁与使用限制。模型权重一旦被大量下载部署,再补限制效果就会打折扣。接下来取决于 DeepSeek V4 正式版与华盛顿的限制措施谁先落地。