2026 年 9 月 10 日,中国 AI 公司 DeepSeek(深度求索)正式发布新一代开源大模型 V4.1 Flash。这是一款总参数 552B(约 5520 亿)的混合专家(MoE)模型——混合专家相当于把模型拆成许多分工不同的「专家」子网络,处理任务时只唤醒其中一小部分,用更少算力干同样的活。官方给它的定位是「更强、更快、更普惠」:在多项基准测试中智能水平超过自家旗舰模型 V4 Pro,推理成本却显著更低,模型权重与技术报告同步开源,个人和公司均可免费下载使用。

DeepSeek 与 Flash 系列:来历与定位

DeepSeek 是中国人工智能公司深度求索的英文名,以开源大模型闻名,此前发布的 V3、R1 等模型凭借「性能接近前沿、成本远低于同行」的特点引发行业关注。Flash 是它的轻量模型系列,主打速度快、价格低,覆盖文字问答、写代码、读图等日常高频任务——「读图」属于多模态能力,即一个模型同时处理文字与图片等多种形式的信息。它也能支撑 Agent(智能体,能按指令自动操作软件完成任务的人工智能程序)类应用。

V4.1 Flash 是 V4 家族中最小尺寸的模型,却直接对标旗舰:官方称其智能水平已在基准测试中超越 V4 Pro 在内的一众旗舰模型,用户可以用远低于旗舰的价格拿到接近旗舰的智能。

非对称结构:552B 总参数,单次只激活 24B

模型的「参数」可以理解为内部可调节的「知识旋钮」,参数越多,理论上能装下的知识越多,但每次计算的成本也越高。V4.1 Flash 采用全新的 Causal-Encoder-Decoder(因果编码器-解码器)非对称结构:输入侧每次只激活 8B 参数,输出侧激活 16B 参数,合计约 24B 参数参与单次计算,其余参数按需休眠。总参数决定知识容量,激活参数决定单次成本,把两者拉开距离,就能在知识不缩水的同时把算力账单降下来——这是「小成本大智能」的来源。

KV 缓存压缩:显存需求降到上一代的四分之一

大模型对话时要记住前面说过的话,这些上下文临时存放在名为 KV Cache(KV 缓存) 的内存区域,上下文越长占用越大,直接推高服务成本。V4.1 Flash 大幅压缩 KV 缓存:对 HBM(高带宽内存,AI 加速卡上的高速显存)的需求降到上一代的 1/4,对 SSD(固态硬盘)的需求降到 1/8;与 DeepSeek 初代模型相比,KV 缓存总体已缩小 437 倍。在 Agent 使用场景中,缓存命中的费用往往占大头,这一压缩让此类任务的成本明显下降。

API 改名与峰谷定价:调用更便宜,闲时半价

V4.1 Flash 已同步上线 DeepSeek 官方 API(应用程序编程接口,开发者付费调用模型能力的通道),模型名称改为 deepseek-flash;旧名称 deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 暂时也会路由到新模型,老用户无需改代码即可用上新模型。

定价同步调整:V4.1 Flash 整体降价,并继续采用峰谷定价——闲时(低峰时段)价格为高峰时段的一半,新价格自 2026 年 9 月 10 日 12:00 生效。同时官方宣布,2026 年 9 月 14 日 12:00 之后,访问 deepseek-v4-pro 的请求将全部改由 V4.1 Flash 承接,并按 V4.1 Flash 单价计费——旗舰名号正式让位于更经济的 Flash。

开源与生态:权重与论文公开,腾讯与 OpenCode 已接入

模型权重已发布在 HuggingFace(全球最大的开源模型托管平台)的 deepseek-ai/DeepSeek-V4.1-Flash 页面,技术报告也一并公开,开发者可以自行下载、部署与微调。生态方面,腾讯(WorkBuddy、CodeBuddy)与开源编程工具 OpenCode 作为官方合作伙伴已全量接入 V4.1 Flash。

结论

V4.1 Flash 带来的变化很直接:旗舰级的智能,又便宜了一档,而且人人都能拿到——这正是「普惠」二字的落点。对普通用户,它意味着 API 调用成本下降、响应更快;对开发者和企业,它意味着能以更低成本把大模型能力嵌进自己的产品。