讯飞星火 X2.5 是科大讯飞 2026 年 9 月 9 日上线的大语言模型(俗称“大模型”,即用海量文本训练、能理解和生成文字的人工智能程序),也是星火系列目前参数规模最大的一款:总参数 293B(B 为十亿,293B 即 2930 亿参数),采用 MoE 架构(混合专家架构,把模型拆成多个“专家”子网络,每次只激活一部分来干活,更省算力),实际激活参数 30B。官方把代码与智能体能力放在最前面,号称覆盖 200 余种语言。

它值得关注有两点。其一,第三方实测中它完成了财报拆解、数据核查、整站设计等真实任务,结果可核对;其二,它是目前少数从训练到部署全流程跑在国产算力芯片上的大模型,对国产 AI 芯片产业有风向标意义。

先把底子补齐:端侧小模型先行开源

X2.5 之前,讯飞先开源了两款端侧模型(在手机、电脑本地运行、不依赖云端的大模型):4B 与 1.7B 两个尺寸。它们都能在本地原生处理 100 万 Token 的上下文——Token 是模型处理文本的最小单位,约相当于几十万汉字,够把一本厚书完整放进对话里。开源(公布模型权重、允许任何人免费下载使用和修改)后,社区给它们做量化压缩(压缩体积和显存占用,让普通显卡也能跑)、移植到 Mac 与 WebGPU(浏览器调用显卡算力的标准),还把 4B 版接进 Agent 工作流,一度冲上 Hugging Face(全球最大的 AI 模型分享社区)趋势榜第一。

于是大号版 X2.5 的实测,成了检验“开源小模型这么能打,旗舰大模型能干什么”的一关。

实测一:一句创意,生成能上手玩的 3D 网页

第一类测试考“从想法到成品”:让模型把一句创意直接做成可用的网页产品。输入“中秋祈福、3D 粒子、手势交互”后,模型生成一个网页——待机时粒子像桂花散在夜空,握拳时聚成一轮圆月,比“1”拼出“中秋快乐”、“2”排出“阖家团圆”,松手后化成星辰散开,全程手势控制。

这考验的是模型把自然语言需求转成完整可运行代码(含前端交互逻辑)的能力,是创意到成品的最小闭环。

实测二:61 页财报、科研论文、电商数据,三件真实工作

第二类测试看“干得对不对”。

测试者把英伟达 Q2(2027 财年第一季度)财报丢给模型。这份财报有 61 页,模型用半小时输出 9 份图表和 1 份投研风险简报,营收、利润、净利润等关键数字与财报原文一致。

接着,测试者给了它两篇分别来自 Nature 和 Science 的论文、一篇新闻报道和 20 份模拟问卷数据,要求它完成一项研究并写出论文实证初稿。模型多轮交叉校验后给出结论:现有证据支持“经常使用 AI 的科研人员在产出数量上更高”这一方向;它还主动指出研究存在问卷样本量小、未控制变量等问题。

第三项是“对抗测试”:测试者把电商营收数据故意算错、藏在文档截图里,模型在分析时把这些统计错误逐个揪出,并把分析报告渲染成可视化 PDF。

三件事分别对应长文档处理、数据推理、异常发现,都是日常工作中最耗人力的环节。

实测三:一段世界观设定,搭出可上线的官网

第三类测试是整站设计:只给模型一段游戏《堕神余烬》的世界观设定(诸神陨落后世界碎裂,凡人穿越哥特地下城求生),要求生成可直接上线的沉浸式官网。模型输出包含首页海报、导航栏、闯关地图与 Boss 专题板块,玩法介绍和跳转入口等上线组件一并配齐。

对没有设计师和前端团队的独立游戏开发者来说,这意味着用大模型搭配文生图工具,就能自己搭出可用的官网。

背后主线:Agent 要“交付”,算力要闭环

把三类实测放回行业背景,能看到两条主线。

第一条,AI 的能力标准正从“会聊天”转向“能交付”。年初 OpenClaw 一类让 AI 自己调用工具的智能体(Agent,能自主调用工具、完成多步任务的 AI 程序)走红,随后 OpenAI、Anthropic 等公司强调 Harness Engineering(给智能体搭建执行框架与流程,让它连续工作数小时不掉链子),行业焦点已从“答得对不对”转向“事办没办完”。

第二条,国产算力正从“备用选项”走向“核心资源”,但要先分清两个概念:把训练好的模型搬到国产芯片上运行,叫推理适配,只解决“当下能不能跑”;讯飞做的是从模型训练、强化学习到推理部署整条链路都落在国产算力平台,形成训推闭环——使用中出现的新问题能送回训练端改进,改进后的能力再回到应用。

科大讯飞 2023 年落地国产算力平台“飞星一号”,星火系列模型一直在其上训练迭代。据科大讯飞 2025 年度业绩说明会披露,其 MoE 模型在国产算力上的训练效率,从开箱时的 30%(相对同规模 A800 集群)提升到 93%。这个爬坡来自算子适配、集群通信、专家路由等底层优化,正是国产算力生态绕不开的功课。

政策端也在同向发力:国务院 2025 年 8 月印发《关于深入实施“人工智能+”行动的意见》,提出到 2027 年新一代智能终端、智能体等应用普及率超过 70%。此外市场有消息称国内一家头部开源模型公司计划部署至少 16 万颗国产 AI 芯片,该消息尚未获官方证实。

结论:模型上线只是开工,交付才算干活

星火 X2.5 的实测展示的不是单点能力,而是两条主线汇合:智能体从聊天走向交付,国产算力从跑通模型走向托住真实应用。读者可以带走三点:293B 参数的国产大模型已能完成财报拆解、数据核查、整站设计这类真实任务;这些能力建立在训练到部署全链路国产算力的底座上;行业标准正从“回答得好”转向“交付得了”——能稳定把成品交到用户手里,才是大模型真正的分水岭。