2026 年 9 月 9 日,蚂蚁集团旗下百灵团队发布并开源金融增强开放模型 Ling-3.0-flash-Fin。这是一款专门为金融行业优化的大模型,目标是把「找资料、做分析、算估值、写研报」这条投资研究工作链完整串起来,让 AI 从陪人问答走向真正上手干活。模型权重与配套的金融 AI 评测基准 FinFIRST 同步开源,是蚂蚁百灵从通用模型能力走向专业场景的一次重要布局。

蚂蚁百灵是什么,这款模型解决什么问题

蚂蚁集团是支付宝的母公司,也是国内规模最大的金融科技公司之一。百灵是蚂蚁自研的大模型系列,此前已推出过开源模型。Ling-3.0-flash-Fin 是百灵首个金融增强模型,基于通用模型 Ling-3.0-flash 开发。大模型可以理解为用海量文本训练出来、能理解并生成文字和数据的 AI 程序;金融增强则指在通用能力之外,针对金融行业的语料和任务做了专门训练。开源指公开模型的权重和代码,任何机构或个人都可以下载、自行部署,或在遵守协议的前提下二次开发,而不必依赖厂商提供的接口。

模型延续 124B 总参数、5.1B 激活参数的配置。总参数决定模型的「知识容量」;激活参数是处理每个问题时实际被调用的部分,激活参数小意味着运行成本低、响应快、部署更实用。模型还支持 256K 长上下文,即一次能处理约 25 万个 token。token 是 AI 处理文本的最小单位,大致相当于半个到一个汉字,256K 的容量相当于让模型同时读完几十页的财报和公告,再在此基础上做分析和计算。

与常见金融大模型只做问答、摘要等单点任务不同,Ling-3.0-flash-Fin 的定位是长链路工作:信息检索、研究推理、估值建模、研报撰写环环相扣,尝试打通从找资料到形成研究成果的完整任务链。目前模型权重已开放,开发者也可通过 API 体验。

金融 AI 难在哪里

金融一直被视为 AI 走向专业生产力的高难度场景。一份研究报告背后,需要从年报、财报、公告、监管文件和研究材料中找信息,核对不同报告期的统计口径,再完成计算和估值建模,最终形成能被专业人士审核和复用的成果。统计口径指统计或计算的标准和范围,例如营收按合并口径还是单家口径计算,数字可能完全不同。

金融 AI 面对的不是简单的知识问答。它不仅要答对,还要知道数据能不能用、计算对不对、结论能不能被复核。Ling-3.0-flash-Fin 瞄准的正是这一完整工作链路,让模型把信息检索、证据审查、计算、建模和报告准备连接起来,而不是当成彼此孤立的任务。

四项能力对应一条投研链

信息检索:优先定位官方、一手和高可信数据源,并关注信息时点和统计口径。研究推理:通过多步计算和交叉验证,厘清事实与假设,构建可复核的证据链。估值建模:进入真实的工作簿,支持公式切换、跨表依赖和异常排查,生成的结果能接回专业人员原有工作流程。估值建模指用财务数据推算一家公司值多少钱,是投行与基金投研的核心环节。研报撰写:在以上基础上组织事实、数据和判断,生成可编辑、可审核的研究材料。

四项能力不是功能罗列,而是一条从找信息、验信息,到做计算、建模型、出成果的完整投研链路。这意味着金融 AI 的比拼正从单点能力走向完整工作流。

FinFIRST:给金融 AI 一把评分尺

与模型同步开源的 FinFIRST,解决的是另一个问题:如何判断一个金融 AI 干得好不好。评测基准可以理解为一套标准化的考题和打分规则;Agent(智能体)则是能自己规划步骤、调用工具完成任务的 AI 程序,金融搜索 Agent 就是替你查资料、做验证的 AI 研究员。

FinFIRST 全称 Financial Information Retrieval, Sourcing and Traceability,由蚂蚁集团构建并开源,中金公司投行团队提供专业支持,50 余位金融专业人士参与设计。它重点评测金融搜索 Agent 在信息检索、信源选择、口径判断和推导过程上的能力:好的金融 AI 不仅要给出正确答案,还要能回答三个问题——信息从哪里来、口径是什么、结论如何得出。

数据构成上,FinFIRST 覆盖中国内地、美国、中国香港及其他市场,中文题占 60.2%,英文题占 39.8%;超过五分之四的题目包含多个相关子问题,61.8% 要求显式计算,32.5% 需要多个信源,75.6% 不直接指定信源、需要 Agent 自主搜索判断,所有题目均使用公开可访问的信源。它不是一份简单的模型排行榜,而是把金融研究中的专业判断转化为可验证、可复用的评测标准。

评测表现与开放策略

据蚂蚁方面公布,Ling-3.0-flash-Fin 已在 FinFIRST、FinSearchComp Verified、Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 等多个金融智能体基准上测试,覆盖金融信息检索、投资研究、长程任务执行、估值建模、银行业务等场景,综合表现超过部分大尺寸旗舰模型,在同尺寸模型中具备较强竞争力。上述成绩目前为厂商口径,尚未见第三方独立复测。

蚂蚁这次采取「模型 + 工具 + 评测」同步开放:模型权重开源、提供 API 体验、评测基准一并开放,让金融机构、研究团队和开发者共同参与迭代。对金融行业来说,开放意味着更多真实业务反馈能反哺模型能力,也降低了金融 AI 研究和应用开发的门槛。

判断金融 AI 的新标准

金融 AI 的竞争正在从「会不会回答问题」转向「能不能把一项工作完整干完」。蚂蚁选择把模型和评测标准一起开源,让行业有了可对照的尺子。对从业者来说,以后判断一个金融 AI 工具值不值得用,可以看三件事:它能否说清信息从哪里来、统计口径是什么、结论如何得出。能说清,说明背后有可复核的证据链;说不清,再漂亮的答案也要存疑。