说到「AI 预测未来」,很多人想到的是聊天机器人。但 AI 还有另一类重要用途:预测一串按时间排列的数字接下来怎么走——明天的汇率、下个月的现金流、未来几周的库存需求。这类任务叫时间序列预测(时间序列 = 按时间先后记录的一串数据,比如每天的外汇牌价)。
蚂蚁集团旗下的国际业务公司蚂蚁国际,2026 年 8 月 26 日发布了自研时序预测大模型「鹰序 TST」(Falcon TST,英语全称 Time-Series Transformer)2.0 版。它在全球权威基准测试中取得当前最优成绩(SOTA,state of the art),衡量误差的 MASE 指标(平均绝对比例误差,数值越小越准)降到 0.666,官方称预测准确率稳定超过 93%。更值得关注的是,巴克莱、花旗、德意志、渣打四家国际银行已把它用在真实的现金流预测与外汇管理中。
鹰序 TST 是什么:读历史数据,预测未来
时间序列数据无处不在:汇率、股价、销售量、航班客流。「鹰序 TST」做的就是读取一段历史数据,预测接下来一段时间的走势。它属于「时间序列基础模型」——用海量跨行业数据预训练出来的通用预测底座,类似 ChatGPT 之于文字,它之于数字序列。
银行和跨境支付公司最关心两类预测:现金流(钱什么时候进、什么时候出)和外汇敞口(持有的外币资产因汇率波动面临的风险)。预测不准,企业只能多花钱对冲(用金融工具锁住汇率,防止波动带来损失),或者多留资金垫底。预测越准,这笔「保险钱」花得越少。
成绩单:全球基准第一,四家银行实战验证
GIFT-Eval 是行业常用的时间序列模型评测基准,覆盖 28 个数据集、超过 14.4 万条时间序列和 1.77 亿个测试数据点。鹰序 TST 2.0 在其中拿下当前最优成绩,MASE 降至 0.666,超过多家全球头部科技公司的同类模型。
比榜单更重要的是真实业务验证:
- 巴克莱银行:2025 年 5 月起把模型接入其外汇对冲平台 BARX NetFX,按小时、日、周预测现金流与外汇敞口;
- 花旗银行:2025 年 7 月合作试点,面向跨币种线上售票的航空公司客户,试点客户对冲成本节省约 30%;
- 渣打银行:2025 年 8 月把模型接入其 24 小时流动性引擎 SCALE,当时已覆盖蚂蚁国际超过 60% 涉及外汇转换的交易,外汇相关成本最高下降 60%、流动性管理成本最高下降 50%(合作双方披露口径);
- Capital A 旗下 AirAsia:2025 年 10 月披露为首个商业部署,多币种现金流与外汇敞口预测准确率 90%,外汇对冲成本最高下降 40%。
模型家族:单变量效率与多变量关系两条路线
鹰序 TST 不是单个模型,而是一个家族,两个新成员各有分工:
- Falcon-2.0(2026 年 7 月开放 API):主打单变量预测效率,一次前向计算直接出结果,延迟更低;可输出 21 个分位点(预测区间,用于构造乐观、中性、悲观情景),最大实验版本 585M 参数(M 即百万,585M 为 5.85 亿参数);
- Falcon-X(2026 年 5 月公开论文):主打多变量关系建模,把汇率、利率、波动率等不同变量放进统一空间,识别它们之间的联动,最大实验版本 591M 参数,在 GIFT-Eval 上报出 MASE 0.687。
与主流模型对比:各有侧重,没有通吃
时间序列基础模型赛道今年竞争激烈:Amazon 的 Chronos-2、Google 的 TimesFM 2.5、Salesforce 的 Moirai 2.0、IBM 的 FlowState 相继升级,路线各不相同——有的拼多变量,有的拼长上下文,有的用极小参数量换效率。鹰序 TST 的差异化在于先有金融业务验证,再逐步公开模型:2025 年先与多家银行跑通真实场景,2025 年 10 月才把 Falcon-1.0 在 Hugging Face(全球最大的 AI 模型开放社区)开源。
结论:基准第一不等于业务第一
通用基准拿第一,只证明模型「会预测」;能不能进银行风控,还要看它在真实数据上的稳定性、极端行情的表现、分位数校准(预测区间与实际情况是否吻合)和系统接入能力。对金融机构来说,最终购买的是一套能被验证、被校准、被治理的预测能力,模型规模只是其中一项技术参数。鹰序 TST 2.0 的意义,是把时间序列模型的竞争焦点从「谁在公开榜单上更高」,推向「谁能在真实资金管理流程中稳定好用」——这将是整个行业下一阶段的竞争主线。