Google 的多智能体协作框架 Antigravity 公布了与 Gemini 3.7 Flash 配对后的最新成绩:由多个 AI 智能体组成的「研究团队」解决了 7 个学术界悬而未决的开放问题,从零做出了与真实硬件高度一致的 CPU 模拟器,并为两个知名开源库提交了性能优化。这是 AI 智能体从「聊天问答」跨向「研究级协作」的一个可验证的里程碑。
Antigravity 是什么:一群 AI 智能体组成的协作框架
Antigravity 是 Google 推出的多智能体协作框架。所谓多智能体,就是让多个独立的 AI 程序(每个称为一个智能体)像人类团队一样分工:有人拆解问题,有人执行计算,有人检查结果和挑错,然后互相评审、反复迭代,连续工作数小时甚至数天,去解决单个 AI 单次对话搞不定的长周期复杂问题。框架的 Teamwork 功能负责协调这些智能体的分工与协作。
Gemini 3.7 Flash 是 Google 的大语言模型,也就是用海量文本训练出来、能理解和生成文字的 AI 程序。「Flash」后缀代表速度和成本优先,适合承担需要大量试错和反复调用的执行型任务。Google 表示,让 Gemini 3.7 Flash 充当智能体的「大脑」、配合 Teamwork 编排,能显著加快研究与工程问题的求解。
数学与理论计算机:7 个开放问题被解决
第一类成果在数学与理论计算机科学领域。智能体团队解决了 7 个开放问题,覆盖 FOCS(IEEE 计算机科学基础研讨会,理论计算机领域的顶级会议)和 JMLR(机器学习研究杂志,该领域的顶级期刊)。
其中最受关注的是 Knuth 的 Cycles Conjecture(高德纳循环猜想)。高德纳(Donald Knuth)是计算机科学领域的奠基人之一,其《计算机程序设计艺术》系列著作是该领域的经典。智能体团队给出的证明长达 40 多页,并使用了 Lean 工具完成形式化验证——Lean 是一套计算机辅助证明系统,能把数学证明写成计算机可以逐行检查的代码,证明中的每一步都由机器核验,从而排除人工推理的疏漏。
被解决的另外几类问题包括稀疏凸优化、可证明的 LLM 量化(即在压缩大模型、降低其精度时,给出可验证的误差保证)和前缀矩阵分解。在 TCSBench(一个面向理论计算机科学的评测基准)上,团队取得了 71% 的成绩。
系统工程:周期误差 0.71% 的 RISC-V 模拟器
第二类成果在系统工程领域。智能体团队从零搭建了一个周期精确(cycle-accurate)的乱序执行 RISC-V CPU 模拟器。
这里有几个概念需要交代。RISC-V 是一套开放、免费的 CPU 指令集架构,也就是规定「CPU 能执行哪些指令」的标准,与英特尔、AMD 采用的 x86 架构和手机芯片主流的 ARM 架构并立。CPU 模拟器是用软件在普通电脑上模拟芯片真实行为的程序。周期精确意味着模拟器对每个时钟周期内的行为都逐一还原,模拟结果与真实硬件一一对应。乱序执行则是现代高性能 CPU 常用的一种执行方式:指令不按程序顺序执行,而是等依赖就绪后提前处理,以提高速度。
这个模拟器的验收方式是启动 xv6——麻省理工学院为教学编写的经典操作系统,功能精简但结构完整。模拟器成功把 xv6 启动到了命令行界面,并且与真实芯片的对照显示,周期对齐误差只有 0.71%,意味着它对硬件行为的还原度非常高。
开源社区:两项性能优化写入上游核心库
第三类成果在开源软件领域。智能体团队的性能优化被上游核心库采纳,全球开发者都能直接受益。
- Eigen:C++ 的线性代数库,被大量科学计算和机器学习项目依赖。团队为其补充了 SIMD 快速路径——SIMD(单指令多数据)是让 CPU 用一条指令同时处理多个数据的技术,能显著加速矩阵等批量运算。
- ParlayHash:一个并行哈希表实现。哈希表是最基础的数据结构之一,用于快速存取键值数据。优化后其插入吞吐量提升到原来的 2 倍,内存占用减少 25%。
结论:AI 智能体正在成为真正的研究伙伴
这三类成果有一个共同点:全部可验证。开放问题的证明经过机器核验,模拟器的行为与真实硬件逐周期对照,性能优化进入了开源主线接受社区检验。AI 智能体第一次在「长周期、需要严谨验证」的科研工作流程中交出了可核查的成绩单。
对开发者来说,信号同样直接:用便宜快速的模型(Gemini 3.7 Flash)配上多智能体编排(Antigravity Teamwork),已经能承担真实的科研与工程任务。可以预期,长周期复杂问题的自动化求解,会是多智能体框架接下来最有价值的应用方向。