苹果发布蛋白质设计模型 SimpleDesign:可同时生成氨基酸序列与三维结构
苹果在 arXiv 公布蛋白质设计模型 SimpleDesign,可同时生成氨基酸序列与三维结构,走端到端简化路线 训练数据超 200 万组序列-结构配对,延续 SimpleFold 思路;目前仅计算机模拟验证,尚未进入实验室
学术论文与研究成果
苹果在 arXiv 公布蛋白质设计模型 SimpleDesign,可同时生成氨基酸序列与三维结构,走端到端简化路线 训练数据超 200 万组序列-结构配对,延续 SimpleFold 思路;目前仅计算机模拟验证,尚未进入实验室
arXiv 最新研究对比两种技能包调用方式:派子智能体执行 vs 加载进主上下文;输入输出边界清晰时,子智能体方案表现更优、更稳定,代价是额外 token 协调开销。
2026 年 8 月底 arXiv 研究揭示:增量命名实体识别中,新训练数据携带的「上下文偏见」会加速模型遗忘旧知识 论文提出类型平衡上下文学习(TBCL),用句子配对与一致性约束配平上下文,在 10 组 INER 设置上验证有效
OpenAI 宣称用 1 万个并发 AI 代理解出纳维-斯托克斯难题,约 90 年无人解开的千禧年大奖难题迎来新进展 学者质疑 OpenAI 可能使用了未公开研究数据;OpenAI 否认看过对方工作,但承认无法排除数据帮助改进模型
美团研究团队提出 ATLAS 评估框架,从「单次任务过程」与「长期交互连续性」双视角诊断 AI 服务智能体 在美团小团生产流量上验证:在线 A/B 实验显示用户参与度、下游业务指标、人工抽检质量三项同步提升
AI 首次攻下千禧年难题:OpenAI 证明纳维-斯托克斯方程会在有限时间内破裂
开源 9B 模型经真实执行验证的数据微调后,在多项测试中追平了同家族 27B 大模型 论文同时发布 KOPA-Bench 基准,用韩国政府开放接口的 145 个真实任务考核多步工具调用能力
新研究用黑盒干预实验量化大模型自报解释的可靠性 模型自报的关键影响因素与实际决策相关度仅 0.35 至 0.58 研究者提供黑盒可靠性检查框架,可用于智能体监督与 AI 审计
DEX-Comp 两阶段训练方法,用蒸馏预热加困难探索突破老师水平:把 RAG 检索上下文压缩到十六分之一,推理加速最高 24 倍,回答质量与未压缩基线持平或更高。
HSRM 用约 2M 参数的隐藏状态奖励模型,不重读答案文本即可完成推理时验证,在 16 个生成器-数据集组合中的 15 个上达到或超过 55M 参数纯文本验证器。该论文已被 EMNLP 2026 接收。
Google Research 与以色列理工学院联合研究:模型答错的事实多数并非缺失,而是已编码却回忆失败 延长推理时间最多能找回 65% 的「假性遗忘」事实,扩容与 RAG 并非万能解药
北京理工大学在《科学》发表片上光谱计算新方法,高光谱图像无需回传服务器,在卫星或便携设备上即可现场实时解析 该成果为高光谱技术在遥感卫星、便携式检测设备等场景的实时应用提供了技术基础
arXiv:2608.31035 系统实测「人类主观感受当强化学习奖励」在语音生成模型上的可行性,论文已投稿 EMNLP 2026 三个关键结论:主观奖励不可互换、Best-of-8 重排序听感不输 GRPO、CER 区间约束是防转写漂移的关键防线
Meta 与 UIUC 研究者发布 EvoHarness-RL 训练框架,以 Qwen3-8B 在 ALFWorld 基准拿到 96.9% 平均成功率,追平 Claude Opus 4.5 把 Agent 的工具使用与状态管理从人工规则变成可训练行为,为预算敏感团队提供 8B 级模型逼近前沿表现的现实路径
斯坦福 CRFM 主导的 Marin 项目启动 5350 亿参数 MoE 模型全程公开训练,训练曲线、数据配方、失败与修改记录实时开放 11 套 NVIDIA GB200 NVL72 集群、18.75 万亿 Token,预计持续约 3 个月,JAX/XLA 栈上手写专家并行
清华大学与香港科技大学团队开源的 LiveEdit,以 4 步去噪实现 12.66 FPS 的实时流式视频编辑,论文与代码全部公开。 三阶段蒸馏把双向编辑能力迁移给因果模型,掩码缓存裁剪 70% 冗余 Token,已被 ECCV 2026 接收。