DeepSeek Harness 开源:性能追平海外、价格低 57 倍的 Agent 框架
DeepSeek 发布首款 Agent 框架 Harness:一切皆插件、MIT 协议开源、可私有化部署 Terminal Bench 2.1 得分 87.9 追平海外第一梯队,输出价格约为 Claude Fable 5 的 1/57
论文、开源项目与资讯简报
DeepSeek 发布首款 Agent 框架 Harness:一切皆插件、MIT 协议开源、可私有化部署 Terminal Bench 2.1 得分 87.9 追平海外第一梯队,输出价格约为 Claude Fable 5 的 1/57
市面上的 AI 教程大多是「使用向」的:教你打开工具、写提示词。GitHub 上的开源项目 ai-engineering-from-scratch(从零开始学 AI 工程)走的是另一条路:它让学习者把 AI 亲手造出来——从数学基础起步,逐步实现神经网络、Transformer、大语言模型和智能体,而不是只调用现成接口。项目采用宽松的 MIT 许可证免费开源,截至 2026 年 8 月已获 5.17 万星标、9 千次 fork,官网在过去 30 天(截至 8 月 29 日)记录了 11.4 万读者与 18.2 万次页面浏览。
苹果在 arXiv 公布蛋白质设计模型 SimpleDesign,可同时生成氨基酸序列与三维结构,走端到端简化路线 训练数据超 200 万组序列-结构配对,延续 SimpleFold 思路;目前仅计算机模拟验证,尚未进入实验室
FreeLLMAPI 是一个可自部署的开源网关,把 34 家 AI 厂商的免费大模型额度聚合为一个统一接口 每月可用推理容量约 74 亿 token,覆盖 635 个免费模型端点,GitHub 约 2.35 万 Star,MIT 协议 支持 Claude Code、Codex CLI、Cursor 等工具一键接入,但项目方声明仅供个人实验与学习
殷墟是中国历史上第一个既有文献明确记载、又被考古发掘充分证实的商朝都城遗址,也是甲骨文的发现地;甲骨文与《史记》互证,把中国有文字记载的可靠历史向前推进了约1000年。
NASA 与 IBM 联合发布开源月球基础大模型,冰区识别误差比基准模型低 23%,并配套全球首个同类开源数据集
arXiv 最新研究对比两种技能包调用方式:派子智能体执行 vs 加载进主上下文;输入输出边界清晰时,子智能体方案表现更优、更稳定,代价是额外 token 协调开销。
Firecrawl 团队开源浏览器插件 OCR It:单页 PDF 文字识别并转成 Markdown 仅需约 20 毫秒 100% 本地离线运行,不联网、无需 API Key,处理质量对标 IBM 开源工具 Docling,速度约快 300 倍 支持 Chrome 与 Firefox,适合为 LLM 准备语料;复杂版面暂不稳定,建议等待后续更新
2026 年 8 月底 arXiv 研究揭示:增量命名实体识别中,新训练数据携带的「上下文偏见」会加速模型遗忘旧知识 论文提出类型平衡上下文学习(TBCL),用句子配对与一致性约束配平上下文,在 10 组 INER 设置上验证有效
OpenAI 宣称用 1 万个并发 AI 代理解出纳维-斯托克斯难题,约 90 年无人解开的千禧年大奖难题迎来新进展 学者质疑 OpenAI 可能使用了未公开研究数据;OpenAI 否认看过对方工作,但承认无法排除数据帮助改进模型
美团研究团队提出 ATLAS 评估框架,从「单次任务过程」与「长期交互连续性」双视角诊断 AI 服务智能体 在美团小团生产流量上验证:在线 A/B 实验显示用户参与度、下游业务指标、人工抽检质量三项同步提升
面壁智能与 OpenBMB 联合开源 2B 参数语言基座模型 MiniCPM5-2B,综合评测居全球 4B 以下开源基座模型第一 配套开源 Meshy 强化学习框架与 JustRL II 策略,验证「小模型 + 强化学习」的端侧通用 Agent 路线
AI 首次攻下千禧年难题:OpenAI 证明纳维-斯托克斯方程会在有限时间内破裂
开源 9B 模型经真实执行验证的数据微调后,在多项测试中追平了同家族 27B 大模型 论文同时发布 KOPA-Bench 基准,用韩国政府开放接口的 145 个真实任务考核多步工具调用能力
新研究用黑盒干预实验量化大模型自报解释的可靠性 模型自报的关键影响因素与实际决策相关度仅 0.35 至 0.58 研究者提供黑盒可靠性检查框架,可用于智能体监督与 AI 审计
DEX-Comp 两阶段训练方法,用蒸馏预热加困难探索突破老师水平:把 RAG 检索上下文压缩到十六分之一,推理加速最高 24 倍,回答质量与未压缩基线持平或更高。
HSRM 用约 2M 参数的隐藏状态奖励模型,不重读答案文本即可完成推理时验证,在 16 个生成器-数据集组合中的 15 个上达到或超过 55M 参数纯文本验证器。该论文已被 EMNLP 2026 接收。
Google Research 与以色列理工学院联合研究:模型答错的事实多数并非缺失,而是已编码却回忆失败 延长推理时间最多能找回 65% 的「假性遗忘」事实,扩容与 RAG 并非万能解药
北京理工大学在《科学》发表片上光谱计算新方法,高光谱图像无需回传服务器,在卫星或便携设备上即可现场实时解析 该成果为高光谱技术在遥感卫星、便携式检测设备等场景的实时应用提供了技术基础
arXiv:2608.31035 系统实测「人类主观感受当强化学习奖励」在语音生成模型上的可行性,论文已投稿 EMNLP 2026 三个关键结论:主观奖励不可互换、Best-of-8 重排序听感不输 GRPO、CER 区间约束是防转写漂移的关键防线
Meta 与 UIUC 研究者发布 EvoHarness-RL 训练框架,以 Qwen3-8B 在 ALFWorld 基准拿到 96.9% 平均成功率,追平 Claude Opus 4.5 把 Agent 的工具使用与状态管理从人工规则变成可训练行为,为预算敏感团队提供 8B 级模型逼近前沿表现的现实路径
斯坦福 CRFM 主导的 Marin 项目启动 5350 亿参数 MoE 模型全程公开训练,训练曲线、数据配方、失败与修改记录实时开放 11 套 NVIDIA GB200 NVL72 集群、18.75 万亿 Token,预计持续约 3 个月,JAX/XLA 栈上手写专家并行
清华大学与香港科技大学团队开源的 LiveEdit,以 4 步去噪实现 12.66 FPS 的实时流式视频编辑,论文与代码全部公开。 三阶段蒸馏把双向编辑能力迁移给因果模型,掩码缓存裁剪 70% 冗余 Token,已被 ECCV 2026 接收。