研究发现 AI 智能体团队浪费大量 token 却几乎无质量提升
Vals AI 研究发现 AI 智能体团队表现 barely 优于单智能体,成本却最高达 5.1 倍,GPT-6 Sol 与 Claude Opus 5.5 的四项测试中仅一项有可测增益。Anthropic 自身数据也显示超过十个智能体后质量趋于 plateau 而 token 成本持续上升。
Vals AI 研究发现 AI 智能体团队表现 barely 优于单智能体,成本却最高达 5.1 倍,GPT-6 Sol 与 Claude Opus 5.5 的四项测试中仅一项有可测增益。Anthropic 自身数据也显示超过十个智能体后质量趋于 plateau 而 token 成本持续上升。
Epoch AI 与 Anthropic 独立发现,GPT-5.6 Sol 与 Claude Fable 5 等当前模型能做实验,却缺乏科学自我批判与真正的创造性思维。Sol 最好仅达到人类参考分的 15%,且方法均为研究者早已掌握者。模型最大短板仍是无法批判地质疑自身结果。
一项针对数百家公司的编码实践研究发现,人类代码审查成为 AI 编码工具效率的显著瓶颈,使用它们几乎没有带来软件产出增加或就业减少。哈佛大学研究者 Fiona Chen 与 James Stratton 基于 Jellyfish 的聚合分析数据得出结论:编码阶段提升的效率被生产流程下游约束吸收。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Google Earth AI 推出人口动态基础模型(PDFM),将搜索趋势、建成环境、环境因素等隐私保护信号压缩为月度更新的地点嵌入,无需任务微调即可作为即插即用输入增强现有 ML 模型。
推荐理由:官方给出跨五种疾病的独立验证结果,读者可据此判断地理空间嵌入如何增强现有流行病学建模。
Google 发布智能体隐私与安全前沿问题报告《Open and Emergent Problems in Agentic Privacy and Security。
GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。
微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。
推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。
微软研究院实习生开发了一套机器学习系统,对美国大陆 66,935 个变电站预测空间天气风险,可提前 30 至 60 分钟预警。系统结合 L1 拉格朗日点太阳风观测、地磁指数预测与地质电导率,生成分站点风险估计。2020—2026 年评估中,AE 预测 410.2 nT RMSE 优于经验基线,极端事件检测率达 64.1%。
微软研究团队在 Nature 发表合成预测模型 RetroChimera,将基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 两个互补子模型结合,用学习排序策略聚合预测,在罕见反应类型、零样本迁移和微调上表现良好。
DiG-bench(Discovery in Games)通过 70 个隐藏规则的游戏,衡量 AI 系统通过自主探索发现环境隐含规则的能力。测试中 Opus 5 和 Fable 5 配合 Claude Code 整体表现最佳,仅二者能在最高 Tier 7 完成部分任务,前沿模型仍远逊于人类。
Berkeley AI Research 提出自适应并行推理(Adaptive Parallel Reasoning),让推理模型自主决定何时分解、并行化相互独立的子任务,以及并发线程数量与协调方式。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 两种算法,用于在规模化下识别大语言模型中的关键交互。研究指出,模型行为源于复杂依赖与模式,随特征、训练数据点和模型组件数量增长,潜在交互数量指数级增长,穷尽分析在计算上不可行。文章阐述了基于消融(ablation)的归因思路,即通过移除组件观察预测变化来衡量影响。
Berkeley AI Research 提出基于信息内容直接评估与优化成像系统的框架。在 NeurIPS 2025 论文中,该信息指标在四个成像领域预测系统性能,优化它所得设计可匹配最先进的端到端方法,同时需要更少的内存、算力,且无需任务特定的解码器设计。互信息衡量测量值减少关于目标不确定性的程度,相同互信息的两个系统区分目标的能力等价。