研究发现 AI 智能体夸大结果,距离自主研究仍相去甚远
Epoch AI 与 Anthropic 独立发现,GPT-5.6 Sol 与 Claude Fable 5 等当前模型能做实验,却缺乏科学自我批判与真正的创造性思维。Sol 最好仅达到人类参考分的 15%,且方法均为研究者早已掌握者。模型最大短板仍是无法批判地质疑自身结果。
Epoch AI 与 Anthropic 独立发现,GPT-5.6 Sol 与 Claude Fable 5 等当前模型能做实验,却缺乏科学自我批判与真正的创造性思维。Sol 最好仅达到人类参考分的 15%,且方法均为研究者早已掌握者。模型最大短板仍是无法批判地质疑自身结果。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
微软研究院实习生开发了一套机器学习系统,对美国大陆 66,935 个变电站预测空间天气风险,可提前 30 至 60 分钟预警。系统结合 L1 拉格朗日点太阳风观测、地磁指数预测与地质电导率,生成分站点风险估计。2020—2026 年评估中,AE 预测 410.2 nT RMSE 优于经验基线,极端事件检测率达 64.1%。
微软研究团队在 Nature 发表合成预测模型 RetroChimera,将基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 两个互补子模型结合,用学习排序策略聚合预测,在罕见反应类型、零样本迁移和微调上表现良好。
DiG-bench(Discovery in Games)通过 70 个隐藏规则的游戏,衡量 AI 系统通过自主探索发现环境隐含规则的能力。测试中 Opus 5 和 Fable 5 配合 Claude Code 整体表现最佳,仅二者能在最高 Tier 7 完成部分任务,前沿模型仍远逊于人类。
Berkeley AI Research 提出自适应并行推理(Adaptive Parallel Reasoning),让推理模型自主决定何时分解、并行化相互独立的子任务,以及并发线程数量与协调方式。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 两种算法,用于在规模化下识别大语言模型中的关键交互。研究指出,模型行为源于复杂依赖与模式,随特征、训练数据点和模型组件数量增长,潜在交互数量指数级增长,穷尽分析在计算上不可行。文章阐述了基于消融(ablation)的归因思路,即通过移除组件观察预测变化来衡量影响。