微调 Nemotron 在 IOI 与 IMO 双双夺金
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。
推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。
微软研究院实习生开发了一套机器学习系统,对美国大陆 66,935 个变电站预测空间天气风险,可提前 30 至 60 分钟预警。系统结合 L1 拉格朗日点太阳风观测、地磁指数预测与地质电导率,生成分站点风险估计。2020—2026 年评估中,AE 预测 410.2 nT RMSE 优于经验基线,极端事件检测率达 64.1%。
微软研究发布 Quine,一个结合生物学多模态世界模型与连接科学工具、文献、湿实验室和研究人员的交互系统。与 Broad Institute 合作,用它在胰腺导管腺癌中预测并排序数千种化合物,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变,整个过程仅用一周周末。Quine 为实验性研究技术,仅限研究用途,暂通过 Quine Fellows 计划和特定科研合作开放访问。
微软研究团队在 Nature 发表合成预测模型 RetroChimera,将基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 两个互补子模型结合,用学习排序策略聚合预测,在罕见反应类型、零样本迁移和微调上表现良好。
Berkeley AI Research 提出 ABBEL 框架,将摘要信息内容以自然语言"信念状态"形式隔离并进行监督,以应对任务步数增多时 LLM 上下文无法无限扩展的问题。
Berkeley AI Research 提出自适应并行推理(Adaptive Parallel Reasoning),让推理模型自主决定何时分解、并行化相互独立的子任务,以及并发线程数量与协调方式。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 两种算法,用于在规模化下识别大语言模型中的关键交互。研究指出,模型行为源于复杂依赖与模式,随特征、训练数据点和模型组件数量增长,潜在交互数量指数级增长,穷尽分析在计算上不可行。文章阐述了基于消融(ablation)的归因思路,即通过移除组件观察预测变化来衡量影响。