微调 Nemotron 在 IOI 与 IMO 双双夺金
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,并新增闪卡、测验以及青少年 AI 委员会。College Planner 用于协助学生应对大学申请流程,配套闪卡与测验帮助学习,青少年 AI 委员会则为青少年参与 AI 相关讨论提供渠道。
雷迪森酒店集团与埃森哲合作,基于 OpenAI 技术构建 ChatGPT 插件,帮助旅客在规划行程时查找、对比并预订酒店。该插件将酒店搜索能力直接带入 ChatGPT,让旅客无需切换应用即可完成订房流程。
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生将文本、代码、图像、视频和音频映射到统一嵌入空间。
推荐理由:原文给出参数规模、模块化配置、量化内存和上下文窗口等具体指标,读者可据此判断其端侧多模态检索的适用性。
微软研究员 Jennifer Neville 与 Microsoft Research 的 Chad Atalla 在微软研究播客中探讨评估在推动 AI 系统性能、满足用户需求中的作用,以及模型在传统 benchmark 之外被测试时出现的"令人意外的失败"。她分享了与当前 AI 系统协作的实用建议,并强调当结果违背预期时,仔细审视数据的重要性。
Google Earth AI 推出人口动态基础模型(PDFM),将搜索趋势、建成环境、环境因素等隐私保护信号压缩为月度更新的地点嵌入,无需任务微调即可作为即插即用输入增强现有 ML 模型。
推荐理由:官方给出跨五种疾病的独立验证结果,读者可据此判断地理空间嵌入如何增强现有流行病学建模。
NVIDIA 最新《电信业 AI 现状》报告显示,89% 的受访者认为开源模型与软件对其公司 AI 战略至关重要。开源模型为电信运营商带来五大战略价值:以更低成本获取前沿智能、支持电信场景定制、增强 AI 可信度、实现灵活安全部署,以及为政企客户提供本地化 AI 服务。
Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。
推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。
Google 发布智能体隐私与安全前沿问题报告《Open and Emergent Problems in Agentic Privacy and Security。
GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。
企业 AI 智能体常因缺乏知识而难以真正落地生产,平均仅约 34% 的智能体项目能进入生产阶段。MIT Technology Review 基于 300 名数据、AI 等技术高管的调查显示,遗留数据系统、安全隐私顾虑及知识上下文缺失是主要失败点。数据碎片化被 55% 受访者列为扩展知识访问的首要挑战,领先企业则更关注安全隐私(72%)。
2026 年,企业 AI 的核心问题已从预测模型能否优于统计预测,转向如何让预测系统在不偏离业务意图的前提下自主行动。借助深度学习与生成式 AI 等技术,实时训练让 AI 持续演进而非等待季度更新,数据源也从规整数值记录扩展至杂乱的、富含洞见的非结构化交互。预测分析由此推动企业从被动回顾走向务实前瞻。
NVIDIA Inception 计划中的初创公司正用 AI 支持乳腺癌诊疗各环节。iSono Health 的 ATUSA 平台约两分钟完成一次乳腺扫描,敏感度比手持 2D 超声高 28%,已通过 FDA 认证并在加州、德州等地诊所商用;Whiterabbit.ai 的 WRDensity 软件自动评估乳腺密度,已用于数十万患者;Ataraxis AI 则通过数字病理切片预测治疗反应与复发风险。
Toby Ord 将 AI 群体(swarm)视为一种新的推理扩展方式,4-agent 群体约需两倍 token 达到同等性能,但因并行运行可将耗时减半。群体扩展存在边际收益递减的"踩脚"效应,规模扩大 10 倍仅能获得 3 至 5 倍性能提升。Google DeepMind 推出 SynthID Bio,为合成生物设计加水印以增强生物安全。
尽管公众对 AI 的态度日益矛盾——皮尤调查显示更多美国成年人认为 AI 会带来负面影响,斯坦福报告称全球逾半数人因 AI 产品感到紧张,但使用量仍在飙升:ChatGPT 于 5 月突破十亿月活用户,Gemini 7 月达 9.5 亿用户。作者认为,人们厌恶的并非技术本身,而是背后公司无休止地推广。目前美国 50 个州均已通过或提出 AI 相关法律,开源替代方案也为消费者选择提供了可能。
MIT Technology Review 的 EmTech Future 2026 大会围绕 AI 如何重塑生物、基础设施、制造业与科学展开,并探讨量子、能源系统、机器人等技术融合带来的挑战与机遇。
微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。
推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。
GitHub 发文指出 AI 正在改变开发者工作方式,代码编写仍 Essential,但开发者 increasingly 需要学会指挥 AI、评估其输出、权衡取舍并做出正确技术决策。
Google 发布新一代联邦学习(FL)系统,借助可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证。新系统通过公开透明日志 Rekor、可复现构建的 KMS 与数据处理二进制、以及支持动态侧载的 TEE 执行,使只有差隐私模型权重对操作员可见。Gboard 已部署该系统,推出英文和日语的下一个词预测模型,隐私保证更强、准确率更高,训练时间较此前大幅缩短。
NVIDIA DGX Spark 将推出 64GB 统一内存配置,由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商提供,起售价 4,999 美元,10 月 23 日开售。
ServiceNow CoreAI 推出 AutoSynthData,用目标模型的失败和更强教师的成功决定该学什么,自动生成并校验可执行任务,随模型进步把课程转向仍难的部分。
推荐理由:ServiceNow 官方公布 AutoSynthData 用目标模型失败加更强教师成功自动生成并校验企业智能体训练任务的流程与实验数据。
GPT-6 Astra Ultrafast 已在 OpenAI API 及对格的 ChatGPT Work 与 Codex 用户中推出,基于 NVIDIA Blackwell GPU 运行。
GeForce NOW 十月将上线 25 款新游戏,其中 6 款本周即可游玩。CONTROL Resonant 作为 Performance 和 Ultimate 会员奖励开放云串流。
微软研究院实习生开发了一套机器学习系统,对美国大陆 66,935 个变电站预测空间天气风险,可提前 30 至 60 分钟预警。系统结合 L1 拉格朗日点太阳风观测、地磁指数预测与地质电导率,生成分站点风险估计。2020—2026 年评估中,AE 预测 410.2 nT RMSE 优于经验基线,极端事件检测率达 64.1%。
Google DeepMind 推出 SynthID Bio,用于给 AI 生成的蛋白质加水印,同时保留其生物学功能。这是一项概念验证(proof of concept),旨在为 AI 生成的蛋白质内容提供水印标识。
Hugging Face 推出 Open TTS Leaderboard,用客观指标评估文本转语音模型,把评测周期从数周压缩到数小时。评测涵盖可懂度(WER/CER)、速度(H200 上的 RTFx 与 TTFA)及说话人相似度(SIM)。截至 2026 年 9 月 30 日,Hub 上已有逾 8K 个 TTS 模型,但人工投票类榜单中开源模型占比偏低。
微软研究发布 Quine,一个结合生物学多模态世界模型与连接科学工具、文献、湿实验室和研究人员的交互系统。与 Broad Institute 合作,用它在胰腺导管腺癌中预测并排序数千种化合物,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变,整个过程仅用一周周末。Quine 为实验性研究技术,仅限研究用途,暂通过 Quine Fellows 计划和特定科研合作开放访问。
2025年7月24日,微软亚洲研究院(新加坡)作为微软在东南亚的首个研究实验室正式启用,以连接微软前沿AI研究与新加坡高校、政府及产业生态。过去一年,其工作围绕下一代AI模型与智能体系统、面向真实场景的行业专用AI、AI原生研究实践及生态与人才培养四大支柱展开,在医疗、金融、教育等领域推动前沿研究向实际应用转化。新加坡经济发展局、IMDA等机构成为重要合作伙伴,共同培养新一代AI研究人才。
Mistral 在慕尼黑开设新总部,组建专注 Physics AI 与工业 AI 的研究团队,并配备直接服务企业伙伴的应用工程师。继 2026 年 5 月收购 Emmi AI 后,30 余名物理与工程 AI 领域的专家加入 Mistral。公司计划到 2030 年建成 1 吉瓦的欧洲算力,并与 BMW、Siemens Energy 合作开发面向欧洲重工业的 Physics AI 应用。
Jack Clark 的 Import AI 周刊聚焦多篇前沿内容。智谱用 GLM-5.3 构建 Infra Agent 自动化自身基础设施,将 GLM-5.3-Flash 从模型适配到生产就绪压缩到两周以内,端到端吞吐相对基线提升三倍。
GitHub Copilot 应用推出 canvases(canvas 扩展),一种用户与 AI 智能体共享、可定制的双向界面,可做成看板、发布清单、仪表盘或表格等。通过 /create-canvas 技能用自然语言描述即可生成界面,无需手写代码或设计,智能体会在右侧面板自动搭建并开放编辑。界面保存为扩展后可在项目内团队共享或存为个人扩展,用户与智能体可实时协同操作。
GitHub Copilot 应用中的 canvas 是一种运行在应用内、无浏览器界面的全栈应用,可与 GitHub Copilot 智能体双向通信。它能调用第三方 API,也能在本机执行代码,例如用于浏览和管理本地包的 Winget 界面、操作 SQLite 数据库,甚至还原 Windows Live Writer。
GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。
推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。
GitHub Copilot 应用重构了 pull request 视图,能在 2,200 个文件、超过百万行改动、400 多条内联评论的极端规模下保持流畅渲染。
微软研究团队称在移动操作负载上,把物理 AI 推理从机载 GPU 卸载到边缘或云 GPU 能提升任务成功率、支持更大模型并延长续航。实测显示较小 GPU 使映射规划最高慢 383%、导航障碍及时检测下降 30%、VLA 模型精度下降 50%,Jetson Thor 等大功率机载 GPU 使续航最多缩短 160%。
Google 向 Private AI Compute 平台引入持久、跨设备的服务端记忆,将云端内存变为安全数字保险库。用户数据存入专用加密存储,解密密钥仅保存在个人设备上,即使 Google 也无法访问。AI 模型访问信息时,通过端到端加密通道连接至云端安全飞地,临时解密处理请求后立即重新加密。
微软研究团队在 Nature 发表合成预测模型 RetroChimera,将基于 Transformer 的 R-SMILES 2 与基于图神经网络的 NeuralLoc 两个互补子模型结合,用学习排序策略聚合预测,在罕见反应类型、零样本迁移和微调上表现良好。
RAND 发布长篇论文,主张美国在通往超级智能的不确定道路上应采取"行动自由"战略,通过先期投入保留多种选项以获取地缘政治优势。论文将七种战略归为共存、准备、否认、加速三类,并列出危险临近度、共存可行性等五大不确定性。此外,研究者成功在脑组织被刻意削弱的小鼠体内培育部分人脑样组织,用于潜在的人-机混合实验。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实、保护隐私的基准数据。
GitHub Podcast 新一期节目拆解五个 AI 编程领域的热门观点。关于读代码:你仍需对代码负责,审查应随风险调整,而非逐行同等对待。关于用 AI:更强信号是判断力,能说清何时用 AI、何时手动、如何审查生成代码。Skills 与 MCP 解决不同问题,二者可共存而非二选一。RAG 并未消亡,只是不再是最新话题。微调模型以适配代码库,未必代表代码质量差。