微软 Decision-1 决策模型入局快速增长的 AI 决策模型竞赛
微软推出自有决策模型 Decision-1,基于 Qwen3.5-9B,面向分类、评估与路由等快速结构化决策。微软称其在近 15 万题、36 个 benchmark 中准确率最高,达 83.5%,延迟 85 ms,领先 Jev 1.13.0;速度是第二名 H2O-Lightning-4B 的 2.5 倍。
微软推出自有决策模型 Decision-1,基于 Qwen3.5-9B,面向分类、评估与路由等快速结构化决策。微软称其在近 15 万题、36 个 benchmark 中准确率最高,达 83.5%,延迟 85 ms,领先 Jev 1.13.0;速度是第二名 H2O-Lightning-4B 的 2.5 倍。
一项针对数百家公司的编码实践研究发现,人类代码审查成为 AI 编码工具效率的显著瓶颈,使用它们几乎没有带来软件产出增加或就业减少。哈佛大学研究者 Fiona Chen 与 James Stratton 基于 Jellyfish 的聚合分析数据得出结论:编码阶段提升的效率被生产流程下游约束吸收。
Simon Willison 今日为个人博客上线 Newsletters 页面,收录其免费周更 Substack 与每月赞助专属更新的全部索引。该功能几乎完全通过 ChatGPT 桌面应用 Codex 标签下的语音对话模式完成,运行于本地开发环境,所用模型为 GPT-6 Astra High。作者一边做饭一边与电脑对话,通过预览页面追踪开发进度。
Asana 在 Codex 中使用 GPT-6 Astra,将浏览器智能体成本降低 76 倍、速度提升 5 倍。这是 Asana 在测试中得出的结果,目的是为客户提供能力更强的模型。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 改为 GPT-5/GPT-6。
Simon Willison 发布 CLI 工具 ttok 0.4,用于基于 OpenAI 开源的 tiktoken 库统计 token 数量。本次更新修复了 Click 警告、更新了 CI,并新增 --list-models 命令以列出可用模型。该工具支持 uvx,可通过 `cat file.txt | uvx ttok` 的方式统计任意内容的 token。
LegalOn 将 Codex 的估算每日成本降低 65%,同时保持开发速度不变。它通过将任务匹配到 Astra、Sol 和 Luna,并战略性地管理预算来实现降本。
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
GitHub 官方博客发文称,GitHub 上三分之一的拉取请求涉及 AI 智能体,过去一年带凭证的推送增长,GitHub 用 Microsoft Applied Sciences 微调的现代 BERT 分类器在不到两毫秒内评估候选密钥,能把可预防的密钥数量翻倍。
推荐理由:GitHub 给出新分类器的精度、速度与成本数据,以及在不同产品线的开放节奏,可据此判断推送保护的边界变化。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。
推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。
GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。
GitHub 发文指出 AI 正在改变开发者工作方式,代码编写仍 Essential,但开发者 increasingly 需要学会指挥 AI、评估其输出、权衡取舍并做出正确技术决策。
GPT-6 Astra Ultrafast 已在 OpenAI API 及对格的 ChatGPT Work 与 Codex 用户中推出,基于 NVIDIA Blackwell GPU 运行。
微软研究发布 Quine,一个结合生物学多模态世界模型与连接科学工具、文献、湿实验室和研究人员的交互系统。与 Broad Institute 合作,用它在胰腺导管腺癌中预测并排序数千种化合物,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变,整个过程仅用一周周末。Quine 为实验性研究技术,仅限研究用途,暂通过 Quine Fellows 计划和特定科研合作开放访问。
GitHub Copilot 应用推出 canvases(canvas 扩展),一种用户与 AI 智能体共享、可定制的双向界面,可做成看板、发布清单、仪表盘或表格等。通过 /create-canvas 技能用自然语言描述即可生成界面,无需手写代码或设计,智能体会在右侧面板自动搭建并开放编辑。界面保存为扩展后可在项目内团队共享或存为个人扩展,用户与智能体可实时协同操作。
GitHub Copilot 应用中的 canvas 是一种运行在应用内、无浏览器界面的全栈应用,可与 GitHub Copilot 智能体双向通信。它能调用第三方 API,也能在本机执行代码,例如用于浏览和管理本地包的 Winget 界面、操作 SQLite 数据库,甚至还原 Windows Live Writer。
GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。
推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。
GitHub Podcast 新一期节目拆解五个 AI 编程领域的热门观点。关于读代码:你仍需对代码负责,审查应随风险调整,而非逐行同等对待。关于用 AI:更强信号是判断力,能说清何时用 AI、何时手动、如何审查生成代码。Skills 与 MCP 解决不同问题,二者可共存而非二选一。RAG 并未消亡,只是不再是最新话题。微调模型以适配代码库,未必代表代码质量差。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型储层模拟器,无测试套件、无集中文档。原文指出,迁移完整系统需要架构级重构而非单纯语法翻译,并分享了三个可复用原则:迁移前先构建 parity harness 用数值一致性验证迁移结果;先把文档整理清楚再依赖智能体;在这个规模下,带人审关口的结构化工作流优于完全自主或纯人工。
Mistral 发布 Agentic Search,通过多步检索循环让模型在复杂文档中查找、浏览、验证信息,通过 Mistral Search Toolkit 提供 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。
推荐理由:官方发布检索层并给出跨两个基准的准确率、token 与延迟对比,可据此判断它对复杂文档检索的改进幅度。
DiG-bench(Discovery in Games)通过 70 个隐藏规则的游戏,衡量 AI 系统通过自主探索发现环境隐含规则的能力。测试中 Opus 5 和 Fable 5 配合 Claude Code 整体表现最佳,仅二者能在最高 Tier 7 完成部分任务,前沿模型仍远逊于人类。
Berkeley AI Research 提出 ABBEL 框架,将摘要信息内容以自然语言"信念状态"形式隔离并进行监督,以应对任务步数增多时 LLM 上下文无法无限扩展的问题。