跳到正文
10月10日周六
10月9日周五
  1. Simon Willison40

    用语音构建博客新功能:Simon Willison 用 Codex 语音模式上线 Newsletters 页面

    Simon Willison 今日为个人博客上线 Newsletters 页面,收录其免费周更 Substack 与每月赞助专属更新的全部索引。该功能几乎完全通过 ChatGPT 桌面应用 Codex 标签下的语音对话模式完成,运行于本地开发环境,所用模型为 GPT-6 Astra High。作者一边做饭一边与电脑对话,通过预览页面追踪开发进度。

  2. Simon Willison21

    ttok 0.4 发布

    Simon Willison 发布 CLI 工具 ttok 0.4,用于基于 OpenAI 开源的 tiktoken 库统计 token 数量。本次更新修复了 Click 警告、更新了 CI,并新增 --list-models 命令以列出可用模型。该工具支持 uvx,可通过 `cat file.txt | uvx ttok` 的方式统计任意内容的 token。

10月8日周四
  1. Hugging Face Blog78

    用 HuggingChat 的 ML-Intern 在几天内造出六个没人做的模型

    作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。

    推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。

  2. GitHub Blog · AI & ML60

    GitHub 推送保护接入 ModernBERT 通用密钥检测模型

    GitHub 官方博客发文称,GitHub 上三分之一的拉取请求涉及 AI 智能体,过去一年带凭证的推送增长,GitHub 用 Microsoft Applied Sciences 微调的现代 BERT 分类器在不到两毫秒内评估候选密钥,能把可预防的密钥数量翻倍。

    推荐理由:GitHub 给出新分类器的精度、速度与成本数据,以及在不同产品线的开放节奏,可据此判断推送保护的边界变化。

10月7日周三
  1. Hugging Face Blog75

    微调 Nemotron 在 IOI 与 IMO 双双夺金

    Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。

    推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。

10月6日周二
  1. Mistral AI85

    Mistral 发布 Mistral Large 4 预览版

    Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。

    推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。

10月5日周一
  1. GitHub Blog · AI & ML50

    ReviewBench:面向 AI 代码审查的开源基准

    GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。

10月2日周五
9月29日周二
  1. Microsoft Research55

    微软发布 Quine 生物学 AI 研究系统

    微软研究发布 Quine,一个结合生物学多模态世界模型与连接科学工具、文献、湿实验室和研究人员的交互系统。与 Broad Institute 合作,用它在胰腺导管腺癌中预测并排序数千种化合物,湿实验验证中排名最高的化合物产生了最大的预期细胞状态转变,整个过程仅用一周周末。Quine 为实验性研究技术,仅限研究用途,暂通过 Quine Fellows 计划和特定科研合作开放访问。

9月26日周六
  1. GitHub Blog · AI & ML43

    GitHub Copilot 应用入门:用 canvases 构建自定义工作流

    GitHub Copilot 应用推出 canvases(canvas 扩展),一种用户与 AI 智能体共享、可定制的双向界面,可做成看板、发布清单、仪表盘或表格等。通过 /create-canvas 技能用自然语言描述即可生成界面,无需手写代码或设计,智能体会在右侧面板自动搭建并开放编辑。界面保存为扩展后可在项目内团队共享或存为个人扩展,用户与智能体可实时协同操作。

9月25日周五
  1. GitHub Blog · AI & ML68

    GitHub Security Lab 发布 Fuzzing Taskflow 自主模糊测试智能体

    GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。

    推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。

9月18日周五
  1. GitHub Blog · AI & ML24

    GitHub Podcast 拆解五个 AI 编程热门观点:读代码、用 AI、Skills 与 MCP、RAG 与微调

    GitHub Podcast 新一期节目拆解五个 AI 编程领域的热门观点。关于读代码:你仍需对代码负责,审查应随风险调整,而非逐行同等对待。关于用 AI:更强信号是判断力,能说清何时用 AI、何时手动、如何审查生成代码。Skills 与 MCP 解决不同问题,二者可共存而非二选一。RAG 并未消亡,只是不再是最新话题。微调模型以适配代码库,未必代表代码质量差。

9月9日周三
  1. Mistral AI53

    Mistral 用 AI 智能体将 4 万行 Fortran 77 现代化迁移到 C++

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型储层模拟器,无测试套件、无集中文档。原文指出,迁移完整系统需要架构级重构而非单纯语法翻译,并分享了三个可复用原则:迁移前先构建 parity harness 用数值一致性验证迁移结果;先把文档整理清楚再依赖智能体;在这个规模下,带人审关口的结构化工作流优于完全自主或纯人工。

8月20日周四
  1. Mistral AI65

    Mistral 发布 Agentic Search 检索层

    Mistral 发布 Agentic Search,通过多步检索循环让模型在复杂文档中查找、浏览、验证信息,通过 Mistral Search Toolkit 提供 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。

    推荐理由:官方发布检索层并给出跨两个基准的准确率、token 与延迟对比,可据此判断它对复杂文档检索的改进幅度。

8月17日周一
7月26日周日