跳到正文
10月5日周一
  1. GitHub Blog · AI & ML50

    ReviewBench:面向 AI 代码审查的开源基准

    GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。

10月4日周日
  1. Hugging Face Blog80

    微软与 Hugging Face 联合发布 ThinkingBox 智能体基准

    微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。

    推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。

9月30日周三
  1. Hugging Face Blog43

    Open TTS Leaderboard:面向开源与多语种文本转语音及声音克隆的可扩展评测

    Hugging Face 推出 Open TTS Leaderboard,用客观指标评估文本转语音模型,把评测周期从数周压缩到数小时。评测涵盖可懂度(WER/CER)、速度(H200 上的 RTFx 与 TTFA)及说话人相似度(SIM)。截至 2026 年 9 月 30 日,Hub 上已有逾 8K 个 TTS 模型,但人工投票类榜单中开源模型占比偏低。