Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
GitHub 官方博客发文称,GitHub 上三分之一的拉取请求涉及 AI 智能体,过去一年带凭证的推送增长,GitHub 用 Microsoft Applied Sciences 微调的现代 BERT 分类器在不到两毫秒内评估候选密钥,能把可预防的密钥数量翻倍。
推荐理由:GitHub 给出新分类器的精度、速度与成本数据,以及在不同产品线的开放节奏,可据此判断推送保护的边界变化。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。
推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。
GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。
推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。
Mistral 发布 Agentic Search,通过多步检索循环让模型在复杂文档中查找、浏览、验证信息,通过 Mistral Search Toolkit 提供 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。
推荐理由:官方发布检索层并给出跨两个基准的准确率、token 与延迟对比,可据此判断它对复杂文档检索的改进幅度。