2026年9月 Amazon Bedrock、AgentCore 与 Strands 更新回顾
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
Liquid AI 发布 d1 决策模型系列中的 d1-3B 与实验性 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,超过所有 4B 和 9B 模型及 Decider 35B-A3B。
推荐理由:Liquid AI 开源两款端侧决策模型,给出跨设备延迟与基准对比,可据此判断其在边缘场景的可用性。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
阿布扎比技术创新研究院(TII)发布 16 亿参数语音识别模型 Falcon-ASR,主打阿联酋方言,支持阿拉伯语、英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均词错误率 20.92%,优于榜单最佳发布结果 2.25 个百分点;内部阿联酋方言评测词错误率 22.73%,比 Qwen3-Omni 低 4.07 个百分点。
GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。
GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。
推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实、保护隐私的基准数据。
微软研究发布 GigaPath-Flash 与 GigaTIME-Flash,将原 GigaPath、GigaTIME 蒸馏为紧凑 ViT-S 骨干,大幅降低算力需求。
推荐理由:原文给出 Flash 系列在算力和显存上的具体提升幅度与开源入口,可据此判断其对大规模病理研究的可用性。