2026年9月 Amazon Bedrock、AgentCore 与 Strands 更新回顾
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
Postman 与 AWS 介绍在 Amazon Bedrock 上为 4000 万开发者运行 Agent Mode 的架构模式。Agent Mode 直接对 Postman 应用推理,通过 Amazon Bedrock 访问 Claude 系列模型,并支持跨 Region 推理、模型相关的零数据保留和分层 prompt 缓存。
推荐理由:Postman 给出在成熟产品里落地 Agent 的可复用工程模式,工具选择、schema 读取和上下文管理都可迁移。
Ai2 的 AI 基础设施团队将基于优先级的 GPU 调度器替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,把"每个研究项目该得多少 GPU 时间"从个案谈判转为透明的行政预算流程。
Amazon Bedrock AgentCore payments 现已正式可用,给智能体提供托管式按需付款能力,处理支付协议、连接钱包、签署交易并强制消费上限。
Amazon SageMaker HyperPod 提供基于 Amazon EKS 或 Slurm 编排的大规模计算集群,自动处理节点健康监控、故障恢复与集群生命周期管理。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
AWS 在 Amazon Bedrock 和 Claude Platform on AWS 上线 Claude Haiku 5.5,这是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发、成本敏感型任务。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时直接调用权威数据源 API 进行实时访问控制列表(ACL)校验,解决企业 RAG 中 AI 回答越权泄露敏感文档的问题。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
AWS 提出 Agentic Value Model,帮助 AI 卓越中心(AI CoE)领导者构建能捕捉智能体自动化全部价值的商业论证,而非沿用 RPA 时代的 ROI 模型。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,让员工用自然语言提问即可获得有据源、可验证的答案。自 2026 年 2 月全面推出以来,其智能体工具 Discovery Agent 已为客户带来超过 10 万项发现。
GPT-6 Astra Ultrafast 已在 OpenAI API 及对格的 ChatGPT Work 与 Codex 用户中推出,基于 NVIDIA Blackwell GPU 运行。
GitHub Copilot 应用重构了 pull request 视图,能在 2,200 个文件、超过百万行改动、400 多条内联评论的极端规模下保持流畅渲染。
微软研究团队称在移动操作负载上,把物理 AI 推理从机载 GPU 卸载到边缘或云 GPU 能提升任务成功率、支持更大模型并延长续航。实测显示较小 GPU 使映射规划最高慢 383%、导航障碍及时检测下降 30%、VLA 模型精度下降 50%,Jetson Thor 等大功率机载 GPU 使续航最多缩短 160%。
Google 向 Private AI Compute 平台引入持久、跨设备的服务端记忆,将云端内存变为安全数字保险库。用户数据存入专用加密存储,解密密钥仅保存在个人设备上,即使 Google 也无法访问。AI 模型访问信息时,通过端到端加密通道连接至云端安全飞地,临时解密处理请求后立即重新加密。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,用于为中段物流(middle-mile)配送问题生成真实、保护隐私的基准数据。
Mistral 发布 Agentic Search,通过多步检索循环让模型在复杂文档中查找、浏览、验证信息,通过 Mistral Search Toolkit 提供 search、open、navigate、read、grep 五个工具,并内置于 Studio 和 Vibe。
推荐理由:官方发布检索层并给出跨两个基准的准确率、token 与延迟对比,可据此判断它对复杂文档检索的改进幅度。
Berkeley AI Research 基于 K-Search 进化型内核搜索框架,新增 MLX 后端,并开发 CUDA-to-MLX 结构化翻译层,将现有 CUDA 内核作为知识库,适配为 Apple Silicon 上的高质量 GPU 内核,而非从零重建。
Berkeley AI Research 提出自适应并行推理(Adaptive Parallel Reasoning),让推理模型自主决定何时分解、并行化相互独立的子任务,以及并发线程数量与协调方式。