2026年9月 Amazon Bedrock、AgentCore 与 Strands 更新回顾
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
Postman 与 AWS 介绍在 Amazon Bedrock 上为 4000 万开发者运行 Agent Mode 的架构模式。Agent Mode 直接对 Postman 应用推理,通过 Amazon Bedrock 访问 Claude 系列模型,并支持跨 Region 推理、模型相关的零数据保留和分层 prompt 缓存。
推荐理由:Postman 给出在成熟产品里落地 Agent 的可复用工程模式,工具选择、schema 读取和上下文管理都可迁移。
Ai2 的 AI 基础设施团队将基于优先级的 GPU 调度器替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,把"每个研究项目该得多少 GPU 时间"从个案谈判转为透明的行政预算流程。
Asana 在 Codex 中使用 GPT-6 Astra,将浏览器智能体成本降低 76 倍、速度提升 5 倍。这是 Asana 在测试中得出的结果,目的是为客户提供能力更强的模型。
Sophos 使用 OpenAI 的 Daybreak 将网络安全威胁调查时间缩短 96%,并在保留人工监督的前提下自动化了 52% 的 MDR 案例。
开发者将 GPT-6 Astra、Claude Fable 5 等前沿 AI 模型与 NVIDIA Omniverse 库结合,用自然语言指令驱动 AI 智能体,完成物理、渲染和传感器仿真,把仿真创意转化为可运行的应用。
Amazon Bedrock AgentCore payments 现已正式可用,给智能体提供托管式按需付款能力,处理支付协议、连接钱包、签署交易并强制消费上限。
Amazon SageMaker HyperPod 提供基于 Amazon EKS 或 Slurm 编排的大规模计算集群,自动处理节点健康监控、故障恢复与集群生命周期管理。
Oracle 在招聘、工程和运营中,借助 ChatGPT Work 和 Codex 将专家知识转化为快速、可重复的工作流,把过去需要数天的工作压缩到几分钟完成。该方案覆盖招聘、工程与运营三大场景,实现专家知识的标准化复用。
《战争机器:E-Day》于 10 月 6 日全球发售后登陆 GeForce NOW,Ultimate 会员可体验 RTX 5080 级云性能,并支持 NVIDIA DLSS 与 NVIDIA Reflex 技术,可在笔记本、Mac、移动设备、掌机及 Firefox 等浏览器上运行。
LegalOn 将 Codex 的估算每日成本降低 65%,同时保持开发速度不变。它通过将任务匹配到 Astra、Sol 和 Luna,并战略性地管理预算来实现降本。
Pollo AI 结合 GPT-5.6、GPT-6 Astra 与 GPT‑Image‑2.5,帮助创作者将大胆创意转化为精细图像与电影级视频广告。该能力依托 OpenAI 的模型实现,面向内容创作者提供从创意到视觉素材的生成支持。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
OpenAI 捣毁两起由 AI 驱动的影响力行动,这些行动借助伪装成记者的虚假身份与一家智库传播地缘政治信息。该行动揭示了生成式 AI 被滥用于制造虚假叙事、操纵公众舆论的风险。
AWS 在 Amazon Bedrock 和 Claude Platform on AWS 上线 Claude Haiku 5.5,这是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发、成本敏感型任务。
在旧金山微软活动上,NVIDIA 与微软共同展示为 AI 智能体在 Windows 电脑上运行的软硬件。微软宣布 Microsoft Execution Containers(MXC)正式可用,作为操作系统级基础设施让智能体在后台安全、持久运行。
推荐理由:NVIDIA 把完整 AI 栈带入 Windows 本地,给出 RTX Spark 硬件规格与 DGX Station 的本地算力,开发者可据此判断端侧 Agent 的落地路径。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时直接调用权威数据源 API 进行实时访问控制列表(ACL)校验,解决企业 RAG 中 AI 回答越权泄露敏感文档的问题。
GitHub 官方博客发文称,GitHub 上三分之一的拉取请求涉及 AI 智能体,过去一年带凭证的推送增长,GitHub 用 Microsoft Applied Sciences 微调的现代 BERT 分类器在不到两毫秒内评估候选密钥,能把可预防的密钥数量翻倍。
推荐理由:GitHub 给出新分类器的精度、速度与成本数据,以及在不同产品线的开放节奏,可据此判断推送保护的边界变化。
Liquid AI 发布 d1 决策模型系列中的 d1-3B 与实验性 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,超过所有 4B 和 9B 模型及 Decider 35B-A3B。
推荐理由:Liquid AI 开源两款端侧决策模型,给出跨设备延迟与基准对比,可据此判断其在边缘场景的可用性。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
AWS 提出 Agentic Value Model,帮助 AI 卓越中心(AI CoE)领导者构建能捕捉智能体自动化全部价值的商业论证,而非沿用 RPA 时代的 ROI 模型。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,让员工用自然语言提问即可获得有据源、可验证的答案。自 2026 年 2 月全面推出以来,其智能体工具 Discovery Agent 已为客户带来超过 10 万项发现。
阿布扎比技术创新研究院(TII)发布 16 亿参数语音识别模型 Falcon-ASR,主打阿联酋方言,支持阿拉伯语、英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均词错误率 20.92%,优于榜单最佳发布结果 2.25 个百分点;内部阿联酋方言评测词错误率 22.73%,比 Qwen3-Omni 低 4.07 个百分点。
Hugging Face 官方博客称,Nemotron 通过监督微调(SFT)、强化学习(RL)与反馈式推理,在 IOI 2026 和 IMO 2026 都达到金牌级成绩。
推荐理由:Nemotron 通过 SFT、RL 与反馈式推理在 IOI 和 IMO 都拿到金牌级成绩,给出了可复用的微调配方。
OpenAI 将 College Planner 引入 ChatGPT for Teens,帮助学生管理大学申请,并新增闪卡、测验以及青少年 AI 委员会。College Planner 用于协助学生应对大学申请流程,配套闪卡与测验帮助学习,青少年 AI 委员会则为青少年参与 AI 相关讨论提供渠道。
雷迪森酒店集团与埃森哲合作,基于 OpenAI 技术构建 ChatGPT 插件,帮助旅客在规划行程时查找、对比并预订酒店。该插件将酒店搜索能力直接带入 ChatGPT,让旅客无需切换应用即可完成订房流程。
Google DeepMind 推出 EmbeddingGemma 2,基于 Gemma 4 架构、Apache 2.0 许可,740M 参数,原生将文本、代码、图像、视频和音频映射到统一嵌入空间。
推荐理由:原文给出参数规模、模块化配置、量化内存和上下文窗口等具体指标,读者可据此判断其端侧多模态检索的适用性。
微软研究员 Jennifer Neville 与 Microsoft Research 的 Chad Atalla 在微软研究播客中探讨评估在推动 AI 系统性能、满足用户需求中的作用,以及模型在传统 benchmark 之外被测试时出现的"令人意外的失败"。她分享了与当前 AI 系统协作的实用建议,并强调当结果违背预期时,仔细审视数据的重要性。
Google Earth AI 推出人口动态基础模型(PDFM),将搜索趋势、建成环境、环境因素等隐私保护信号压缩为月度更新的地点嵌入,无需任务微调即可作为即插即用输入增强现有 ML 模型。
推荐理由:官方给出跨五种疾病的独立验证结果,读者可据此判断地理空间嵌入如何增强现有流行病学建模。
NVIDIA 最新《电信业 AI 现状》报告显示,89% 的受访者认为开源模型与软件对其公司 AI 战略至关重要。开源模型为电信运营商带来五大战略价值:以更低成本获取前沿智能、支持电信场景定制、增强 AI 可信度、实现灵活安全部署,以及为政企客户提供本地化 AI 服务。
Mistral 官方发布 Mistral Large 4(ML4)预览版,可于 Mistral Studio 调用预览 API,权重将于本月底开放。这是其迄今最大、能力最强的模型,为万亿参数原生多模态架构,520 亿激活参数,在欧洲自有数据中心用 3800 块 NVIDIA Grace Blackwell GPU 训练。
推荐理由:官方发布万亿参数多模态模型并给出编码、安全、推理等基准表现,可据此判断其在开源模型中的竞争力。
Google 发布智能体隐私与安全前沿问题报告《Open and Emergent Problems in Agentic Privacy and Security。
GitHub 推出 ReviewBench,一个用于评估 AI 代码审查智能体的离线基准,可衡量审查系统在不同 pull request 下的发现能力与取舍。该基准基于对 103.9M GitHub pull request 的分布建模,包含 19 种语言、187 个公开开源仓库的 219 个 pull request,并采用多来源 golden set 与统一评分标准。
NVIDIA Inception 计划中的初创公司正用 AI 支持乳腺癌诊疗各环节。iSono Health 的 ATUSA 平台约两分钟完成一次乳腺扫描,敏感度比手持 2D 超声高 28%,已通过 FDA 认证并在加州、德州等地诊所商用;Whiterabbit.ai 的 WRDensity 软件自动评估乳腺密度,已用于数十万患者;Ataraxis AI 则通过数字病理切片预测治疗反应与复发风险。
微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。
推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。
GitHub 发文指出 AI 正在改变开发者工作方式,代码编写仍 Essential,但开发者 increasingly 需要学会指挥 AI、评估其输出、权衡取舍并做出正确技术决策。
Google 发布新一代联邦学习(FL)系统,借助可信执行环境(TEE)提供完全可验证、可审计的数据匿名化保证。新系统通过公开透明日志 Rekor、可复现构建的 KMS 与数据处理二进制、以及支持动态侧载的 TEE 执行,使只有差隐私模型权重对操作员可见。Gboard 已部署该系统,推出英文和日语的下一个词预测模型,隐私保证更强、准确率更高,训练时间较此前大幅缩短。
NVIDIA DGX Spark 将推出 64GB 统一内存配置,由 Acer、ASUS、Dell、Gigabyte、HP 和 MSI 等厂商提供,起售价 4,999 美元,10 月 23 日开售。
ServiceNow CoreAI 推出 AutoSynthData,用目标模型的失败和更强教师的成功决定该学什么,自动生成并校验可执行任务,随模型进步把课程转向仍难的部分。
推荐理由:ServiceNow 官方公布 AutoSynthData 用目标模型失败加更强教师成功自动生成并校验企业智能体训练任务的流程与实验数据。
GPT-6 Astra Ultrafast 已在 OpenAI API 及对格的 ChatGPT Work 与 Codex 用户中推出,基于 NVIDIA Blackwell GPU 运行。