2026年9月 Amazon Bedrock、AgentCore 与 Strands 更新回顾
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
2026年9月,AWS 对 Amazon Bedrock、Amazon Bedrock AgentCore 和 Strands 进行更新,扩展模型选择并提升智能体运行效率。
Postman 与 AWS 介绍在 Amazon Bedrock 上为 4000 万开发者运行 Agent Mode 的架构模式。Agent Mode 直接对 Postman 应用推理,通过 Amazon Bedrock 访问 Claude 系列模型,并支持跨 Region 推理、模型相关的零数据保留和分层 prompt 缓存。
推荐理由:Postman 给出在成熟产品里落地 Agent 的可复用工程模式,工具选择、schema 读取和上下文管理都可迁移。
Ai2 的 AI 基础设施团队将基于优先级的 GPU 调度器替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,把"每个研究项目该得多少 GPU 时间"从个案谈判转为透明的行政预算流程。
Matthew Green 在 Twitter 上指出,AI 生成惊喜的速度与人类更新标准(即便有最强 AI 辅助)的速度相差数个数量级,唯有提前准备才能从这类意外中恢复。
Simon Willison 今日为个人博客上线 Newsletters 页面,收录其免费周更 Substack 与每月赞助专属更新的全部索引。该功能几乎完全通过 ChatGPT 桌面应用 Codex 标签下的语音对话模式完成,运行于本地开发环境,所用模型为 GPT-6 Astra High。作者一边做饭一边与电脑对话,通过预览页面追踪开发进度。
MIT Technology Review 记者 Arthur Holland Michel 撰文指出,现代大模型已将“拒绝”内化为安全核心机制,但这一机制并不可靠。
Asana 在 Codex 中使用 GPT-6 Astra,将浏览器智能体成本降低 76 倍、速度提升 5 倍。这是 Asana 在测试中得出的结果,目的是为客户提供能力更强的模型。
Sophos 使用 OpenAI 的 Daybreak 将网络安全威胁调查时间缩短 96%,并在保留人工监督的前提下自动化了 52% 的 MDR 案例。
Simon Willison 发布 ttok 1.0,将默认 tokenizer 从 GPT-4 改为 GPT-5/GPT-6。
2025 年斯坦福大学博士生 Samuel King 用生成式 AI 模型提出了微观病毒的基因蓝图,虽尚未构成 AI 生成的生命,但下一步或可实现。MIT Technology Review 资深 AI 记者 James O'Donnell 将采访 King,探讨其研究、入选《MIT Technology Review》35 位创新者,以及观察生物学的新方式。
Simon Willison 发布 CLI 工具 ttok 0.4,用于基于 OpenAI 开源的 tiktoken 库统计 token 数量。本次更新修复了 Click 警告、更新了 CI,并新增 --list-models 命令以列出可用模型。该工具支持 uvx,可通过 `cat file.txt | uvx ttok` 的方式统计任意内容的 token。
OpenAI 解雇 Tomek Korbak、Mikita Balesni 与 Jasmine Wang 三名安全研究员,三人称因"将安全置于公司短期利益之上"被辞退,涉及 METR 审计与 agent 越狱事件。
开发者将 GPT-6 Astra、Claude Fable 5 等前沿 AI 模型与 NVIDIA Omniverse 库结合,用自然语言指令驱动 AI 智能体,完成物理、渲染和传感器仿真,把仿真创意转化为可运行的应用。
Amazon Bedrock AgentCore payments 现已正式可用,给智能体提供托管式按需付款能力,处理支付协议、连接钱包、签署交易并强制消费上限。
Latent Space 访谈 Periodic Labs 的 Liam Fedus 与 Ekin Doğuş Çubuk,讨论他们如何把强化学习建立在真实物理实验室的数据上,用 X 射线衍射、密度泛函理论和高通量实验构成材料发现闭环。他们认为科学发现与数学、编码不同,需要在噪声、不确定性和信息缺失下做推理,失败实验可能是最有价值的训练数据,并希望通过自动化实验室把数十年的科学试错压缩到几个月。
Amazon SageMaker HyperPod 提供基于 Amazon EKS 或 Slurm 编排的大规模计算集群,自动处理节点健康监控、故障恢复与集群生命周期管理。
Oracle 在招聘、工程和运营中,借助 ChatGPT Work 和 Codex 将专家知识转化为快速、可重复的工作流,把过去需要数天的工作压缩到几分钟完成。该方案覆盖招聘、工程与运营三大场景,实现专家知识的标准化复用。
《战争机器:E-Day》于 10 月 6 日全球发售后登陆 GeForce NOW,Ultimate 会员可体验 RTX 5080 级云性能,并支持 NVIDIA DLSS 与 NVIDIA Reflex 技术,可在笔记本、Mac、移动设备、掌机及 Firefox 等浏览器上运行。
LegalOn 将 Codex 的估算每日成本降低 65%,同时保持开发速度不变。它通过将任务匹配到 Astra、Sol 和 Luna,并战略性地管理预算来实现降本。
Pollo AI 结合 GPT-5.6、GPT-6 Astra 与 GPT‑Image‑2.5,帮助创作者将大胆创意转化为精细图像与电影级视频广告。该能力依托 OpenAI 的模型实现,面向内容创作者提供从创意到视觉素材的生成支持。
Nvidia 推出面向物理 AI 的全栈安全解决方案,目前已被多家机器人公司采用。该方案旨在提升 robotaxi 与人形机器人的安全性,是 Nvidia 在物理 AI 领域的重要布局。
特斯拉 Optimus 等 AI 人形机器人被寄予厚望,马斯克称其或成史上最大产品,但多数机器人研究者对"用 ChatGPT、Claude 同类 AI 让机器人掌握物理世界"的假设持怀疑态度。
AVEVA 首席技术官 Arti Garg 认为,工业 AI 正进入新阶段,基础模型、物理 AI 与智能体 AI 让更复杂任务的自动化成为可能,但工业 AI 可直接作用于物理系统,意外决策可能危及安全、可靠性与关键基础设施。AVEVA 的责任 AI 框架强调安全、效率与人类安全及监督,主张 AI 应增强而非取代关键决策中的人,并用护栏界定自动化系统可行动与仍需人类监督的边界。
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
微软在时隔两年的首场发布会推出 Surface Laptop Ultra,这是首款搭载 Nvidia RTX Spark SoC 的设备,起售价 2599 美元,10 月 16 日开始发货,现已开放预购。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
OpenAI 捣毁两起由 AI 驱动的影响力行动,这些行动借助伪装成记者的虚假身份与一家智库传播地缘政治信息。该行动揭示了生成式 AI 被滥用于制造虚假叙事、操纵公众舆论的风险。
开发者 Brandon Thomas 用 Anthropic 的 Claude Opus 5.5 通过 AI 逆向工程,用 Rust(附 WebAssembly 浏览器版)打造 Adobe 软件的"洁净室"开源替代品。
AWS 在 Amazon Bedrock 和 Claude Platform on AWS 上线 Claude Haiku 5.5,这是 Claude 5.5 家族中速度最快、效率最高的模型,面向子智能体和高并发、成本敏感型任务。
在旧金山微软活动上,NVIDIA 与微软共同展示为 AI 智能体在 Windows 电脑上运行的软硬件。微软宣布 Microsoft Execution Containers(MXC)正式可用,作为操作系统级基础设施让智能体在后台安全、持久运行。
推荐理由:NVIDIA 把完整 AI 栈带入 Windows 本地,给出 RTX Spark 硬件规格与 DGX Station 的本地算力,开发者可据此判断端侧 Agent 的落地路径。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时直接调用权威数据源 API 进行实时访问控制列表(ACL)校验,解决企业 RAG 中 AI 回答越权泄露敏感文档的问题。
一名男子因利用 AI 方案盗取约 800 万美元音乐流媒体版税,被判处 18 个月监禁。他使用 10K 个机器人账号和 AI 生成的歌曲进行 outstream 刷量,从而骗取 Taylor Swift 等艺人的流媒体版税分成。
GitHub 官方博客发文称,GitHub 上三分之一的拉取请求涉及 AI 智能体,过去一年带凭证的推送增长,GitHub 用 Microsoft Applied Sciences 微调的现代 BERT 分类器在不到两毫秒内评估候选密钥,能把可预防的密钥数量翻倍。
推荐理由:GitHub 给出新分类器的精度、速度与成本数据,以及在不同产品线的开放节奏,可据此判断推送保护的边界变化。
Liquid AI 发布 d1 决策模型系列中的 d1-3B 与实验性 d1-omni-600M。d1-3B 在 Decision Index 0.2.1 上得分 48.57,超过所有 4B 和 9B 模型及 Decider 35B-A3B。
推荐理由:Liquid AI 开源两款端侧决策模型,给出跨设备延迟与基准对比,可据此判断其在边缘场景的可用性。
微软亚洲研究院开源 Agent Lightning v1.0,提出 Harnessed Agentic RL 范式,让部署用的 agent harness 直接参与强化学习,无需在训练框架内重建智能体。
推荐理由:框架用真实 harness 直接参与 RL 训练并原生支持 Kubernetes,方法可迁移到自有智能体训练。
AWS 提出 Agentic Value Model,帮助 AI 卓越中心(AI CoE)领导者构建能捕捉智能体自动化全部价值的商业论证,而非沿用 RPA 时代的 ROI 模型。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,让员工用自然语言提问即可获得有据源、可验证的答案。自 2026 年 2 月全面推出以来,其智能体工具 Discovery Agent 已为客户带来超过 10 万项发现。
Mistral 表示 Le Chonk 能够与顶级闭源模型相抗衡,同时保持开源权重。该模型主打在开放权重的前提下挑战当前最强的 AI 模型表现。
Stacklok 由两位 Kubernetes 创始人 Craig McLuckie 与 Joe Beda 创立,正把业务从软件供应链安全转向基于 Kubernetes 的 agent 基础设施。
阿布扎比技术创新研究院(TII)发布 16 亿参数语音识别模型 Falcon-ASR,主打阿联酋方言,支持阿拉伯语、英语、法语、西班牙语和葡萄牙语。在六个阿拉伯语测试集上平均词错误率 20.92%,优于榜单最佳发布结果 2.25 个百分点;内部阿联酋方言评测词错误率 22.73%,比 Qwen3-Omni 低 4.07 个百分点。