本地运行 AI 令人兴奋、 overwhelm 又令人沮丧
作者开始在日常中真正使用本地 AI,在 256GB 统一内存的 M5 Ultra Mac Studio 上安装了开源的自托管 AI 智能体桌面应用 Hermes Agent,并运行了 1250 亿参数、约 105GB 的 Qwen 3.8 Flash Next 模型。
作者开始在日常中真正使用本地 AI,在 256GB 统一内存的 M5 Ultra Mac Studio 上安装了开源的自托管 AI 智能体桌面应用 Hermes Agent,并运行了 1250 亿参数、约 105GB 的 Qwen 3.8 Flash Next 模型。
GitHub 的 actions/python-versions 已加入 Python 3.15.0 稳定版。现在可以在 GitHub Actions 的测试矩阵中添加 "3.15",对新的 Python 3.15.0 版本运行测试。Simon Willison 称为此等待了数天,甚至让 ChatGPT 帮忙留意该更新。
Postman 与 AWS 介绍在 Amazon Bedrock 上为 4000 万开发者运行 Agent Mode 的架构模式。Agent Mode 直接对 Postman 应用推理,通过 Amazon Bedrock 访问 Claude 系列模型,并支持跨 Region 推理、模型相关的零数据保留和分层 prompt 缓存。
推荐理由:Postman 给出在成熟产品里落地 Agent 的可复用工程模式,工具选择、schema 读取和上下文管理都可迁移。
Ai2 的 AI 基础设施团队将基于优先级的 GPU 调度器替换为包含 GPU 时间预算、分层公平共享分配和时间切片契约的新系统,把"每个研究项目该得多少 GPU 时间"从个案谈判转为透明的行政预算流程。
Simon Willison 今日为个人博客上线 Newsletters 页面,收录其免费周更 Substack 与每月赞助专属更新的全部索引。该功能几乎完全通过 ChatGPT 桌面应用 Codex 标签下的语音对话模式完成,运行于本地开发环境,所用模型为 GPT-6 Astra High。作者一边做饭一边与电脑对话,通过预览页面追踪开发进度。
Amazon SageMaker HyperPod 提供基于 Amazon EKS 或 Slurm 编排的大规模计算集群,自动处理节点健康监控、故障恢复与集群生命周期管理。
LegalOn 将 Codex 的估算每日成本降低 65%,同时保持开发速度不变。它通过将任务匹配到 Astra、Sol 和 Luna,并战略性地管理预算来实现降本。
作者想做一个 Qwen-Image 2.1 自带 prompt rewriter 的小版本,官方 9B 模型需要约 20GB 显存,于是向 HuggingChat 的 ML-Intern 描述需求,次日就得到了可在 CPU 上运行的 0.8B 版本。
推荐理由:作者用 HuggingChat 的 ML-Intern 在几天内以约 103 美元完成六个模型,给出了可迁移的提示词结构和预算控制方法。
Amazon Quick 与 Amazon Bedrock Knowledge Bases 通过查询时直接调用权威数据源 API 进行实时访问控制列表(ACL)校验,解决企业 RAG 中 AI 回答越权泄露敏感文档的问题。
AWS 提出 Agentic Value Model,帮助 AI 卓越中心(AI CoE)领导者构建能捕捉智能体自动化全部价值的商业论证,而非沿用 RPA 时代的 ROI 模型。
Qlik 基于 Amazon Bedrock 构建 Qlik Answers,让员工用自然语言提问即可获得有据源、可验证的答案。自 2026 年 2 月全面推出以来,其智能体工具 Discovery Agent 已为客户带来超过 10 万项发现。
GitHub 发文指出 AI 正在改变开发者工作方式,代码编写仍 Essential,但开发者 increasingly 需要学会指挥 AI、评估其输出、权衡取舍并做出正确技术决策。
ServiceNow CoreAI 推出 AutoSynthData,用目标模型的失败和更强教师的成功决定该学什么,自动生成并校验可执行任务,随模型进步把课程转向仍难的部分。
推荐理由:ServiceNow 官方公布 AutoSynthData 用目标模型失败加更强教师成功自动生成并校验企业智能体训练任务的流程与实验数据。
GitHub 安全实验室推出 Fuzzing Taskflow,一个面向 C/C++ 项目的自主模糊测试流水线。你只需指向一个 GitHub 仓库,它会自动识别入口点、分析构建系统、编写 harness、运行 AFL++、读取覆盖率报告、改进 harness、分类每个崩溃,并为每个唯一漏洞撰写报告。
推荐理由:作者给出可复用的自主模糊测试流水线,用 LLM 智能体接管 harness 编写、覆盖率反馈与崩溃分类,值得安全研究者参考。
GitHub Copilot 应用重构了 pull request 视图,能在 2,200 个文件、超过百万行改动、400 多条内联评论的极端规模下保持流畅渲染。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 迁移到 C++,这是一个物理密集型储层模拟器,无测试套件、无集中文档。原文指出,迁移完整系统需要架构级重构而非单纯语法翻译,并分享了三个可复用原则:迁移前先构建 parity harness 用数值一致性验证迁移结果;先把文档整理清楚再依赖智能体;在这个规模下,带人审关口的结构化工作流优于完全自主或纯人工。
Berkeley AI Research 基于 K-Search 进化型内核搜索框架,新增 MLX 后端,并开发 CUDA-to-MLX 结构化翻译层,将现有 CUDA 内核作为知识库,适配为 Apple Silicon 上的高质量 GPU 内核,而非从零重建。
Berkeley AI Research 提出 ABBEL 框架,将摘要信息内容以自然语言"信念状态"形式隔离并进行监督,以应对任务步数增多时 LLM 上下文无法无限扩展的问题。
Berkeley AI Research 提出 GRASP,一种用于学习动力学(世界模型)的基于梯度的规划器,通过把轨迹提升到虚拟状态、向状态迭代直接加入随机性探索、重塑梯度三条手段,让长时域规划更实用。