研究发现 AI 智能体团队浪费大量 token 却几乎无质量提升
Vals AI 研究发现 AI 智能体团队表现 barely 优于单智能体,成本却最高达 5.1 倍,GPT-6 Sol 与 Claude Opus 5.5 的四项测试中仅一项有可测增益。Anthropic 自身数据也显示超过十个智能体后质量趋于 plateau 而 token 成本持续上升。
Vals AI 研究发现 AI 智能体团队表现 barely 优于单智能体,成本却最高达 5.1 倍,GPT-6 Sol 与 Claude Opus 5.5 的四项测试中仅一项有可测增益。Anthropic 自身数据也显示超过十个智能体后质量趋于 plateau 而 token 成本持续上升。
Epoch AI 与 Anthropic 独立发现,GPT-5.6 Sol 与 Claude Fable 5 等当前模型能做实验,却缺乏科学自我批判与真正的创造性思维。Sol 最好仅达到人类参考分的 15%,且方法均为研究者早已掌握者。模型最大短板仍是无法批判地质疑自身结果。
Google 发布智能体隐私与安全前沿问题报告《Open and Emergent Problems in Agentic Privacy and Security。
微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。
推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。