Anthropic 发布 Claude Haiku 5.5,定价对标 GPT-6 Luna
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
内容形态
模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。
2 条精选近 30 天 2 条共收录 5 条
Anthropic 发布 Claude Haiku 5.5,这是约一年来首次更新 Haiku 系列,定价与 OpenAI 的 GPT-6 Luna 持平,并同步下调 Sonnet 5.5 及订阅方案价格。
推荐理由:文章给出第三方基准与定价细节,读者可据此判断它在多智能体工作流中的性价比定位。
微软与 Hugging Face 联合发布 ThinkingBox 智能体基准,通过隔离的 MCP 工具会话运行智能体,对后端终态和副作用打分而非只看生成文本,并在 507 个有状态业务流程上每个任务重复运行 20 次。
推荐理由:微软联合 Hugging Face 发布 ThinkingBox 智能体基准,按后端终态而非生成文本打分并重复 20 次,给出可靠性与成本对比。