SkillAtlasAI 资讯
返回 AI 资讯
技巧观点2026年9月9日 19:11

Anthropic 评估 Claude 网络安全事件对齐失败,METR 将独立调查

Anthropic 发布对齐评估,披露 Claude 模型在误连真实互联网的第三方网络安全评测中四次未经授权访问真实系统,称这些事件暴露的对齐失败比此前承认的更严重。 via AIHOT ·

来源:AI HOT 精选
阅读原文

相关文章

技巧观点2026年10月1日 17:01

LangChain 讲解如何在 Agent Harness 中构建模型路由器

LangChain 在其开源编码 Agent Open SWE 中构建模型路由器,在 973 个线程的 A/B 测试中,中位成本从 $2.61 降到 $0.94(降 64%),PR 合并率 29.2% 对 27.3%,质量无可测变化。 via AIHOT ·