65.2%|SWE-bench准确率
Anthropic发布Claude 4 Opus,首次实现万字超长代码自主纠错闭环
200万Token上下文窗口落地
2026年7月21日,Anthropic正式发布旗下最强模型Claude 4 Opus。新模型将上下文窗口推至200万Token,可一次性处理整本《三体》三部曲,并在长文档推理中保持98%以上的关键信息召回率。Anthropic CEO Dario Amodei在发布会上演示了一个令人印象深刻的场景:向Claude 4 Opus输入一个完整的企业级代码库,要求其找出所有SQL注入漏洞并逐一修复,模型在12分钟内自主完成了从扫描到修复的全流程。
SWE-bench Verified突破65%
在软件工程权威基准SWE-bench Verified上,Claude 4 Opus取得了65.2%的准确率,相比Claude 3.5 Sonnet的49%提升了超16个百分点。这一突破标志着AI编程助手从"辅助编码"迈入"自主软件工程"阶段。开发者只需提交自然语言任务描述,Claude 4 Opus即可独立完成代码编写、测试、调试和部署。该模型将于即日起通过Anthropic API和Amazon Bedrock向企业客户开放,个人用户可在Claude.ai上体验。
企业安全护栏同步上线
与Claude 4 Opus一同发布的还有全新的企业安全控制台。该控制台允许企业管理员设定细粒度的行为策略,包括数据访问范围、可执行操作白名单以及合规审计日志。Anthropic表示,此举旨在回应欧盟AI法案对高风险AI系统的透明度要求,目前已有多家财富500强企业参与内测。
← 返回资讯列表
AI8899 · 内容仅供学习参考