OpenAI正式发布GPT-5.2 Thinking模型,推理能力超越人类专家
多项基准测试刷新纪录
OpenAI在今日凌晨的线上发布会上正式推出GPT-5.2 Thinking推理模型。该模型在国际数学奥林匹克(IMO)真题测试中取得92.3%得分率,首次超越金牌选手平均水平。在SWE-bench Verified代码基准上,GPT-5.2 Thinking的修复成功率达到89.7%,较GPT-5提升超过15个百分点。在MMLU-Pro专业知识测试中达到96.1%准确率。OpenAI CEO Sam Altman在发布会上表示,"这是我们距离AGI最近的一步,模型已经可以在大多数认知任务上媲美甚至超越人类专家。"
200万token超长上下文与多模态融合
GPT-5.2 Thinking在上下文窗口上实现重大突破,从GPT-5的100万token扩展至200万token,足以一次性处理超过3000页的技术文档或整部《三体》三部曲。更引人注目的是其"深度思维链"能力,模型可以在回答前进行长达数万token的内部推理,将复杂问题分解为数十个子步骤逐一求解。新模型还加强了多模态融合,支持文本、图像、音频和视频的联合推理。用户在演示中上传一段机械故障视频,模型仅用12秒即定位问题并提供维修方案。GPT-5.2 Thinking即日起向ChatGPT Plus和Pro用户逐步开放。
安全对齐与开源生态
伴随新模型发布,OpenAI同步公开了安全评估报告。报告显示GPT-5.2 Thinking在生物武器、网络攻击等高风险领域的拒绝率达到99.7%,有害输出率低于0.02%。同时OpenAI宣布将GPT-5.2 Thinking的"轻量版"以开源方式发布,模型权重将通过Hugging Face平台提供下载,支持商用。这一举措被业界视为对标Meta Llama开源战略的重要一步。分析师预测,GPT-5.2 Thinking的发布将推动全球AI产业进入新一轮高速增长期,相关算力基础设施投资有望在2026年下半年突破500亿美元。