← 资讯列表
资讯

DeepSeek V4在多项基准追平GPT-4,训练成本仅十分之一

📅 2026/5/27 18:00:50👁 3 阅读⏱ 约 2 分钟
大模型军备竞赛的叙事正在被悄然改写。当外界普遍认为,追赶 GPT-4 必须依赖天文数字的算力成本时,深度求索团队发布的 DeepSeek V4 模型,像一个突然登场的搅局者,用一组极具反差感的数据震动了整个圈子。 这个新模型最引人注目的不是它追平了标杆,而是它实现追赶的方式。在 MMLU 综合知识评测中,DeepSeek V4 拿下了 86.5 分,与 GPT-4 的 86.4 分几乎并驾齐驱;在 HellaSwag 常识推理、HumanEval 代码生成等多个硬核榜单上也呈现出紧咬之势。真正令业内人士咋舌的是账本:据披露,DeepSeek V4 的训练总成本控制在 550 万美元左右,仅为行业推算 GPT-4 训练花费(约 6000 万美元)的十分之一。用十分之一的资金,硬生生买到了同一张能力的入场券,这笔账怎么算都足够震撼。 DeepSeek 能做到这一点,背后是一套精妙的“财力节省术”。研究团队没有选择蛮力堆砌参数,而是把模型设计成一个庞大的“专家委员会”。通过极致的混合专家架构与动态稀疏激活策略,总参数量虽然巨大,但每次推理仅调动与当前任务相关的极少部分计算单元,大模型的“无用功”被压到最低。再加上对海量训练数据的智能去重和课程学习式调度,每一部算力都被用在了刀刃上。这就像一群人中,只让真正懂行的人处理手边的事,其他人休息,所以会议成本极低,但决策质量丝毫不降。 这种打法带来的不仅是技术突破,更是一种路径上的启示。它证明了在英伟达顶级芯片受到出口管制的背景下,通过极致的架构创新和工程优化,依然可以打出世界级的好牌。 【记者点评】这并非一次简单的“追平”事件,它真正宣告了高性价比大模型时代的到来。当算力不再是唯一壁垒,架构智慧与工程能力的价值被空前放大。中国团队用更绿色、更经济的方式证明,追赶顶尖模型不必复刻硅谷的烧钱路径。这种
← 返回资讯列表 AI8899 · 内容仅供学习参考