我怎么看 DeepSeek-V4-Pro 这次更新
参数和榜单当然值得看,但我更关心模型能不能把一项长任务稳定地做完。
DeepSeek-V4-Pro 发布以后,我先看的不是社交平台上的惊叹,而是它在长任务里会不会少走一些弯路。
根据 DeepSeek 在 2026 年 4 月发布的说明,V4-Pro 采用总参数 1.6T、单次激活约 49B 的混合专家架构,支持 100 万上下文,并同时提供思考与非思考模式。到了 7 月,旧的 deepseek-chat 和 deepseek-reasoner 名称也停止服务,V4-Pro 成为 API 的实际承接者。这些变化很重要,不过对真正把模型接进开发流程的人来说,上下文更长、参数更多,并不自动等于任务完成得更稳。
我手头有一组 250 个真实轨迹用例,覆盖五个模型,每个模型 50 例。在这套评分口径下,DeepSeek-V4-Pro 的平均分是 79.3,50 个用例中有 34 个通过、11 个需要提醒、5 个失败,整体表现是五个模型里最好的。这个结果只能说明它在这组任务和这套 Harness 中的相对表现,不能拿来当通用排行榜,但有一点很清楚:即使是表现最好的模型,也依然会在少数任务里偏离目标、反复试探或者没有把收尾工作做完整。
因此我真正关心的是另外几件事:它能不能先理解约束再行动,调用工具以后能不能利用返回结果,走错一步时能不能及时纠正,接近答案时能不能停止无效搜索,以及上下文变长之后会不会把关键条件淹没在大量过程信息里。这些问题不会在一张漂亮的基准测试表里自动显现,却会直接决定它能不能进入日常生产环境。
V4-Pro 给我的感受不是“模型已经解决了一切”,而是模型能力继续上升以后,外围工程的重要性更明显了。模型、系统提示、工具说明、上下文管理和错误恢复共同决定最后结果。只看最终回答,很容易把 Harness 的问题归到模型头上,也容易把一次偶然成功误认成稳定能力。
所以这次更新之后,我愿意给 DeepSeek-V4-Pro 更多真实任务,但不会因为版本号和参数规模放松检查。我更想知道它在第十步、第六十步和第一百步分别做了什么,为什么继续,为什么停止。一个模型能不能让人放心,最终还是要看它在完整执行过程中的表现。