新闻 小时报

DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽

李亚洲 阅读约 7 分钟 133035 阅读
DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽
配图:DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽

新闻导读

DeepSeek又更新了,这次梁文锋没放大招|进击的独角兽流量不好时有更偏文字的模式,父母放大字体后仍可读。谣言澄清结构清楚:常见说法、现有证据、更稳妥的理解。转给家里老人时也不担心语气太冲或太玄乎。还想学的状态比被震惊一下健康太多。整体我愿意长期留着,慢慢看、慢慢补。信息获取负担低,却不轻飘。小处想得细,耐看也耐用。

从“正式版”和“公测”两个词同时出现来看,这并不是V4的最终形态。DeepSeek也特意强调,本次更新只涉及V4-Flash的API,V4-Pro及App、Web端模型均未发生变化,V4-Pro正式版还要再等等。 从最新版本来看,V4-Flash-0731没有改变模型架构和参数规模,只重新进行了一次后训练。更新后,DeepSeek把几乎所有篇幅都用来强调它在Agent,尤其是Code Agent上的进步。 DeepSeek正在尝试回答一个新的问题:到了Agent阶段,一家公司最需要的,究竟是一个能力最强的模型,还是一个足够强、足够快,也足够便宜的模型? 4月24日,DeepSeek发布V4预览版时,已经同时推出V4-Pro和V4-Flash。两者都是MoE模型,但体量差距明显:V4-Pro拥有1.6万亿总参数,每次推理激活49B参数;V4-Flash拥有284B总参数,每次只激活13B参数。两款模型均支持100万Token上下文。 参数规模更大的V4-Pro,在世界知识以及高难度Agent任务上表现更好;V4-Flash则可以通过增加思考预算,在部分推理任务上接近Pro。换句话说,Flash牺牲了一部分知识容量,却用更小的激活参数换来了速度和成本。 用通俗的话来讲就是,DeepSeek虽然继续在追求AGI,但是并没有通过一味地增加参数来实现这件事情,而是让模型学会更好地拆解任务、调用工具、执行代码,并在更长的任务轨迹中减少错误。 过去,大模型公司的主要竞争发生在预训练阶段。谁有更多算力、更多数据,谁就有机会训练出参数更大、知识更多的模型。但进入Agent阶段后,模型能力不再完全由预训练决定。 一个模型会不会使用终端,能不能在数百次交互中维持任务状态,遇到错误后能否修正,以及是否知道什么时候应该调用什么工具,这些能力越来越依赖后训练、强化学习和模型外部的执行框架。 一方面,部分结果来自DeepSeek内部测试集;另一方面,DeepSeek Harness尚未公开,外界还无法在完全相同的环境下复现这些成绩。正式版V4-Flash究竟比预览版进步了多少,还需要等待独立评测以及真实开发场景验证。 在聊天机器人阶段,用户提出一个问题,模型生成一次答案,一次交互就结束了。但在Agent任务里,模型需要先理解目标,再拆解任务、检索信息、调用工具、读取结果、修正错误,最后完成交付。 这时,模型单次推理增加的成本和延迟,会在整个任务轨迹中被不断放大。一个能力更强、但速度更慢、成本更高的模型,未必能带来更好的实际结果。 Agent真正需要的,往往不是每一步都调用能力最强的模型,而是在绝大多数步骤中,使用一个能力足够、价格更低、响应更快的模型。 根据DeepSeek技术报告,在100万Token上下文下,V4-Flash单Token推理所需的计算量,约为V3.2的10%,KV Cache则约为V3.2的7%。它的总参数只有V4-Pro的约六分之一,每次激活参数也只有Pro的约四分之一。 目前,V4-Flash每百万Token未命中缓存的输入价格为1元,输出价格为2元;V4-Pro分别为3元和6元。V4-Flash的并发限制为2500,Pro则为500。Responses API目前也只有V4-Flash支持,V4-Pro预计到8月初才会接入。 在V4的产品体系里,Pro负责证明DeepSeek的模型能力能够达到什么位置,Flash则负责承担真正高频、长链条的Agent任务。前者是能力模型,后者更像生产模型。 DeepSeek没有选择通过扩大参数,让Flash在所有能力上追上Pro;它选择在模型架构不变的情况下,通过后训练和Agent框架,提高Flash完成真实任务的能力。 如果Agent最终要进入企业和开发者的日常工作流,那么决定模型能否被大规模使用的,不只是Benchmark,而是完成一个任务需要多少时间、消耗多少Token,以及最终成功率是多少。 DeepSeek公布的Agent成绩大多使用Max reasoning effort完成。更高的思考强度通常意味着更长的推理过程和更多Token消耗。一个模型每百万Token的价格很低,不等于完成一项任务的总成本一定更低。 因此,真正有价值的对比,不是V4-Flash在某一项Benchmark上超过了谁,而是在完成同一个Agent任务时,它与V4-Pro、Kimi、GLM以及闭源模型分别需要多少Token、多少时间和多少次重试。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:/?m/blog/20260810-310.shtml

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者10号
    用了这么久最想说:它让我不怕“不懂”,不懂就点开,读完就懂一点。专题常把问题、证据和局限放在一起讲,读完更踏实。转给备考的人时也不担心语气太冲或太玄乎。慢慢把常识补起来,这种不紧不慢的节奏反而更容易坚持。看到靠谱内容还是想支持一下,不只是白嫖。
    20260810 · 来自移动端
  • 用户
    周广峰
    我是文科出身,理化底子薄,这里的入门路径却很友好。争议话题措辞谨慎,不站队煽情,更像在认真备课。家庭共享和分龄内容池让人更放心,给孩子用也踏实一些。双商都在线的内容产品不多,碰到了就想多支持一会儿。适合当枕边和通勤的固定搭子,不吵,但有用。
    2026-08-10 16:30:12
  • 用户
    热心网友
    火影奖励网站V.2.8.6破解版(2025已更新),内容值得关注,期待后续更新。
    20260810

期待你的精彩发言。