新闻 短讯

短讯成本拉低100倍,梁文锋把Claude拉进“斩杀线”

郭颖明 阅读约 9 分钟 836035 阅读
短讯成本拉低100倍,梁文锋把Claude拉进“斩杀线”
配图:短讯成本拉低100倍,梁文锋把Claude拉进“斩杀线”

新闻导读

短讯成本拉低100倍,梁文锋把Claude拉进“斩杀线”连续用了好几周,居然没怎么觉得腻,题材轮换比较自然。弱网下文字优先模式很体谅,流量不好时也能读下去。天文地理健康科技都有覆盖,单篇不长,信息密度却够用。好的工具不吵不闹,但你会总想起打开看一眼。综合可读性、可信度和可坚持性,表现都还在线。关键路径打磨充分,少有莫名其妙的打断。

今年6月,DeepSeek才刚刚完成首轮500亿元融资,创下国内大模型首轮融资规模纪录,投后估值超过3500亿元。仅时隔两个月,其投前估值便攀升约43%,两轮募资完成后累计金额将超千亿元。 具体的情况是这样的,权威模型测试媒体Artificial Analysis放出了一组实测数据,他们用多个主流模型跑同一组基准测试,比谁的平均成本更低。 乍一看这个数据可能没什么,但是如果把其他主流模型拉来作为对比,一切就都变了。在同一份基准下,Anthropic 的旗舰模型 Claude Fable 5平均成本为3.15美元,GPT-5.6 Sol 要1.86美元,DeepSeek 比 Claude 便宜了100倍。 而且这只是金钱成本,DeepSeek V4-Flash 还有一大特点就是快。根据 Artificial Analysis 的实测数据,DeepSeek V4 Flash(Max Effort 模式)的输出速度约为113tokens/秒,而同级别的 Anthropic 旗舰模型Claude Opus 5约为74tokens/秒,约为1.5倍。 为了得到这种极致的性价比和效率,DeepSeek V4-Flash在智能水平上做了一定的取舍。Artificial Analysis的数据显示,智能指数方面V4-Flash得分为50分,跟谷歌Gemini 3.6 Flash持平,只落后旗舰模型约10分——Claude Opus 5为61分,Fable 5为60分。 过去这几年,大模型行业的定价方式既简单又粗暴,按跑了多少token算钱。输入每百万token多少钱,输出每百万token多少钱,厂商怎么定价,用户就怎么交钱。 就像去饭店吃饭,菜单上写着“大米5块钱一斤”,但我只在乎“一碗米饭多少钱”。token相当于是大米,任务就是那碗米饭。大米就算再便宜,蒸成米饭的工艺依然会影响米饭的最终价格。 DeepSeek V4-Flash的官方定价是每百万输入token 0.14美元,每百万输出token 0.28美元,人民币定价为输入缓存未命中每百万输入1元,输入缓存命中每百万0.02元,输出每百万2元。 这个价格本身就已经是行业最低梯队了。但问题是,token价格低不等于任务成本低,一个模型如果需要生成更多的token才能完成同样的任务,那便宜的token单价可能换来一张昂贵的账单。 Artificial Analysis 做的事情,就是把这层“翻译”给做了。他们比的是“跑完同一套基准测试要花多少钱”。这个口径叫“每次任务成本”(Cost per Task),它把token用量、推理深度、缓存命中率、思考时间这些变量全部揉在一起,直接给出一个终极答案,干完一件事到底要花多少钱。 但光靠这些还不够。V4在注意力机制上做了很大的文章,他们设计了一套叫CSA(压缩稀疏注意力)和HCA(重度压缩注意力)交替排列的混合架构。 比如最近几分钟发生的事,记得非常清楚,每一个细节都能说出来;几天前发生的事,大概就只能记得发生了什么,细节被模糊掉了;几个月前的事,可能只记得一个大概的印象。 第一阶段叫“分科培养”。数学、代码、Agent、指令跟随这些领域,各自单独训练专家模型。每个专家先用监督微调(SFT)打基础,再用GRPO强化学习反复打磨。GRPO是郭达雅在DeepSeek时发表论文DeepSeekMath中首次提出的概念。 传统PPO算法需要额外训练一个价值函数模型,又费显存又费算力,而GRPO直接把这一步砍了,改成让模型对同一问题生成多个答案,用组内的相对排名来代替绝对价值评估,自己跟自己比、自己跟自己学。既省了训练成本,效果还更好。 第二阶段叫“融会贯通”,用On-Policy Distillation(在线策略蒸馏)把多个领域专家的能力合并回同一个模型里。蒸馏的时候不是简单地复制输出,而是让目标模型在自己的策略分布下生成数据,再用专家模型的输出来矫正,确保合并后的模型不会“学了这个忘了那个”。 过去说模型蒸馏,都是先让高性能的模型生成答案,再让低性能的模型去学。但是在线策略蒸馏是反过来的,是学生先自己做题,老师在旁边看着,边看边指导。学生根据各个老师的反馈,当场调整自己的思路,继续往下做。做完一道,再做下一道,边做边学。 “在线”指的是学生和老师是同步的,老师实时给学生反馈。“策略”指的是它学的不是具体某道题的答案,而是“遇到问题该怎么想”这套思考方法。 其结果是,Terminal Bench 2.1从61.8分干到了82.7分。这个测试测的是模型在真实终端环境中完成复杂命令行任务的能力,分数直接超过了自己的老大哥V4-Pro预览版的72.1分,逼近Anthropic旗舰Opus 4.8的85.0分。 更夸张的是 DeepSWE,这是一个专门测试GitHub真实Issue解决能力的基准,DeepSeek V4-Flash从7.3分飙到54.4分,涨幅645%。一个Flash级别的轻量模型,在9项Agent基准测试上全面碾压自家旗舰Pro的预览版。 过去几年,企业选模型的过程就像选供应商,比参数、比跑分、比价格,最后选一个“综合最优”的。这种思路的前提是模型之间的价格差距不大,都在同一个数量级内,当然大家都会选能力最强的。 假设一个企业每天要处理100万次API调用,用Claude,每天的成本是31500美元,用DeepSeek,每天只需要300美元。一年下来,差距是1130万美元。这已经不是省点钱的问题,这是能不能活下去的问题。 所以企业的核心命题就不再是“用哪家模型”了,现在变成了“怎么把任务分到最合适的模型上”。这个思路在行业里有个名字,叫模型路由(Model Routing)。 模型路由的逻辑很简单,把高价值、高失败成本的复杂任务放到Claude Opus 5或 GPT-5.6这样高上限的模型里,比如自动编程中架构设计、金融报告的关键分析、法律文书的条款审查等等,企业给模型的智能等级和成功率付费。 像是批量分类、代码初筛、数据清洗、低风险Agent任务之类的“苦力活”,往往占据了企业运营的80%,因此把这些全都交给DeepSeek,省下来的每一分钱都是纯利润。 根据Menlo Ventures的企业AI调研,37%的企业已经在生产环境中使用5个以上的模型。学术方面也有相同的推论,LMSYS团队(UC Berkeley、Anyscale)在 ICLR 2025上发表的RouteLLM研究发现,在MT Bench基准上,智能路由可以在保持GPT-4 95%质量的前提下削减85%的成本。 路由做得好不好,直接决定了企业的AI成本。一个路由策略粗糙的企业,可能80%的任务都打到了旗舰模型上;而一个路由做得精细的企业,可能只有20%的任务需要旗舰模型,其余80%都分流到了高性价比模型。 最原始的路由,是“静态规则”。举个例子,客服部门的,就用便宜模型;算法部门的,就用贵模型。或者关键词匹配,提到“代码”就用中低档模型,提到“分析”就用旗舰模型。 高级一点的,是用分类器。先训练一个小模型,专门用来判断“这个请求应该用哪个模型”。请求进来,先过分类器,分类器说简单,就给便宜模型;分类器说难,就给贵模型。 这种办法比静态规则准,但还是有问题。分类器本身也会犯错,而且它只能根据请求的字面意思判断,不知道模型实际做出来效果怎么样。 再高级一点的,叫做“先试后升”。不管什么请求,先让最便宜的模型试试。如果结果质量够好,就直接用;如果质量不够,再自动升级到更贵的模型重做。 所以闭源厂商的日子,以后会越来越不好过。它们必须不断往上走,去做那些更难、更复杂、价值更高的任务,把自己的护城河挖得更深。因为下面的市场,已经被DeepSeek占满了。 此前,行业常会用GPT-4o、Claude Sonnet、Gemini Pro这些模型来作为参考,它们的性价比就成为了行业基准。比它们贵的,就得证明自己更强;比它们弱的,就得证明自己更便宜。 不过图片中可以看到,这些作为行业基准的模型,它们的斩杀线是很低的,稍微推理强度高一点的模型,都可以轻松逃过被斩杀的命运,DeepSeek V4-Flash正式版的出现,让整个斩杀线抬高到了一个非常高的地方,全球将近70%的模型都处于被斩杀区域。 这也就意味着,包括低推理强度的Fable 5和GPT-5.6在内,全球90%的模型,在完成任务的性价比这方面,都被DeepSeek斩杀了,更有甚者,无论是把推理强度调高也好调低也好,依然也逃不过被DeepSeek满血斩杀的命运。 8月初,DeepSeek Harness负责人崔添翼在X发文称“如果你是Agent Harness相关开源项目的开发者,希望参加 DeepSeek Harness的内测,可以回复或私信联系我。请附上GitHub id以及开源代表作。” 一个Agent任务的完成质量,不只取决于模型本身的能力,还取决于框架怎么组织上下文、怎么处理工具调用的错误返回、什么时候该重新规划、长会话怎么压缩、什么条件算任务完成。Harness所负责的,正是这些事情。 但minimal模式只是Harness能力的冰山一角。Harness正式发布并开放完整功能后,同样的模型在同样的任务上,可能会表现出更高的成功率和更少的token浪费。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:/?world/20260810-2506.scm

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者3号
    查找体验意外地好,搜完相关条目会串成一条线,不再是散落的冷知识碎片。会区分科普简化模型和专业表述,提醒别过度脑补。和通勤族一起看时,讨论会自然落到证据而不是站队。好的工具不吵不闹,但你会总想起打开看一眼。我会继续用信任投票,也希望它别被错误指标带偏。
    20260810 · 来自移动端
  • 用户
    苑肖肖
    看到本地相关的地质或物种,亲近感一下子上来,学习不再悬浮。广告若有也相对克制,注意力还能留给内容本身。关键术语会顺手用白话解释一句,不太劝退小白。谣言澄清结构清楚:常见说法、现有证据、更稳妥的理解。读者对用心敏感,用心会转化为信任和口碑。已经安利给身边几个人,反馈大多也不错。
    2026-08-10 23:35:57
  • 用户
    热心网友
    《《新品玩具测试员》漫画百度免费观》,内容值得关注,期待后续更新。
    20260810

期待你的精彩发言。