新闻 简讯

简讯赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

齐丙瑞 阅读约 8 分钟 380626 阅读
简讯赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?
配图:简讯赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?

新闻导读

简讯赌注十万亿:字节拒绝走蒸馏捷径背后,张一鸣的长期主义有多狠?长条目拆成上下篇,通勤读完一篇刚好,到站不憋屈。广告若有也相对克制,注意力还能留给内容本身。正误对照版块适合快速建立框架,也方便转发给家人。转给理工小白如我时也不担心语气太冲或太玄乎。成年人的修补式学习,原来可以如此体面,也如此愉快。信息获取负担低,却不轻飘。

近日,The Information爆出,在两周前的 Seed 全员会上,张一鸣罕见发声,明确拒绝以蒸馏手段追赶前沿大语言模型。他的态度很坚决:“字节跳动应该愿意为了长远目标牺牲一些短期利益。” 最新一期 Artificial Analysis 全球 LLM 排行榜中,月之暗面 Kimi K3 Max 位列第二,阿里 Qwen 3.8 Max 位居第四,智谱 GLM 5.2 Max、DeepSeek V4 Flash 分列第七、第八,中国模型已占据全球前十近半席位。反观字节 Seed 2.1 Pro,仅排在第 21 位,远低于其他中国模型。 论钱,字节年利润规模位居互联网头部;论人,Seed 团队汇聚了搜广推体系成长起来的顶尖算法人才;论算力,数万张 GPU 集群的智算中心正在全国铺开;论数据,抖音与 TikTok 坐拥全球最大的原生内容池。 蒸馏(Distillation),通俗说就是拿其他大模型的答案来训练自己的模型,是行业公认的“捷径”。而在公开报道中,字节内部至少有三次关于是否蒸馏的路线之争。 第一次冲突是在2025年1月。DeepSeek-R1横空出世,其推理风格席卷全球。Seed内部就有研究员提议跟进蒸馏,张一鸣拒绝了。他要的是 Seed 像人类一样“学习如何思考”,而不是学会模仿 R1 的“碎碎念”。 第二次冲突是英伟达Blackwell芯片部署后。算力差距拉大,对手拿到了英伟达最新的入场券,字节只能靠 H20 苦撑,蒸馏呼声再起。但张一鸣再次说不,字节选择增资2000亿,在乌兰察布和怀来加盖智算中心。 然后是Kimi K3成功跻身全球顶尖模型榜单带来的压力。每次国内开源新模型发布,都是一次压力测试。内部焦虑达到顶点,但在张一鸣眼里,榜单是虚的,商业主权是实的。 张一鸣每次都顶住了。据接近Seed的人士透露,内部对开源模型的蒸馏禁令通过API检测等技术手段硬性执行,早在2023年4月就已明令禁止将GPT生成数据混入训练集。 “字节刚开始也做蒸馏,后来张一鸣痛定思痛,说我们还是要走长远路。阿里、腾讯、字节这个量级的公司,不能总靠蒸馏别人过日子。” 国内某大厂高管曾对AI科技评论这样说。 大模型的蒸馏可以用“背老师的作业答案”来形容。这条路见效极快。几百万条高质量指令数据灌进去,模型在基准测试上的分数能在短短几周内突飞猛进,快速逼近被蒸馏模型的水平。在大模型竞速的早期,几乎所有玩家都试过这招。 但随着赛道进入深水区,争议随之爆发。2026 年以来,Anthropic 连续公开指责 Minimax、月之暗面、DeepSeek、阿里通义实验室存在蒸馏其模型的行为,将中国大模型的快速崛起直接归因于 “抄捷径”。 真正让张一鸣坚持 “不抄捷径” 的,是更深层的技术判断:在数据见顶、算力匮乏、全球模型 PK 进入白热化的阶段,靠蒸馏永远只能追在别人身后,甚至会在下一轮智能跃迁中彻底掉队。 从技术角度而言,字节 Seed 坚持从头训练而不做“蒸馏派”,是一套环环相扣的技术演进逻辑。从头训练虽然痛苦,但它是突破天花板的唯一解。 蒸馏的本质,是用别人模型的输出当 “标准答案” 来训练自己的模型。它看起来高效,却藏着一个不可逆的致命缺陷:模型坍缩。 2024 年 7 月,牛津、剑桥等机构的联合研究登上《Nature》封面,首次系统证实,如果模型反复用 AI 生成的数据训练,原始数据分布中的尾部信息会逐渐消失,最终产生不可逆的能力退化。 而ICLR 2025 的 Meta 研究进一步证实,训练数据中哪怕只掺入千分之一的合成数据,就足以触发模型坍缩;比例再低,毒性效应依然存在。而且模型参数量越大,在特定阈值下坍缩效应反而会被放大。不是堆参数就能解决问题。 真实世界的知识不是均匀分布的。常见问题、标准回答只占信息分布的 “头部”,而那些罕见的边缘场景、反常识的提问、方言俚语的微妙语义、小众领域的专业知识,都藏在分布的 “长尾” 里。这些长尾信息,决定了模型处理未知问题的上限,也是真正的智能边界。 AI 生成的 “标准答案”,天生就会抹平这些长尾。模型输出的永远是概率最高的回答,它会自动过滤掉小众、反常、不确定的内容,只留下最 “正确” 也最平庸的结果。用这样的数据反复训练,模型会变得越来越自信,也越来越狭隘。虽然基准测试分数可能还在涨,但它的 “世界观” 已经在悄悄坍缩。 而字节最大的底气,恰恰是数据。抖音日均产出超 8000 万条短视频,头条日均推荐内容以亿计,海外 TikTok 覆盖 150 多个国家和地区,这是全球最庞大的原生人类内容池。从 PB 级的真实视频、文本、评论、交互数据中清洗降噪,比直接拿来几百万条 GPT 生成的干净指令难得多,但只有原生真实数据,才能完整保留现实世界的分布,包括那些奇怪、鲜活、不可预测的长尾。 Scaling Law 的本质,是用更多高质量真实数据推高智能的天花板。合成数据只能在已有边界内做平滑,永远无法突破边界。字节选的,是一条自己定义天花板的路。 词表是模型的 “眼睛”,它决定了模型把一段文字切分成多少个基础单元,每个单元对应一个向量表示。用别人的词表,就等于接受了别人的语言偏好和认知颗粒度。 比如 Llama 的词表是针对英语优化的,遇到中文成语、网络热梗、弹幕缩写,常常会被拆成四五个零散的单字。这不仅会大幅降低推理效率、拉高成本,更关键的是,语义的关联性被切碎了,模型从输入层就没真正理解中文的表达逻辑。 字节 Seed 系列的核心战场从来不是纯文本大模型,而是原生多模态。Seedance 2.0 已经实现原生音画同步的视频生成,支持 60 秒 2K 分辨率视频和 8 种语言的唇形对齐。这种能力的前提,是模型在底层就实现文本、视频帧、音频信号的原子级映射:每一个语义单元,都要和对应的视觉、声学单元在同一个向量空间里对齐。 如果你蒸馏了别人的模型,你继承的就是别人的编码地基。别人怎么切分视频 Token,你就得怎么切分;别人怎么对齐音文时序,你就得怎么对齐。后天微调可以改参数、调效果,但改不了底层的 Token 空间和语义框架。 不蒸馏,意味着字节可以从零定义规则:视频帧以什么粒度做 Token 化最合理、音频的节奏特征怎么编码进语言模型、多模态信号怎么做联合注意力…… 所有底层决策全部握在自己手里。 靠蒸馏做模型,本质是轻量级的 “微创新”:站在别人现成的基座上做微调,几百张 GPU 跑几周就能看到效果,见效快、成本低,是很多厂商快速追赶的首选路径。 但字节选的从头训练路线,完全是另一套游戏规则。要从零训练 200B 以上参数的 MoE 大模型,比拼的从来不是单点算法的优劣,而是整套工程体系的硬实力。这是真正的 AI “重工业”。 超大规模预训练里,最致命的指标叫MTBF(平均无故障时间)。一次完整的预训练周期往往长达数月,要调动数万张 GPU 并行计算。这期间任何一张显卡出现内存错误、任何一条高速链路发生通信闪断、任何一个算子触发精度溢出,都可能让整个训练任务中断,甚至导致前期投入的算力成本全部打水漂。 集群规模越大,故障发生的概率就越高。我们可以做一个简单推算:假设单张 GPU 的平均无故障时间是 10 万小时,那么由一万张卡组成的集群,平均每 10 小时就会遭遇一次硬件故障。如果没有毫秒级的故障检测、精准的断点续训和完备的容错恢复机制,大规模从头训练根本无从谈起。 对字节来说,这份挑战还要再上一个量级。受美国芯片出口管制限制,字节无法采购英伟达最新的 Blackwell 旗舰芯片,只能使用性能受限的 H20 芯片,单卡训练效率与海外顶尖平台差距显著。别人靠更强的单卡性能就能撑起训练效率,字节要追上差距,只能靠更大的集群规模、更高的资源利用率和更极致的工程优化来补。 公开信息显示,字节的训练集群已布局内蒙古乌兰察布、山西大同、河北怀来、张北、安徽芜湖等多个智算中心,搭建起数万张卡规模的分布式算力网络。2026 年字节 AI 基础设施资本开支已上调至超 2000 亿元,公司净利润同比出现明显下滑,核心原因正是三四季度算力采购与数据中心建设的集中投入。 张一鸣本人也将一半精力倾注在 Seed 团队。这笔千亿级的资金投入,加上创始人级别的注意力倾斜,押注的从来不只是某一个模型的效果,而是一整套能稳定支撑超大规模训练的全栈工程体系:从底层算子优化、集群通信调度,到训练故障恢复、算力资源管理,全部自主研发。 这套能稳稳撑起 “万亿参数从零训练” 的训练框架与基建能力,才是字节真正的技术护城河。走蒸馏路线的厂商,永远不需要攻克万卡级稳定训练的工程难题,自然也沉淀不下这套重工业级的系统能力。 当 Scaling Law 继续向前演进,模型参数规模持续攀升时,竞争的门槛会从算法转向工程。到那时,只有手握完整基建能力的玩家,才有资格留在牌桌上。 用别人模型的输出训练,你的模型学到的是对方的输出分布,包括说话的语气、回答的套路、甚至 RLHF 阶段被注入的价值观偏好。它知道什么问题该说什么话,但不知道为什么这么说;它模仿得了结果,模仿不了背后的推理链路。 更关键的是,模型的 “灵魂” 会打上别人的烙印。什么是好回答、什么该拒绝、什么场景用什么风格,这些底层偏好,在蒸馏过程中会被一并继承过来。后续你再做 RLHF、再调奖励模型,也只是在别人的地基上做装修,很难从根本上改变模型的行为模式。 抖音的推荐讲完播率和互动率,电商讲点击到购买的转化效率,短视频内容讲节奏感和视觉冲击力,这些独特的商业逻辑,必须深度植入 Reward Model,让模型在 RLHF 阶段就和字节系产品的目标对齐。 如果你蒸馏了GPT-4,模型的"灵魂"里刻着OpenAI的偏好逻辑。你在后训练阶段再怎么调,也是在别人的地基上装修。只有从头训练,从预训练到RLHF全链路自主,字节才能让模型真正对齐到自己那套极致的商业逻辑中。这不仅关乎效果,更关乎可控性。 据《金融时报》报道,字节跳动正在讨论训练一个参数规模10万亿的大模型,显著超过阿里 Qwen 3.8-Max 的 2.4 万亿参数和月之暗面 K3 的 2.8 万亿参数,是目前国内已知参数规模最大的模型计划。该项目仍处于早期探索阶段,由 Seed Foundation 负责人项亮主导,与预训练数据负责人沈科协同推进,最终是否正式发布尚未确定。 这是一个非常 “字节” 的选择:与其在同尺寸参数上苦苦追赶,不如直接把规模拉到同行的数倍,用一次量级跃迁争取领先位置。 Scaling Law 依然是当前大模型最可靠的进阶路径。在数据质量、训练效率达标的前提下,参数规模的提升会带来可预测的能力增长。当主流玩家还在 2-3 万亿参数区间内卷时,字节直接冲击10万亿,本质是用规模换时间,用更大的投入,跳过中间的追赶步骤,直接摸到下一个梯队的门槛。 参数规模翻倍,训练难度不是线性增长,而是指数级上升。数据供给、算力稳定性、对齐难度、推理成本,每一项都是巨大的挑战。2000 亿资本开支、70% 的利润下滑、创始人一半的精力,所有筹码都压在了这条 “更慢更难”的路上。 当 DeepSeek 被 OpenAI 正式指控蒸馏,当美国立法将模型数据窃取纳入国家安全范畴,字节的选择突然有了提前避险的战略意味。全链路自研的模型,没有知识产权争议,没有合规包袱,无论是全球化布局还是长期技术竞争,都站在更安全的位置。 蒸馏的诱惑在于确定性:你知道终点在哪里,知道怎么走最快,投入产出清晰可见。但它的代价,是永远失去定义终点的资格。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:/?blog/202608/pwuby2nlv1-096.scm

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者5号
    带孩子一起看了不少条目,很多“为什么”都能找到靠谱且好懂的说法。语言通俗,但没有把科学讲成尴尬段子,分寸拿得住。学习记录能看见看过哪些主题,有种在铺知识地图的感觉。耳朵也能学,时间碎的人几乎能无痛坚持。作为主力科普入口长期留下很合适。把核心求知需求解决得很扎实。
    20260809 · 来自移动端
  • 用户
    赵康进
    化学安全、生活防护写得很仔细,像可执行的说明书。内容更新偏稳,宁缺毋滥,注水感不强。兴趣标签认真调两次就比较准,少推不相干的八卦。让人愿意持续学下去,而不是靠意志硬撑两天就放弃。转给通勤族时也不担心语气太冲或太玄乎。写给后来者:别指望一夜变专家,但真的能变清醒。
    2026-08-09 17:36:53
  • 用户
    热心网友
    庶女有为(N)姜嫫,内容值得关注,期待后续更新。
    20260809

期待你的精彩发言。