新闻 评论

评论余承东说到做到,华为openPangu-2.0-Pro模型及技术报告开源上线

毛瑞东 阅读约 5 分钟 995782 阅读
评论余承东说到做到,华为openPangu-2.0-Pro模型及技术报告开源上线
配图:评论余承东说到做到,华为openPangu-2.0-Pro模型及技术报告开源上线

新闻导读

评论余承东说到做到,华为openPangu-2.0-Pro模型及技术报告开源上线我把常用主题打了标签,主页干净得像私人杂志。方法讲得多:对照、重复、证据强弱,比只丢结论更让人长进。压力小,收获却一点都不含糊,适合建立科学思维。整体我愿意长期留着,慢慢看、慢慢补。连续高强度翻看也不容易心累。作为主力科普入口长期留下很合适。

openPangu-2.0-Pro 是基于昇腾 NPU 训练的大规模混合专家(MoE)语言模型,参数规模约 505B,每 token 激活参数规模约 18B,模型支持 512k 上下文长度,训练数据总量约 34T tokens。后训练阶段完成快慢合一微调(SFT)、多专项强化学习(RL),并通过在线蒸馏(OPD)完成能力合一。 Attention 架构:沿用高效 MLA,并采用 DSA+SWA 独立分层混合架构,层配比为 1:2;SWA 层负责局部窗口建模,DSA 层负责稀疏全局聚合,在保持精度的同时显著降低长序列推理的计算、显存与访存开销。拓扑架构:将传统残差连接升级为 4 支流 mHC 架构,提升表征多样性与泛化能力。自投机模块:采用 3 头 MTP 架构,一次额外预测 3 个 token,显著提升模型的推理速度。Muon 优化器:训练中采用 Muon 优化器,获得更快的收敛速度。 在今年 6 月的华为开发者大会 HDC 2026 主题演讲中,华为常务董事、产品投资评审委员会主任、终端 BG 董事长余承东宣布,openPangu 2.0 计划从 6 月 30 日起陆续开源 7 大组件,包括新增开源的预训练代码、后训练代码、训练算子。 对于 openPangu-2.0-Pro 总参数仅 505B,余承东曾解释称,算力大量支持了国内的其他企业需求,自己留的数量还是非常有限的;此外,AI 算力成本非常高,华为更聚焦时延和吞吐率的提升。

相关标签

免责声明:本文内容来自公开报道与编辑整理,仅供参考。转载请注明出处;版权争议请联系本站核实处理。页面地址:/?yaowen/r3lulx.scm

评论区

热门讨论 · 占位展示
说说你的看法…
发表评论
  • 用户
    读者9号
    朋友推荐时说“不鸡汤也不故弄玄虚”,体验后果然如此。会区分科普简化模型和专业表述,提醒别过度脑补。遇到平均数可能藏着什么陷阱相关谣言,至少知道该从哪几处质疑。进度跨设备衔接自然,换手机平板继续看不费劲。科学叙述尽量接得住更多人的生活,而不是只写给同温层。
    20260811 · 来自移动端
  • 用户
    章春雷
    做笔记很方便,划重点能同步,复习时只看自己的摘录效率高很多。很多生活现象背后的原理讲得清楚,不装腔作势,也不故意卖萌到尴尬。广告若有也相对克制,注意力还能留给内容本身。双商都在线的内容产品不多,碰到了就想多支持一会儿。有问题就来翻,有收获就收藏,节奏刚刚好。
    2026-08-11 08:02:12
  • 用户
    热心网友
    亚洲中文字幕在线观看,内容值得关注,期待后续更新。
    20260811

期待你的精彩发言。