核心内容摘要
《被竹马发现继承玩具公司后百度网盘》软件打开快,重点几乎全在内容组织上,首页不是连篇震惊标题。广告若有也相对克制,注意力还能留给内容本身。正误对照版块适合快速建立框架,也方便转发给家人。给大脑装了个简易滤网,再刷别的信息时也更清醒一点。写给后来者:别指望一夜变专家,但真的能变清醒。
浙大与字节跳动联手:当AI"老师"学会为自己的失误"亡羊补牢",大模型开放任务训练效率翻倍
这项由浙江大学与字节跳动联合开展的研究,以预印本形式发布于2026年7月,论文编号为arXiv:2607.18082,有兴趣深入了解的读者可以通过该编号查询完整论文。 当你向一位医生助手AI提问"这个孩子的症状最可能是什么病",你希望它给出的不只是一个空洞的猜测,而是一个有理有据、考虑周全、分析详尽的专业回答。然而,训练这样的AI,远比训练它做数学题难得多。数学题对不对,一眼就能看出来。但一份医学建议好不好,往往需要从多个维度来评判——它有没有识别关键症状?有没有推荐合适的检查手段?有没有提醒避免危险操作?这些维度,无法用一个简单的"对"或"错"来衡量。 正是为了解决这个难题,研究人员发展出了一种叫做"基于评分标准的强化学习"的训练方法,简单说就是:给AI制定一份详细的评分表,就像老师给学生打分时用的评分标准一样,每一项都有具体的考察点,然后根据这份评分表来训练AI。这个方向近几年颇受关注,但浙大与字节跳动的研究团队发现,现有的方法存在两个一直被忽视的根本性缺陷——而他们提出的解决方案,让模型训练效率提升了整整一倍。 要理解这项研究,先从"评分标准强化学习"说起。强化学习是一种让AI通过不断试错来进步的训练方式,就像训练一只小狗:做对了给零食,做错了不给。对于数学或编程这类有标准答案的任务,这种方法非常好用,因为答案对不对,一验证就知道。 但医疗问答、长篇写作这类开放性任务怎么办?这里没有"唯一正确答案",一个回答的质量取决于很多方面。于是研究者想到了用评分标准(英文叫Rubric)来打分:把一个好回答分解成多个具体标准,比如"是否正确识别了主要疾病"、"是否建议了影像学检查"、"是否提醒避免有创操作",每项打0分或1分,最后把所有分数汇总成一个总分,再用这个总分来训练AI。 强化学习训练时,AI每次面对一道题,会同时生成一批回答(通常是8个),然后根据这批回答之间的相对好坏来学习。问题在于:如果这批回答中,没有一个满足某条评分标准,那这条标准就完全没有产生任何学习信号,相当于这道考题根本没被做到,AI无从知晓自己在这方面有多差、应该怎么改进。 打个比方,假设老师出了一道题考察"是否能引用具体文献支撑论点",但这个班上所有同学的作文里都没有引用任何文献,老师就算想打分也没有对比基础,这条考察点形同虚设。 研究团队统计发现,在用Qwen3-4B这个模型训练医学任务时,超过83%的训练样本都存在这种"未被探索的标准",平均每个训练样本有2.5条标准从未被任何回答满足过,而且这个问题从训练开始到结束始终存在,并不会随着训练推进自动消失。 这里需要理解一下"优势"这个概念。训练时,AI不是简单地被告知哪个回答好,而是计算每个回答相对于这一批回答平均水平的偏差,偏差为正的回答会被鼓励,偏差为负的会被压制。这个偏差值就叫做"优势"。 现在问题来了:总分是把所有标准的分数加在一起算出来的。某个回答可能在某条标准上表现很好,但在其他标准上一塌糊涂,导致总分很低,总体优势为负。在这种情况下,AI产生的"满足那条好标准的行为",反而会因为整体优势是负数而被惩罚——AI在学习过程中被告知"这种写法是错的,下次别这么写",但其实那个"写法"明明是对的,只是周围环境太差拖累了它。 更具体地说,假设一批8个回答里,只有2个满足了"建议腹部X光检查"这条标准,但这2个回答在其他方面表现很差,总分低于平均,优势是负数。那么AI不但学不到"应该建议腹部X光",反而学到了"别建议腹部X光"——完全颠倒的学习信号。 统计数据相当触目惊心:超过57%的训练样本存在这种"被压制的标准",平均每个样本有1.8条标准遭受压制,而且整个训练过程中这个比例始终高居不下。 既然"未被探索的标准"是个问题,有没有人尝试解决过?有的。已有的一些方法会把评分标准作为额外提示直接写进AI生成回答时的输入里,相当于考试时把考察要点告诉学生,从而引导AI生成更能满足各条标准的回答。 这个思路能部分解决第一个问题,但它引入了一个新的麻烦:训练时AI是在"看着答题提示"生成回答的,但实际使用时用户不会也不该把这些提示告诉AI。这就造成了"训练时的环境"和"实际使用时的环境"不一致——专业术语叫"训练推理不匹配",通俗说就是"考场作弊练出来的能力,真正上考场却用不上"。 面对这两个问题,研究团队提出了一个叫做"基于标准的蒸馏策略优化"(CriPO,Criterion-Distilled Policy Optimization)的方法。它的核心哲学是:不要靠外部提示来引导AI生成更好的回答,而是让AI自己扮演自己的辅导老师,在原有回答的基础上,有针对性地给自己提供纠正信号。 CriPO的底层机制叫做"在线自我蒸馏",可以理解成这样一个过程:同一个AI模型,以两种不同的"模式"运行。一种是正常的学生模式,不知道评分标准,就像普通考试;另一种是辅导老师模式,知道哪些地方做得不够好,可以有针对性地修改。然后,学生模式的AI通过模仿辅导老师模式的AI,把额外的知识"蒸馏"进来。 关键在于:辅导老师模式虽然掌握了更多信息,但它作用的对象是学生模式已经生成的回答,而不是重新生成一个全新的回答。这样,训练时的分布和实际使用时的分布保持一致,彻底消除了"训练推理不匹配"的问题。 值得一提的是,研究团队最初尝试单独使用自我蒸馏来训练AI,但结果不好:无论用哪种变体的蒸馏方式,模型的表现都明显下降。究其原因,是蒸馏信号过于嘈杂,缺乏稳定的基础。于是他们决定保留原来的强化学习框架(GRPO)作为稳定的主干,把自我蒸馏作为一个辅助模块叠加上去,两者各司其职,互相补充。 每当发现某条评分标准在这一批回答中从未被满足,CriPO就会构建一个特殊的"标准注入辅导老师"。这个老师会拿到这批回答里表现最好的那个,然后在此基础上,专门针对那些从未被满足的标准,做最小幅度的修改——就像老师拿着一个接近满分的作文,告诉学生"你只差这一点点没提到,稍微加几句话就好了"。 为什么要选最好的那个回答?因为它已经满足了大部分标准,老师只需要做很小的修改就能覆盖剩余的标准,产生的修改建议更精准、更可靠,而不是在一个到处是错误的回答上做大规模改动,引入太多噪音。 老师修改完之后,CriPO在逐个词的层面上比较老师版本和原始版本的差异:老师在哪些词的位置改变了预测,哪些地方没动?只有那些差异显著的位置,才被认为是真正承载了"缺失标准相关信息"的关键位置,需要让学生模式的AI向老师学习。 这里有一个精妙的设计:实验发现,在一篇回答里,其实只有大约34.6%的词位置贡献了95%的差异量,其余65.4%的位置改变微乎其微,不是真正的修改,而是因为提示词变化引起的"无意义扰动"。于是CriPO只对那些差异贡献超过阈值的位置施加学习信号,过滤掉噪音,让学习更精准。 技术上,这个学习信号采用的是"正向KL散度"。简单理解,就是要求学生模式在那些关键位置,把老师更倾向的词的概率提上来,从而把"老师版本的行为"吸收进自己的生成偏好里。 当一批回答里有某几个回答总体优势为负,但其中满足了某条被压制标准,CriPO会构建另一种"反事实辅导老师"。这位老师的任务相反:专门对原始回答进行修改,把那条被满足的标准对应的内容删掉或改掉,使修改后的版本不再满足这条标准,而其余内容尽量保持不变。 把原始版本和这个"删除版本"一比较,就能找到哪些词位置是专门用于表达这条被压制标准的。具体来说,如果某个词在原始版本中出现的概率比在删除版本中高很多,并且删除版本在那个位置明显更倾向于其他词,那这个词就被认定为"承载了被压制标准的关键词"。 找到这些关键词之后,CriPO做了一个看似简单却效果显著的操作:把这些词位置上的优势值,从负数直接翻转成一个小的正数(默认设为0.1)。这样,原本整体"应该被惩罚"的回答,在这几个特定词上反而变成了"应该被鼓励",精准地保留了有用的行为,而其余有问题的部分仍然受到正常的惩罚。 整体优化目标就是两部分之和:常规强化学习损失(用翻转后的优势值计算)加上行为注入的辅助蒸馏损失,两者按照一个可调节的系数平衡,共同引导AI向更好的方向进步。 研究团队在医学问答和科学问答两个领域做了系统测试,使用Qwen3-1.7B和Qwen3-4B两个不同大小的模型,对比了标准GRPO、HeRL(一种已有的探索增强方法)、OPSD(单独使用自我蒸馏)以及CriPO的多个变体。 结果相当清晰。在Qwen3-1.7B上,标准GRPO训练完后平均分为59.2,而CriPO达到了62.4,提升了3.2分。在Qwen3-4B上,GRPO为68.2,CriPO达到69.6,提升1.4分。单独使用自我蒸馏的OPSD方法则灾难性地崩溃了,在各个数据集上的表现远低于原始模型,印证了自我蒸馏不能单独使用的判断。 CriPO的两个组件分别发挥了各自的作用。只处理未探索标准的CriPO-U版本,在降低未探索标准比例方面效果最显著;只处理被压制标准的CriPO-S版本,在减少被压制标准数量上更胜一筹。完整的CriPO综合了两者优势,在平均表现上最为稳定和出色,这说明两类失败模式是互补的,解决方案也需要互相配合。 最引人注目的是训练效率数据。研究团队仔细对比了收敛曲线,发现CriPO大约在第175步就达到了GRPO充分训练后的最高水平,而GRPO需要完整训练200步才能达到同样水平——换句话说,CriPO只用了大约一半的步骤就赶上甚至超过了标准方法的终点。从实际用机时间来看,即便算上CriPO每步额外的计算开销(毕竟要构建辅导老师、计算额外的散度),CriPO完成训练的总时间依然显著短于GRPO完成同等步数的时间。 研究团队还额外测试了CriPO是否会在医学和科学领域之外产生"副作用",用指令跟随类基准测试评估了模型的通用能力,发现CriPO训练后的模型与原始模型表现基本持平,说明这种定向纠正并没有破坏模型的其他能力。 从奖励曲线看,CriPO在整个训练过程中的奖励都高于GRPO,而且爬升更快、更稳。从熵(可以理解为模型探索多样性的指标,熵越高说明模型在尝试更多不同的回答方式)来看,CriPO训练的模型始终保持比GRPO更高的熵,尤其是带有行为注入的CriPO-U版本,熵的提升最为明显——这直接验证了行为注入确实在帮助AI探索它原本不会主动生成的内容。 从回答长度来看,带有优势翻转的CriPO-S版本训练出的模型回答明显更长,研究团队进一步分析发现,这些更长的回答并非无意义的废话填充,而是包含了更深入的推理过程和对更多评分标准的覆盖,是质量真正提升的体现。 通过具体案例可以直观感受到差别:面对一道关于早产儿血便的医学问题,GRPO训练的模型选择了"内镜检查"这个错误答案,虽然偶尔提到了腹部X光,但没有将患儿的早产史、腹胀、血便和呼吸需氧量增加联系起来,只满足了识别相关症状这一项标准。CriPO训练的模型则系统性地识别出极早产带来的坏死性小肠结肠炎风险,解释了为何腹部X光系列检查是快速、无创的首选方案,并明确说明了为何内镜不适合作为早产儿的首要检查,同时满足了五项评分标准,给出了正确答案。 对于行为注入模块,去掉"只选最高优势回答进行注入"这一设计,分数从66.4降到65.6;去掉"只对差异最大的词位置进行学习"这一设计,分数降到65.5。两者都造成了明显下降,说明这两个设计选择都是有效的,而不是可有可无的装饰。 对于优势翻转模块,最关键的验证是:如果不是精准定位到承载被压制标准的词,而是随机选取同样数量的词来翻转优势,会怎样?结果从68.9大幅下降到64.9,跌幅远大于行为注入部分的消融。这个结果有力地说明,CriPO-S的效果不是来自于"给某些词更高的优势"这件事本身,而是必须要精准地找对那些承载了有用信息的词,才能真正发挥作用。 说到底,这项研究揭示的核心洞察其实很朴素:当我们用一张评分表来训练AI时,光有评分表是不够的,我们还要想清楚那张评分表里有多少题目根本没有被做到过,以及有多少正确的部分因为整体拖累而被错误地惩罚掉了。这两个问题在训练全程普遍存在,却长期隐藏在总分这个数字背后不为人察。CriPO的贡献,在于把这两个问题明确定义出来,并用一种不引入副作用的方式系统性地加以解决。 对于普通用户而言,这项研究意味着,未来面向医疗问答、长篇写作等需要多维度质量判断的AI助手,可以在更少的训练成本下达到更高的质量,对答案的覆盖面更全、对关键细节的关注更到位。这是一个不那么显眼但扎扎实实的进步。 A:被压制的标准是指某些评分标准虽然被某个回答满足了,但由于总分低于平均水平,这个回答的整体优势是负数,导致AI反而因为满足了这条标准而受到惩罚。问题根源在于训练时把所有标准的得分加总成一个数字,好的局部行为会被整体糟糕的表现所掩盖,训练信号被扭曲了。 A:HeRL把评分标准直接写进生成回答时的提示词里,训练时AI是"看着提示"生成的,但实际使用时没有这个提示,造成训练和使用时环境不一致的问题。CriPO则是让AI先正常生成回答,再用"辅导老师模式"在已有回答上提供纠正信号,训练和使用时AI的生成环境完全相同,不存在这个不一致问题。 A:这类方法主要适合那些没有唯一标准答案、质量需要从多个维度来衡量的开放性任务,比如医学问答、科学问答、长篇写作、法律分析等。对于数学题或编程这类有确定答案的任务,直接验证答案是否正确就够了,不太需要用评分标准这种方式。
📕作者: 曹新忠撰 · 更新于 2026-08-12 04:42:17
💫妈妈和姨娘一起快乐时光的说说SpaceX火箭残骸撞上月球后,韩国探测器拍摄到撞击点图像
✔少萝裸体 网站阳春视频最终成绩方面,苏艺馨凭借着61米06的表现成功夺冠,拿下了中国田径队本届世青赛首金。美国选手马西58米41获得亚军,塞浦路斯选手哈吉科斯塔54米88获得季军,马晨一54米58遗憾无缘领奖台。【环球时报报道 记者 倪浩 尹野平】当地时间8月6日,美国总统特朗普签署行政令,依据《1962年贸易扩展法》第232条,对进口多晶硅及其衍生产品设定最低进口价格和加征额外关税,以支持美国国内多晶硅、半导体和太阳能供应链。中国驻美大使馆发言人当天在回应《环球时报》记者相关问询时表示,中方坚决反对美方泛化国家安全概念,滥用国家力量无理打压中国企业。中方将继续坚定维护中国企业的正当合法权益。
🈲被粗大的 巴捣出白浆江澄视频活力中国调研行|新能源车为什么选“它” ?不止于“减重”
❤️香蕉漫画这些规定并不一定靠强硬手段执行,而是靠坚定和信念。对穆里尼奥来说,打造团队同样至关重要。俱乐部分享的一张照片显示,全队球员和教练组在巴尔德贝巴斯一起吃饭,这在过去并不常见。穆里尼奥认为,这种日常安排非常重要,是团队建设的一部分。他在本菲卡时就这么做,如今也把这个新习惯带到了马德里。内部人士表示:“他想促进团队凝聚力和团结,这让人非常振奋。”另一位消息人士补充说:“现在的氛围非常非常好。”在上赛季末那段充满紧张的时期之后,这样的反馈在内部尤其受到重视。
👅妈妈善良的朋友抗议者 山尾希美:倘若杀伤性武器经由日本流向世界各地,那就等同于日本卷入战争,我真心不希望日本参与这类具有危害的恶劣行径。
📸 记者 雷亚玲 摄 · 更新于 2026-08-12 04:42:17