强化学习越练答案越单一?Meta新研究尝试让模型“按目标比例”保留多样性
CoinMeta
Ai 注目
Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略探索和需要满足群体分布约束的任务里,输出过度单一会丢掉可用选项。
役立つ
No.ヘルプ

Meta AI在9月24日发布论文MaD-RL,关注大模型强化学习中的一个不太显眼却很实际的问题:训练通常只奖励单次输出是否得高分,模型可能逐渐把概率集中到一种解法或一种表达上。对于数学题,收敛到高成功率答案或许有利;但在合成数据、策略探索和需要满足群体分布约束的任务里,输出过度单一会丢掉可用选项。

研究团队提出Distribution Matching框架,不只最大化平均奖励,而是让模型输出中某个潜在类别属性的分布接近预先设定的目标。所谓“目标分布”可以是不同解题策略、代码结构或其他可判定类别的比例。论文在数学推理和编程实验中展示方法效果,但这仍是研究结果,不代表所有通用模型已经自动解决模式坍缩,也不等于可以用一套比例控制所有开放式文本。

GRPO可能把概率推向单一模式,调温度并不总能解决

大模型后训练常用可验证奖励:答案正确得分,错误不得分,再用强化学习提高高分输出的概率。GRPO等方法会比较同一问题的一组候选输出,然后强化相对表现更好的样本。机制简单有效,但当多种答案同样正确时,训练可能偏爱最先占优的一种模式,逐步削弱其他可行路径。

论文把这种现象描述为输出分布的集中。提高采样温度能够增加Token层面的随机性,熵正则也能阻止概率过快变尖,却不保证模型在语义类别上达到需要的比例。文字表面变化很多,底层策略仍可能相同;反过来,强行追求均匀也未必符合业务目标。某些任务需要70%的保守策略和30%的探索策略,而不是每类都一样多。

MaD-RL把目标转成分布距离问题。研究者先定义一个能给输出分类的潜在属性,再比较模型当前分布与目标分布,利用差异构造奖励。论文讨论L2、KL和Jensen-Shannon等不同散度,每种度量对稀有类别、零概率和偏离程度的敏感性不同。方法的价值不在某个公式本身,而在于训练目标从“这一次答得好不好”扩展为“许多次回答组合起来是否符合要求”。

这也带来新的依赖:类别必须能被可靠识别。若分类器把不同策略误判为同一类,或目标属性本身带有偏见,分布匹配只会把错误规范得更稳定。数学和编程任务容易借助验证器与结构规则;开放对话、创意写作和社会属性则更难获得清晰、无争议的标签。

分布可控不等于内容公平,目标由谁设定仍是核心问题

论文提到合成数据和公平约束等应用。模型为下游训练生成数据时,如果大量样本重复同一模板,数据规模再大也难覆盖真实变化;分布匹配可以强制保留多种类型。但“多样”只是统计属性,不自动保证事实正确、代表性充分或没有有害内容。质量门槛与分布门槛必须同时存在。

在公平相关场景中,风险更高。设定不同群体的输出比例可能有助于纠正明显失衡,也可能把复杂社会问题简化成僵硬配额。目标比例应来自具体政策、数据和利益相关者讨论,而不是由训练工程师随手指定。模型还可能学会迎合分类器,在表面上满足比例、实质上继续复制偏见。

对开发者而言,MaD-RL更适合被看作一种训练工具,而非即插即用的产品功能。使用前需要明确属性、目标分布、分类准确率和失败成本;训练后还要在未见任务上验证,确认模型没有以降低正确率换取比例。论文展示的数学与编程实验提供了可行性证据,跨领域泛化仍需更多独立复现。

这项研究也提醒行业重新审视“最佳答案”的定义。许多评测只算最高分或平均正确率,无法发现模型是否只会一种套路。当AI用于方案生成、科研假设和代码候选时,用户真正需要的可能是一组彼此不同、都达到质量标准的选择。评测因此应同时记录成功率、分布覆盖、重复度与校准误差。

强化学习后训练正在从单一奖励走向多目标约束。正确、安全、成本和多样性可能互相拉扯,任何一个指标被极端优化都可能伤害其他方面。MaD-RL给出的贡献,是把语义层面的分布明确写入优化目标,并比较不同距离度量的效果。它没有消除“谁来定义理想分布”的治理问题,却让这个问题从训练后的抱怨变成训练前必须写清楚的参数。

现阶段最谨慎的判断是:Meta研究团队证明了在若干可验证任务中,强化学习可以直接匹配目标输出分布,并指出常见GRPO训练可能压缩多样性。方法是否能在更大模型、复杂开放任务和长期训练中稳定工作,还需要后续实验;但它已经为“模型不仅要答对,还要保留合理选择空间”提供了一条可测试的技术路径。

チップ
$0
いいね
0
保存
0
閲覧数 6
CoinWorldは、読者の皆様にブロックチェーンを理性的に捉え、リスク意識を高め、各種仮想トークンの発行と投機に注意を払うようお願いします。サイト内のすべてのコンテンツは市場情報または関連する見解のみであり、いかなる形式の投資アドバイスも構成しません。機密情報を含むコンテンツを発見した場合は、“報告”,をクリックしてください。すぐに対処します。
送信
コメント 0
人気
最新
まだコメントがありません。最初のコメントを投稿しましょう!
関連
Block将比特币闪电网络接入x402协议
Block加入 x402 Foundation,并将比特币闪电网络接入 x402 支付协议,瞄准 AI 代理的小额高频支付需求。
Cointelegraph
·2026-09-25 10:34:09
3
Aave提议用5000万美元级资金做机构抵押贷款:DAO还没批准,风险先走到链下
Aave Labs在9月24日向治理论坛提交Aave Institutional ARFC提案,希望为面向机构的链下超额抵押贷款建立两条资金路线:一是新增GHO facilitator,初始额度2500万GHO;二是允许用DAO资产负债表中的资产作抵押,在Aave V3借出最高2500万美元USDC或USDT。两条路线并行且额度分开,但提案目前仍处于社区讨论阶段,尚未通过Snapshot与正式AIP。
币界网
·2026-09-25 10:06:51
16
Polygon测出每秒1100万次代理支付,但这不是链上TPS突然暴涨
Polygon在9月24日公布Agent Pay Channels测试结果:由25个独立Hub组成的集群,每秒处理超过1100万次经过验证的支付更新;单个Hub在引擎直连条件下达到约53.3万至53.6万次,完整x402链路测试约4万次。这组数字瞄准AI代理的高频小额付费,但必须先说清楚,它统计的是链下支付通道更新,不是Polygon主链每秒确认1100万笔独立交易。
币界网
·2026-09-25 10:05:35
16
欧盟公路货运量2025年增1.8%:矿石最重,食品跑得最远
Eurostat在9月24日发布数据显示,2025年欧盟公路运输货物132.9亿吨,比2024年增加1.8%。这个增长幅度不算猛烈,却为观察实体经济提供了一个直接角度:卡车实际搬运了多少原料、食品和工业品,比调查中的情绪指标更接近生产与消费活动。不过,总吨数只回答“有多重”,不能说明货物运了多远,也不能直接等同于经济价值。
币百科
·2026-09-25 10:04:28
13
欧盟七成以上货物靠海运,价值占比却低一截:供应链风险不能只看金额
Eurostat在9月24日公布的2025年贸易运输数据,揭示了欧盟外贸的两种面貌。按重量计算,海运占非欧盟进口的73.3%和出口的72.6%;按金额计算,份额降至进口50.2%、出口40.4%。也就是说,港口和船舶承载了绝大多数实物,却没有承载同等比例的货值。这个差异会直接影响政策如何评估航线中断、港口拥堵和运价冲击。
币百科
·2026-09-25 10:03:27
12
もっと見る