Group-Aware Reinforcement Learning for Output Diversity in Large Language Models
📅 2026/7/27 23:35:57
👁️ 阅读次数
📝 编程学习
一、文章主要内容总结
该研究针对大型语言模型(LLMs)在生成任务中普遍存在的模式崩溃(mode collapse)问题——即即便存在多个有效答案,模型仍反复生成少量相同输出,限制了输出多样性——提出了一种强化学习方法:Group-Aware Policy Optimization(GAPO,群体感知策略优化)。
核心背景:现有模型(如ChatGPT-4o、Claude Sonnet 3.5等)在监督微调(SFT)和人类反馈强化学习(RLHF)训练后,虽提升了事实准确性和对齐性,但会倾向于高概率输出,导致多样性下降;而温度调节、top-k采样等解码策略仅能部分缓解,无法解决模型概率分布的根本问题。
方法设计:
- GAPO是对现有Group Relative Policy Optimization(GRPO)的扩展,核心改进是将奖励计算从单个样本层面升级到群体层面,使模型能学习多样性、覆盖度等群体级属性。
- 搭配频率感知奖励函数:惩罚过度重复的输出,奖励未充分生成的有效答案,鼓励模型在所有有效输出上均匀采样。
- 训练方式:基于LoRA对预训练指令模型(Qwen2.5系列)进行微调,不改变模型架构或解码策略。
实验结果:
- 列表选择任务:GAP
编程学习
技术分享
实战经验