三亩地 三亩地SAN MU DI · CODE DIARY
ARTICLE DETAIL

日记详情

真实记录编程学习的某一天,欢迎挑你感兴趣的翻一翻。

微调后模型输出千篇一律怎么办?CreativeInstruct 创造力标记法与 GRPO 增益解读

微调后模型输出千篇一律怎么办?CreativeInstruct 创造力标记法与 GRPO 增益解读

【技术解读】本文深度解析北卡罗来纳大学教堂山分校(UNC Chapel Hill)提出的 CreativeInstruct(arXiv:2608.07460):它不做全局温度调节,而是把测试期的双模型 token 级路由离线「编译」进单模型权重。三步流程——① 用 BACo 的 prob+punc 变体对 Tülu V3 中筛出的 4,000 条英文写作提示逐 token 路由生成,每提示采 3 个输出共 12,000 条样本,并记录每个 token 来自基座还是对齐模型;② 把连续来自基座的 span(以及两模型概率差 ≤0.005 的无分歧片段)用 [StartCreativity] / [EndCreativity] 两个特殊标记显式包围,把「此处该发散」的路由决策写进训练序列;③ 用 LoRA(r=32、α=64、dropout 0.05,覆盖全部注意力与 MLP 投影层)微调对齐模型,使其推理时自主注入标记并切换风格,不再需要基座模型常驻陪跑。评测侧提出 LLM-GED:把故事抽象成实体/事件有向图后计算归一化图编辑距离,与人工叙事多样性排序相关系数 0.889,远高于 Distinct-n 与嵌入距离。结果:Llama-3.1 8B 的 LLM-GED 0.366→0.545、Cos-D(M) 0.309→0.458、写作质量 WQRM 5.93→6.65;跨五个模型家族平均,单模型方案比双模型 BACo 语义多样性高约 29%、结构多样性高约 28%。强化学习侧,Qwen3 8B 上同配置 GRPO 在 CreativeInstruct 检查点比在标准对齐检查点多涨 5 个点(MATH 0.409→0.459)与 4 个点(AMC 0.438→0.478)。消融显示训练数据在 12,000 条时仍未饱和,且通用指令数据(0.5451)显著优于 2,020 条叙事领域内数据(0.3341)。

后训练在换取"听话"的同时,付出了多样性代价

做过指令微调和 RLHF 的团队大多有过一个共同体验:模型变得更听话、更规范、更少胡说八道,但同时也变得越来越"没意思"。同一个提示采样十次,十次的开头几乎一模一样,人名永远是 Elara 或 Lyra,故事结构永远是三段式。这个现象在文献里被称为多样性坍缩(diversity collapse),它不只影响创意写作这类显式需要创造力的任务——对强化学习来说,它是更隐蔽也更致命的问题:GRPO、PPO 这类在策略算法要靠 rollout 之间的差异来构造优势信号,如果一组 rollout 高度雷同,梯度信号就近乎消失。

2026 年 8 月 7 日,北卡罗来纳大学教堂山分校(UNC Chapel Hill)的 Ananya Sahu、Mohit Bansal 与 Elias Stengel-Eskin 在 arXiv 提交了论文 CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity(arXiv:2608.07460)。这篇工作的立意与一般"提升创造力"的研究不同:它不试图把模型整体推向更发散,而是让同一个模型学会在什么位置该发散、什么位置该收敛,把创造性生成变成一种可局部触发的能力,而不是全局的温度调节。

核心方法:把测试期路由"编译"进模型权重

要理解 CreativeInstruct,得先理解它想替代的东西。此前提升多样性的一条有效路线是测试期双模型路由(论文中以 BACo 为代表):同时加载基座模型和对齐模型,逐 token 决定用谁的分布——标点和格式类 token 交给对齐模型保证规范,高熵位置交给基座模型引入变化。效果不错,但代价是推理时要常驻两个模型,显存和延迟都翻倍,工程上很难上线。

CreativeInstruct 的思路是把这套运行时行为离线蒸馏成单模型的一个可学习信号。具体流程分三步:

第一步,用路由生成带来源标注的数据。团队从 Tülu V3 SFT 数据集中筛出 4,000 条英文写作类提示,用 BACo 的 prob+punc 变体逐 token 路由生成,每条提示采 3 个输出,共 12,000 条训练样本。生成过程中记录每个 token 究竟来自基座还是对齐模型。

第二步,把连续的基座 token 片段包成显式标记。凡是连续来自基座模型的 span,用[StartCreativity][EndCreativity]两个特殊标记包围;此外,基座与对齐模型概率差在 0.005 以内的片段(即两者本来就无分歧的位置)也一并包上。这一步是整个方法的关键——它把"这里应该更发散"这个原本隐含在路由器里的决策,显式写进了训练序列。

第三步,用 LoRA 微调对齐模型学会自主注入标记。配置为 r=32、α=64、dropout 0.05,覆盖全部注意力与 MLP 投影层。训练完成后,模型在推理时自行决定在哪里插入标记并切换风格,不再需要基座模型在线陪跑

论文另一项方法贡献是评测指标。词汇级(Distinct-n)和语义级(嵌入余弦距离)指标都测不出叙事结构层面的雷同——换几个人名、改几个形容词就能把分数刷上去,但故事骨架依然一样。团队提出LLM-GED:让大模型把每篇故事抽象成有向事件图,节点是实体和事件(实体统一规范化为 Character1、Location1 这类抽象标识符),边是 agent、affected、causes 等语义关系与 next_event 时序关系,再计算两两之间的归一化图编辑距离 nGED = GED / max(|G_A|, |G_B|)。验证显示 LLM-GED 与人工叙事多样性排序的相关系数达0.889,显著高于所有词汇和语义指标;与确定性图构建流水线相比,均值差仅 -0.012(p=0.56),统计上等价但成本低得多。

实验数据:多样性涨了,质量没掉,RL 还额外受益

论文在 Llama-3.1 8B、Qwen2.5 7B/32B、Qwen3 8B/32B 五个模型上做了验证。以 Llama-3.1 8B 为例,结构多样性 LLM-GED 从对齐基线的 0.366 提升到0.545,语义多样性 Cos-D(M) 从 0.309 提升到0.458,均超过 BACo 双模型路由(0.374 / 0.255)和无标记的普通蒸馏 Distill(0.523 / 0.444)。跨模型家族平均下来,单模型的 CreativeInstruct 相比双模型 BACo 在语义多样性上高约 29%、结构多样性上高约 28%。

质量方面没有出现常见的此消彼长。Llama-3.1 8B 的写作质量奖励模型分 WQRM 从 5.93 升到6.65,Qwen3 8B 从 6.56 升到6.90;连贯性和流畅度的 Likert 分与对齐基线基本持平(3.55 vs 3.69、4.22 vs 4.09)。作为对照,去掉创造力标记的 Distill 在多个家族上质量明显滑落——Qwen2.5 7B 的连贯性掉到 2.98,Qwen3 8B 掉到 2.38。这说明标记不只是提多样性的开关,也起到了隔离作用:把发散行为限制在被标记的片段内,避免污染全局质量。

人工评测用 GPT-5 生成 50 个主题,3 名 NLP 背景标注者做匿名成对比较。创造力维度上 CreativeInstruct 以70.3% 对 29.7%胜出(二项检验显著,Cohen’s κ=0.720,一致性较高);多样性维度 57.4% 对 42.6%(κ=0.417,一致性中等,这一项的结论强度弱于创造力项)。

最值得关注的是强化学习那组实验。在 Qwen3 8B 上跑 GRPO,训练 1000 步、8 rollouts、上下文 2048、MATH 12k 训练集、3 个随机种子取平均:

检查点MATHAMC
Instruct 基线0.3740.432
Instruct + GRPO0.4090.438
CreativeInstruct 基线0.4240.428
CreativeInstruct + GRPO0.4590.478

同样的 GRPO 配置,在 CreativeInstruct 检查点上比在标准对齐检查点上多涨了 5 个百分点(MATH)和 4 个百分点(AMC)。有意思的是,CreativeInstruct 检查点在 RL 之前的 AMC 分数(0.428)其实还略低于对齐基线(0.432)——它的价值不在于起点更高,而在于给 RL 提供了更好的探索基底。这也从侧面印证了多样性坍缩确实在压制在策略算法的天花板。

消融部分还有两条对落地有直接参考价值的结论。一是数据量尚未饱和:训练样本从 1,000 增到 12,000,LLM-GED 从 0.3824 一路涨到 0.5451,曲线没有走平。二是通用指令数据比领域内数据更管用:用 2,020 条叙事领域内数据训练,LLM-GED 只有 0.3341,远低于用 12,000 条通用 Tülu 数据的 0.5451。实体重复率的对比也很直观——专有名词唯一率在提示组内从对齐基线的 18.1% 提升到 37.1%,全语料范围从 12.0% 提升到 24.7%。

需要说明适用边界:论文的多样性主实验集中在叙事生成任务,RL 增益只在 Qwen3 8B 的数学任务上验证过一组配置,是否能推广到代码、Agent、长程规划等场景还没有证据。另外方法依赖基座模型可获取——Qwen3 32B 因为没有公开 base,只能借 Qwen2.5 32B 生成数据做迁移,这在纯闭源基座的场景下不成立。

商业启示:多样性应当成为微调交付的一项显式指标

对思陌大模型微调的客户项目来说,这篇论文提示了一个容易被忽视的验收维度。

指令对齐环节需要引入多样性守恒目标。我们在做 SFT 与 RLHF/DPO 对齐时,验收指标通常集中在准确率、指令遵循度、拒答率上,很少有人量化"输出还剩多少变化"。但在文案生成、对话、方案撰写这类交付场景中,客户抱怨"AI 味太重"“几次生成都一个模子"往往就是多样性坍缩的直接后果。CreativeInstruct 提供的是一条低侵入路径:一个 r=32 的 LoRA、一万余条训练样本,不改推理架构、不加常驻显存,把发散能力做成可控开关。

评估优化环节需要补上结构层面的多样性度量。现有评测体系里的 Distinct-n 和嵌入距离都测不到叙事或论证骨架的雷同度,LLM-GED 这类图编辑距离指标可以纳入我们的评估工具箱,作为交付前的质量门禁之一。它对人工判断的相关性达 0.889,而且可以用大模型批量算,成本可控。

RL 微调项目应把"探索基底"当作前置工序。越来越多客户希望用 GRPO 做垂直领域的推理能力优化,实践中最常见的卡点就是训练几百步后奖励曲线走平——很大程度上是 rollout 同质化导致优势信号消失。这篇论文给出的证据是:先花一小笔成本恢复检查点的生成多样性,再启动 RL,同样的算力预算能多拿 4–5 个点。这个顺序对项目排期和成本核算有实际意义。

数据工程环节则要重新审视"领域内数据更好"的直觉。消融实验显示通用指令数据在多样性维度上明显优于领域内小数据集,这与我们做领域适配时"数据越贴近业务越好"的常规经验形成张力。合理的解读是:任务能力靠领域数据,生成风格的丰富度靠通用数据,两者在数据配比上应当分开考虑,而不是一味压缩通用语料的占比。


参考文献

  1. Sahu, A., Bansal, M., & Stengel-Eskin, E. (2026). CreativeInstruct: Scalably Teaching LLMs to Balance Quality, Creativity, and Diversity. arXiv: 2608.07460 | DOI: 10.48550/arXiv.2608.07460
  2. 论文开源代码仓库:github.com/ananya-sahu/CreativeInstruct

本文为思陌大模型微调团队对公开论文的独立解读,数据与结论均以原文为准,不代表原作者观点。

论文原文信息链接:微调后模型输出千篇一律怎么办?CreativeInstruct 创造力标记法与 GRPO 增益解读

(注:本文由 AI 辅助生成,仅对论文做独立解读,不代表原文作者观点。)

← 返回列表