这项由字节跳动、中国科学院软件研究所中文信息处理实验室及中国科学院大学联合开展的研究以arXiv预印本形式于2026年7月14日公开发布论文编号为arXiv:2607.13124。有兴趣深入了解技术细节的读者可通过该编号查询完整论文。一、故事从一次外科手术开始现代AI大语言模型就像一座精密运转的大型工厂拥有数十亿甚至数百亿个零部件协同工作。然而运营这座工厂的成本极其高昂——每次生成一段文字都需要消耗大量的计算资源和电力。为了降低成本工程师们会对这座工厂进行瘦身手术把一些看似不那么重要的生产车间整个拆掉让工厂用更少的零部件继续运转。这个过程在技术上叫做结构化剪枝。这种瘦身方法有个天然的好处拆掉整个车间之后工厂的结构依然是标准的、通用的不需要任何特殊设备就能继续运转这一点比其他一些只是把零件打个洞或者压缩零件体积的方法要方便得多。然而手术之后出现了一个令人头疼的问题工厂在做选择题方面表现依然不错比如判断这句话是正面的还是负面的但一旦要自己从头写一篇文章质量就急剧下滑甚至完全崩溃。这就好比一个人做了大脑手术后还能回答苹果是红色的吗这种判断题却已经没办法自己写一首诗或者讲一个故事了。研究团队拿Qwen3-4B-Instruct这个模型做了实验。这个模型原本有36个生产车间即Transformer层研究人员将其中9个最不关键的车间拆掉参数量减少了约25%。结果这个经过手术的模型在解数学题上的准确率从88%暴跌到了1%写代码的能力几乎归零在各种开放式问答任务上也全面溃败。这就是这篇论文想要解决的核心问题如何在做完缩减手术之后帮助这个受损的模型重新找回自由写作的能力二、一个关键发现能力没有消失只是被压制了在寻找解决方案之前研究团队先做了一件侦探式的工作——他们想搞清楚手术之后模型的写作能力到底是永远消失了还是只是暂时被压制住了他们的测试方法很有趣让这个受损的模型不只生成一次答案而是生成很多次比如64次然后看这64次里有没有至少一次是正确的。结果非常出人意料在解数学题方面当允许尝试64次时这个受损模型居然有91%的概率能给出正确答案甚至略高于原始未受损模型直接给出的88%这说明什么这说明正确的答案其实还藏在模型脑子里只是模型每次开口说话时不够自信总是选择了错误的方向。就像一个真正懂得某道数学题的学生因为过于紧张每次考试时都写错了——但并不是因为他真的不会而是因为某种心理障碍在作怪。这个发现给了研究人员重要的方向恢复这个模型的写作能力本质上不是重新教会它知识而是帮它找到表达知识的正确路径。三、另一个关键发现模型在写着写着就开始复读研究团队还发现了受损模型在生成文字时的另一个典型症状它特别喜欢在生成一段内容之后陷入无休止的重复循环。就像一个正在讲故事的人讲到一半突然卡壳然后开始反复说然后……然后……然后……永远跳不出这个循环。在参数减少25%这个临界点上模型生成的内容中有高达84%会在结尾部分陷入这种重复循环。更有意思的是研究团队用数据证明了这些重复的尾巴几乎不携带任何有用的学习信息——重复部分的信息量用一种叫做JSD散度的指标来衡量只有正常部分的约1/35。换句话说那些陷入循环的文字内容就像一盘磁带卡碟之后反复播放的杂音既没有新信息也没有纠错的价值。这个发现变成了后来设计解决方案时的核心出发点。四、为什么常规补课方法效果不好面对受损的模型最直觉的修复方式是给它做补课——收集大量高质量的问答数据让模型重新学习如何正确回答问题。研究团队系统地测试了几种常见的补课方法。第一种是最简单的方式直接拿人工整理好的标准答案让模型对照着重新学习类似于给学生发一本答案册让他抄。这种方法确实有一定效果模型的综合评分从5.7分满分假设为100分原始模型约75分提升到了21分左右但依然远远不够。第二种方式稍微聪明一些让原始的、未受损的老师模型先把答案写出来再让受损的学生模型去学习这些答案。这种方式效果略好综合评分提升到约28分。第三种方式更进一步不仅让学生模型学习老师写的答案还在每个词的层面上让学生参考老师的词汇偏好即老师对每个可能的下一个词赋予的概率分布。这种方式综合评分约30分。但这三种方式都有一个共同的根本缺陷它们都是让受损的模型去学习别人写的答案而不是让模型在自己真实的思考状态下得到纠正。这就好比一个学生手抖写字总是抖你给他看再多别人写的漂亮字帖都没用——你真正需要的是在他自己拿笔写字、手刚开始抖的那一刻立即告诉他这里抖了应该这样调整。五、正确的修复思路在自己的错误上实时纠正研究团队采用的核心方法叫做在线策略蒸馏On-Policy Distillation简称OPD。这个名字听起来很学术但背后的思路其实非常直观。具体操作是这样的让受损的学生模型自己生成文字同时让原始的老师模型也就是手术之前的完整版模型站在旁边实时观看。学生每写一个字老师就在心里给出一个参考答案——这个位置我会选这些词概率分别是这样的。然后通过一种数学上的拉近操作让学生模型下次在同样位置时做出更接近老师的选择。这个过程有几个重要特点。老师是完全自给自足的不需要从外部找任何人标注数据或者设计奖励机制——老师就是模型自己在手术之前的状态天然地知道正确的分布应该是什么样的。每一个生成的词都会得到老师的实时反馈而不是只在整篇文章写完之后才得到一个对或错的裁决。最关键的是学生是在自己实际生成的文字上被纠正而不是在别人写的文字上。从实验数据来看这种方法的效果远超之前所有的补课方式综合评分直接跳升到约48至50分是受损未修复状态的将近9倍也比最好的传统方法高出了将近18分。六、但这里有个棘手的问题老师在给无用内容打分然而直接套用这个在线实时纠正的方法在实际操作中会遇到一个严重的效率问题受损模型在训练初期生成的内容有高达55%至75%都是那种陷入循环重复的废话尾巴。当受损学生模型生成了一段循环废话老师模型也跟着把这段废话读了一遍。问题在于老师模型发现这段废话其实挺合理的——在循环开始之后继续循环确实是概率最高的选项所以老师给出的反馈是继续循环吧这挺对的而学生的分布也已经在循环这件事上与老师基本一致双方都觉得循环是对的从数学上看几乎没有任何可以改进的信号。结果就是在训练的最初阶段大量的时间和计算资源都被浪费在处理那些无用的重复尾巴上真正有价值的学习信号也就是那些正常生成的、信息量丰富的前半段文字却被稀释了。研究团队在实验中发现用固定长度预算训练时大约需要到第80步才能真正进入有效学习阶段前80步几乎都是在原地踏步。七、ShortOPD从短到长智能分配学习时间为了解决这个问题研究团队提出了他们的核心创新ShortOPD即从短到长的在线策略蒸馏。核心思路可以这样理解既然训练早期模型总是写着写着就开始循环废话那就不要让它写那么长。把每次生成的最大长度限制到一个较短的范围内让模型只写它目前还能写好的那部分。随着训练的进行模型的能力逐渐恢复循环废话越来越少再逐步放开长度限制允许模型挑战更长的生成任务。但具体怎么判断现在应该写多长呢研究团队设计了一套自动化的检测和控制系统完全不需要人工介入。这套系统会持续监测三个信号。第一个信号是循环重复率每批次生成的内容里有多少比例陷入了终止性的循环重复第二个信号是截断率那些没有陷入循环的生成内容里有多少在达到当前最大长度限制时还没写完第三个信号是有效长度每次生成的内容里真正有用的部分不含循环废话尾巴平均有多长控制逻辑遵循两个规则当循环率高时把最大生成长度缩短缩短到大约当前有效长度的1.15倍这个范围当循环率低、且同时有大量内容在达到长度上限时还没写完说明模型已经准备好挑战更长的内容了就把最大生成长度提高25%。为了避免每批次的随机波动导致系统反复横跳所有统计数据都经过指数移动平均来平滑处理长度变化本身也经过平滑处理避免突然剧烈变化。这套系统的妙处在于它不需要任何额外的计算——所有用于判断的数据都是在正常训练过程中已经产生的不需要额外跑一遍模型。八、实验结果数字说话实验在数学、代码和开放式问答三个完全不同的领域同时进行使用了超过45000个训练样本。受损模型在25%参数被剪掉后的综合评分约为5.7分。经过一轮ShortOPD训练后综合评分达到约48.5分恢复到了原始完整模型75.2分的64.5%。在计算效率上对比最直接的传统固定长度训练方式ShortOPD节省了约71%的词元生成量训练时间从35.9小时缩短到8.5小时却只损失了不到2分的最终效果48.5分对比50.2分或49.6分。换句话说用约四分之一的训练时间达到了接近完整训练的效果。研究团队还测试了扩展训练轮次的效果训练一轮综合评分为48.5分两轮为53.5分三轮达到55.4分已经恢复到原始模型的73.7%。这说明随着更多训练效果还能继续提升。关于稀疏奖励方法即只在整篇答案对了之后才给奖励的强化学习方式的对比也很有说服力同样只用数学题训练使用强化学习的两种变体PPO和GRPO几乎没能改善受损模型准确率分别提升0.23和1.59个百分点而ShortOPD在同样的数学题上训练后准确率提升了约37个百分点。背后的原因很直接受损模型很少能自己写出正确答案所以几乎没有正确答案可以被奖励——奖励信号太稀疏根本没有足够的信息来引导学习。九、训练数据的覆盖范围也至关重要研究团队还做了一组非常有启发性的消融实验如果训练数据只覆盖部分领域会怎样当训练数据去掉所有数学题时模型在数学上的恢复几乎为零GSM8K准确率只有8%而完整数据集训练能达到62.7%。当训练数据去掉所有代码题时代码执行成功率暴跌到接近0HumanEval只有0.61%MBPP只有2.33%。这说明模型的写作能力必须在特定类型的任务上练习才能在那类任务上得到恢复——没有数学题就不会恢复数学写作能力没有代码题代码生成能力就无从修复。这意味着训练数据的覆盖范围不是一个技术细节而是整个恢复方案中的一个核心设计决策。如果你希望恢复某个领域的能力就必须确保训练数据覆盖了那个领域的提示词。十、一个有趣的发现选择题和作文题的恢复互不相保研究团队还附带测试了恢复后的模型在多项选择题上的表现。结果揭示了一个值得深思的现象ShortOPD主要提升了生成写作能力但在多项选择题上的准确率67.6分低于那些专门针对选择题优化的传统方法SFT约74.9分KD约74.4分。这并不令人意外——选择题考查的是在给定选项中打分排序的能力而这恰好是传统方法让模型学习外部写好的固定文本序列擅长的事情。ShortOPD让模型在自己写作时更像原始模型但这不等于让模型在看别人写的文字时也更像原始模型。研究人员随后尝试了一种组合拳先用传统SFT方法做一轮基础训练再用ShortOPD做第二轮训练。结果显示这种组合方式在选择题76.8分和写作生成两个方向上都达到了接近原始完整模型的水平说明两种方法是互补而非对立的。说到底这项研究解决的是一个长期被忽视的实用问题AI模型压缩后的写作能力崩溃。过去大家只看选择题成绩觉得压缩没问题但真正部署时才发现模型已经不会好好写文章了。这项工作清晰地指出了问题所在并提供了一套实验验证有效的解决方案——在模型自己的写作过程中实时纠正并智能地管理训练初期的无效循环内容。当然研究团队也坦率地指出了工作的局限性目前的实验主要集中在一种特定的剪枝方法和一个特定的模型系列上25%的参数减少量是这个方案有效的临界点压缩超过这个比例模型会进入更混乱的胡言乱语状态这套方法是否依然有效还需要进一步验证。更大的模型、更多的剪枝方式以及到底压缩到什么程度就彻底没救了这个边界问题都留给了未来的研究。对于普通人而言这项研究意味着未来你在手机、电脑或各类AI助手上用到的大语言模型可能是经过了更充分剪枝压缩、运行更省电更快速的版本但你与它对话时感受到的写作质量并不会因此大打折扣。有兴趣深入了解技术细节的读者可通过arXiv编号2607.13124查阅完整论文。QAQ1结构化剪枝为什么会导致大语言模型写作能力崩溃A结构化剪枝是将模型中整个车间Transformer层拆掉的操作。写作需要模型在生成每一个词时做出正确的概率选择并沿着自己的选择继续生成这是一个链式过程任何一步出错都会累积放大。剪枝后模型在这种链式生成时频繁选错方向最终陷入循环重复而选择题只需在给定选项里打分受影响小得多。Q2ShortOPD训练时为什么要动态调整生成长度A因为训练初期受损模型生成的内容大部分是无意义的循环废话而处理这些废话既耗费计算资源又几乎不能提供有效的学习信号老师和学生在循环是对的这件事上高度一致没有纠正空间。动态缩短生成长度让模型只写它目前能写好的部分然后随着能力恢复再逐步放开长度能把有限的训练资源集中在真正有价值的内容上。Q3为什么强化学习方法对受损模型几乎没有效果A强化学习依赖正确答案才能给出奖励信号。但受损模型本身很少能自己写出正确答案正确答案出现的概率极低可供奖励的机会极少学习信号极度稀疏模型几乎得不到任何有意义的反馈。相比之下ShortOPD在每一个词上都给出老师的参考分布无论答案最终是否正确每个词都有学习信号。