至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1%
理解大模型,无需再训练一个替代网络
至知研究院提出大模型可解释性新路线:拆权重,数据成本不到1% 量子位
为了理解一个已经训练好的模型,研究者往往需要先训练一套新的稀疏表示。
Transcoder、稀疏特征模块等方法会学习一组新的内部单元,用它们近似原模型某一层或某个模块的计算,再通过保留、移除这些单元来寻找任务回路。
这些方法推动了机制可解释性的发展,但也带来了一笔不小的额外成本:新的表示需要数据和优化,而且一旦替代模块没有充分复现原模块,后续分析就可能同时解释模型行为和替换误差。
说白了,研究者想打开一个黑箱,却往往需要先训练另一个“小黑箱”。
问题不只是训练成本。任务回路需要找到一组可以独立干预的内部计算:只保留它们时,相关能力仍然存在;移除它们时,模型表现则明显下降。
训练型替代表示通常还需要针对不同模型、层和checkpoint分别拟合,使大规模、系统性的回路分析更加困难。
更理想的方案应当同时保持原模型行为、提供可独立干预的单元,并能以较低成本直接从已有权重中构造。
至知创新研究院(IQuest Research)与Safe AI Forum、牛津大学、斯坦福大学、清华大学的合作者提出了一条更直接的路线:
不再训练一套独立替代网络,而是从现有的预训练权重中直接“拆”出可干预单元。
这套方法名为稀疏权重分解(Sparse Weight Decomposition,SWD)。
它把一个稠密权重矩阵分解为两个稀疏矩阵,并把二者共享的中间维度变成可独立评分、选择和消融的瓶颈单元。研究者由此可以直接在权重上抽取任务回路。
在匹配替换保真度的单矩阵实验中,SWD使用的数据不到Transcoder等训练型基线的1%;
在GPT-2、Qwen2.5和Qwen3.5-27B的任务回路实验中,SWD通常以更少的瓶颈单元和活跃连接达到相同的充分性、必要性目标;
方法不仅扩展到了27B模型,还覆盖了GPT-2 Small全部48个注意力和MLP权重矩阵,并提供了完全不需要校准文本的zero-data版本。
论文地址:https://arxiv.org/abs/2608.03913
△SWD方法概览。预训练模型中的稠密权重被分解为两个稀疏因子,共享中间坐标成为可独立评分、选择和消融的瓶颈单元。
SWD的出发点很简单。对于预训练模型中的稠密权重矩阵W,寻找两个稀疏矩阵A和B,使得
A和B共享m个中间维度。第i个维度先通过A的第i列从输入中读出一个标量,再通过B的第i行写向输出。这样,一列和一行共同构成一个瓶颈单元,也就是一条固定的rank-one读写路径。
可以把它想象成在一张极其密集的交通网络中增加一组“中转站”:每个中转站只连接少量入口和出口。研究者不仅可以看到一条路径从哪里读取、向哪里写入,还可以单独关闭它,观察模型行为会发生什么变化。
真正困难的地方,是如何在大幅减少连接的同时,仍然保留原权重对模型激活的作用。SWD使用少量校准文本产生的层输入,优化分解前后的输出误差;求解过程中交替更新两个因子,通过硬阈值维持非零预算,并重新拟合保留下来的权重值。分解完成后,每个瓶颈单元都可以像稀疏特征一样参与任务归因、排序和消融,但不需要再训练一套独立的神经替代网络。
△从权重分解到回路抽取。Step 1将稠密权重分解为稀疏因子A和B;Step 2按任务归因对瓶颈单元排序,并选择top-k单元组成任务回路。
既然目标是直接分解权重,一个自然的问题是:为什么不直接使用奇异值分解(SVD)?
SVD同样可以把一个矩阵表示为rank-one成分之和,而且不需要训练数据。近期的NaNA等方法也已经证明,SVD成分可以用于任务排序和干预。
SVD成分的读方向和写方向通常都是稠密的。即使只保留少数成分,它们仍可能连接几乎所有输入和输出维度。
SWD则进一步把稀疏性施加到每个单元的读写连接上:少量单元对应的同时也是少量活跃连接。
团队还构造了两个能够精确还原GPT-2原权重的稠密对照:保留全部奇异值的full-rank SVD,以及采用随机正交基的Random-B。
两种分解都能在数值上精确复现原矩阵,但在相同的归因和消融流程下,需要更多活跃连接才能达到与SWD相同的任务表现。
这组对照表明,SWD的优势并不是“把矩阵拆开”这么简单,真正关键的是每个单元都具有稀疏的读写结构。
△精确稠密分解对照。Full-rank SVD与Random-B都能精确还原原始权重,但需要比SWD更多的活跃连接才能达到相同的充分性或必要性要求。
在进行回路分析之前,首先要回答一个更基础的问题:把原权重换成稀疏分解之后,模型还是原来的模型吗?
团队使用留出文本上的交叉熵差值(CE delta)衡量替换保真度,并使用KL散度和替换位置的激活重构误差进行补充验证。CE delta越接近0,说明替换后的模型行为越接近原模型。
在GPT-2 Small第8层mlp.c_proj的单矩阵实验中,SWD仅使用数千个校准token就进入低CE误差区间;Transcoder和VPD-Recon-CI等训练型基线则需要约10⁶量级的optimizer-replay token才能接近这一替换质量。同样的趋势随后出现在Qwen2.5-0.5B、1.5B、3B和Qwen3.5-27B上。
综合论文中的单矩阵比较,在达到匹配替换保真度时,SWD使用的数据不到训练型替代表示的1%。这意味着,大量数据和长时间替代模块训练并不是获得高保真回路单元的必要前提。直接从预训练权重出发,也可以构造足够忠实的干预表面。
△GPT-2 Small单矩阵替换的CE delta随数据量变化。SWD使用少量校准数据即可进入低误差区域。
△Qwen2.5-3B与Qwen3.5-27B的单矩阵替换结果。横轴为构造替换表示所使用的token数,纵轴为相对稠密模型的CE delta。
高保真地复现原矩阵,只能说明所有瓶颈单元合在一起能够工作。真正的回路还必须满足两个更严格的条件:只保留少量选中单元时,任务行为仍然存在;只移除这些单元时,任务表现会明显下降。前者是充分性测试,后者是必要性测试。
团队先在独立训练划分上使用一阶任务归因对候选单元排序,再构造从top-1、top-2到top-k的嵌套回路,并在留出测试集上评估。回路成本同时使用两种口径衡量:选中了多少瓶颈单元,以及这些单元实际包含多少非零读写连接。
在GPT-2 Small的GreaterThan、IOI、Docstring和Gendered Pronoun四项任务上,SWD达到相同充分性或必要性要求时,通常需要比Transcoder和VPD-Recon-CI更少的单元和活跃连接。
换句话说,SWD得到的不只是一种低误差矩阵近似,而是一组真正能够接受因果检验的任务回路单元。
△GPT-2 Small的任务回路结果。曲线越低,表示达到相同充分性或必要性要求所需的活跃连接越少。
△Qwen3.5-27B的任务回路结果。SWD在大模型上仍能以较少活跃连接达到相应的因果测试要求。
在模型规模上,团队将相同的单矩阵替换和回路抽取流程扩展到Qwen2.5-0.5B、1.5B、3B,最终进一步验证至Qwen3.5-27B。
在27B模型的第31层mlp.down_proj上,SWD依然以显著更少的数据达到低CE delta,并以更少的活跃连接达到相当的充分性和必要性目标。
在替换范围上,团队进一步把GPT-2 Small 12个Transformer block中全部48个注意力和MLP权重矩阵替换为稀疏分解,同时保留embedding、LayerNorm、非线性函数和输出头。
由于局部近似误差会跨层累积,团队将SWD作为稀疏初始化,固定所有非零位置,只微调已经保留下来的因子值。得到的SWD-FT在连接数量不变的情况下,将模型CE从3.90降至3.44,略优于相近非零参数预算下稀疏预训练基线的3.45。
更值得注意的是,SWD-FT总计使用约2,060万个token,而稀疏预训练基线达到相近CE使用了28.84亿个token,前者同样不到后者的1%。这使得从现有稠密checkpoint出发构造全模型稀疏干预表面,成为一条极具吸引力的路线。
SWD还提供了一个更彻底的zero-data版本。在GPT-2 Small单矩阵实验中,它完全不使用校准文本,直接最小化原权重与分解权重之间的Frobenius误差。
结果显示,zero-data SWD在权重空间中更接近原矩阵;使用激活校准的SWD则在高稀疏度下更能保持典型文本上的模型行为。
即使完全不使用校准激活,zero-data SWD得到的瓶颈单元仍然能够抽取出有效任务回路。这为逐checkpoint、逐训练阶段追踪大模型内部结构提供了新的可能性。
△GPT-2 Small全模型替换。固定稀疏结构并微调保留的非零值后,模型CE从3.90降至3.44,同时保持活跃连接数量不变。
△Zero-data SWD。Zero-data SWD在权重空间中更接近原矩阵;activation-calibrated SWD在高稀疏度下更能保持典型文本上的模型行为。
回路曲线证明了这些单元在因果测试中有效,但机制可解释性还关心另一个问题:这些单元能否呈现出可理解的模式?
团队在GreaterThan任务上,对GPT-2 Small全部9,208个候选mlp.c_proj瓶颈单元进行归因排序,并从第6、8、10层展示六个高排名单元。
随后,他们在独立的WikiText-2文本上收集每个单元的高激活上下文,并由GPT-5.5总结重复出现的语义模式。
六个单元中,有四个集中响应数字、年份、数量或度量信息,另外两个更多对应标点、句法和命名实体。
这些语义模式并未参与单元选择,却与GreaterThan所需的数值比较能力形成了明显呼应。
团队还进行了一个独立的定向编辑实验。他们筛选出瓶颈单元c205,并将该单元读方向诱导的rank-one更新施加到原始稠密GPT-2权重上。
在提示词The opposite of up is中,正确答案down相对干扰答案left的logit margin提高了0.216;在七条无关事实提示上,平均末token KL仅为4.02×10⁻⁵。
在相近的正向目标变化下,这个单单元方向测得的副作用低于随机单元和rank-4 LoRA对照。
一个从权重分解中得到的瓶颈方向,因此不仅可以被观察和消融,还能够成为精确操控模型行为的编辑手柄。
△GreaterThan回路的语义审计。六个高归因瓶颈单元中,四个与数字、数量或度量模式相关;语义假设来自独立文本中的高激活上下文。
△单个SWD方向的定向编辑。纵轴为目标答案相对干扰答案的logit margin变化,横轴为无关提示上的平均末token KL。
过去,机制可解释性往往需要先学习一套新的特征字典或替代模块,再对这些新单元进行归因和干预。SWD展示了另一种可能:预训练权重本身就可以被重新组织成稀疏、可寻址、可因果检验的计算路径。
从不到1%的数据成本,到更少的瓶颈单元和活跃连接;从GPT-2、Qwen2.5到Qwen3.5-27B;从单矩阵、整个Transformer主干到完全不依赖校准文本的zero-data分解,SWD正在把权重侧机制可解释性变成一条更轻量、也更容易扩展的技术路线。
更重要的是,这些稀疏路径不只存在于数值曲线中:它们能够响应具体语义模式、通过充分性和必要性测试,并被用于定向改变模型行为。
随着模型规模不断增长,直接从已有checkpoint中抽取和追踪回路,或许将成为理解大模型内部计算的一条重要路径。
论文标题:Sparse Weight Decomposition for Efficient Circuit Extraction
作者:Chuanhao Yan、Xuhan Huang、Yawen Duan、Zhenfei Yin、Hang Zhao、Bryan Dai、Jie Fu
机构:IQuest Research、Safe AI Forum、University of Oxford、Stanford University、Tsinghua University
论文:https://arxiv.org/abs/2608.03913
代码:https://github.com/Veri-Safe/SWD
模型:https://huggingface.co/veri-safe/SWD
交互式博客:https://huggingface.co/spaces/veri-safe/SWD-Blog
根治AI音乐通病!这家国产音乐模型正面挑战SUNO2026-08-15
对话郎咸朋:用机器人创业重做一次“百万智驾量产”2026-08-15
4.8亿美元砸向端侧算力!Agent芯片新贵冲出重围2026-08-13
紫东太初推出GMC核心集剪枝方法,少80%Token仍满血保真多模态能力2026-08-12
GPT-5.6和Fable联手,解决了一道悬了25年的数学难题
量子位 QbitAI 版权所有©北京极客伙伴科技有限公司 京ICP备17005886号-1