摘要公开研究档案

这项 NeurIPS 2025 主会论文把 CHT 的拓扑驱动训练扩展到 Transformer 与 LLaMA 级语言模型,直接比较高稀疏度模型与 fully connected reference 的任务性能。

研究问题

研究问题

拓扑驱动的动态稀疏训练能否跨越视觉网络,稳定地进入 Transformer 翻译任务与语言模型预训练?

核心创新

核心创新

CHTss 将 Cannistraci–Hebb 机制适配到 Transformer,在 5% connections(95% sparsity)下维持可训练性,并进一步评估 LLaMA-1B 的语言建模困惑度。

关键结果

关键结果

95%稀疏度
2 / 3翻译任务超过 FC

CHTss 在 95% sparsity 下仍能进入 Transformer 翻译任务;但收益依赖任务,WMT 是没有超过 dense reference 的边界案例。

BLEU · 越高越好
稀疏 / CHT参考值
图表由后台结构化论文结果生成;每个指标使用独立坐标轴,并保留论文报告的比较方向。
PPL · 越低越好
稀疏 / CHT参考值
图表由后台结构化论文结果生成;每个指标使用独立坐标轴,并保留论文报告的比较方向。
为什么重要

为什么重要

它说明稀疏拓扑不只适用于小型视觉网络,同时保留了任务差异:稀疏方法的收益不能被概括成在所有 benchmark 上都胜过 dense。

出版信息

论文档案

发表场合
NeurIPS 2025
年份
2025
作者
Yingtao Zhang · Diego Cerretti · Jialin Zhao · Ziheng Liao · Wenjing Wu · Umberto Michieli · Carlo Vittorio Cannistraci
论文状态
Peer-reviewed conference paper · Main Conference Track
边界与来源

论文同时报告了 Transformer 翻译与语言模型结果。阅读结果时应区分 BLEU 与 PPL:前者越高越好,后者越低越好;不同稀疏比例和训练设置不能直接横向合并。