中国AI研究机构深度求索(DeepSeek)发布了一种能够大幅提升下一代人工智能学习性能的新架构。这项被命名为“mHC(流形约束超连接)”的技术,超越了大规模语言模型(LLM)和视觉识别模型中至关重要的“残差连接”方式,被认为不仅提升了学习精度,还提高了硬件效率。
mHC是对现有“超连接”技术的改进方式。超连接作为一种能更高效传递深度学习模型层间信息的结构曾备受关注,但在实际运行环境中,由于各种技术限制未能被广泛采用。深度求索通过结合“流形”概念克服了这一局限。流形是数学上具有多层结构的空间,从简单的圆形到超越三维的复杂结构,形式多样。深度求索解释称,mHC利用这种基于流形的结构,在确保模型学习过程中产生的梯度(误差反向传播信号)的稳定性和一致性方面发挥了核心作用。
为验证该架构的性能,深度求索使用mHC结构训练了分别具有30亿、90亿和270亿参数的三种LLM,并与基于超连接的相同规格模型分别进行了对比实验。公司方面声称,结果显示mHC结构的模型在总计8个基准测试中 consistently 表现出了更优异的性能。特别是在内存需求方面,能够实现比原有结构更高效的学习,且训练时产生的硬件开销据报告仅为6.27%的水平。
深度求索的研究人员强调了其技术意义:“通过更深入地理解基于流形的拓扑结构与优化算法之间的关系,mHC有望克服当前AI模型的局限,并为下一代基础设施设计开辟新道路。”
此次发布之所以受到关注,在于其正值全球范围内重新审视AI学习架构的动向之际。现有的残差连接方式自2015年深度学习研究中被引入以来,已广泛应用于LLM和图像分类模型。该结构通过让最后输出层产生的误差信号逆向传播至所有层来传递学习信息,起到了弥补此过程中出现的信息失真现象的作用。
然而,随着AI模型日益超大规模化,这种残差连接的局限逐渐显现,为此进行的各种改进尝试持续不断。深度求索的mHC正是在此背景下诞生的最新技术,有分析认为它能够直接为改善整个AI产业根基所在的模型学习效率做出贡献。


