谷歌发布了名为"TurboQuant"的技术,旨在提升AI模型性能。TurboQuant是一种能够提高AI模型处理速度并减少内存需求的新型压缩技术,相比现有算法能以更少误差压缩数据。该技术通过减少AI模型需处理的数据量来实现优化,通过改变数据的数学特性进行高效数据压缩。
该技术使AI模型以向量形式存储数据,并利用向量的方向性优化数据。通过名为"随机预调节"的方法旋转AI模型向量使其易于压缩,再使用"量化器"算法进行压缩。旋转后的向量能避免压缩过程中可能出现的数据错误,但仍可能产生少量误差。这类误差通过名为"QJL"的算法进行修正,该算法运用"约翰逊-林登斯特劳斯变换"技术,在缩减复杂高维数据的同时保持数据点间的本质距离与关联。
谷歌通过将TurboQuant应用于多个开源大语言模型进行效率测试,结果显示这些模型仅需常规内存的六分之一即可完成评估。该技术还在长上下文任务中展现出增强性能。


