比特派钱包官网|四行代码让大模型上下文暴增3倍,羊驼Mistral都适用 - AI新智界

作者:TPwallet 2026-07-31 浏览:935
导读: 原文来历:量子位图片来历:由无界 AI生成无需微调,只需四行代码就能让大模型窗口长度暴增,最高可添加3倍!并且是“即插即用”,理论上能够适配恣意大模型,现在已在Mistral和Llama2上试验成功。有了这项技能,大模型(LargeLM)就能摇身一变,成为LongLM。近来,来自得克萨斯农工大学等组...

原文来历:量子位

图片来历:由无界 AI生成

无需微调,只需四行代码就能让大模型窗口长度暴增,最高可添加3倍!

并且是“即插即用”,理论上能够适配恣意大模型,现在已在Mistral和Llama2上试验成功。

有了这项技能,大模型(LargeLM)就能摇身一变,成为LongLM。

近来,来自得克萨斯农工大学等组织的华人学者们发布了全新的大模型窗口扩展办法SelfExtended(简称SE)。

在Mistral上,研究者在24k长度的文本中随机刺进5位数字让模型查找,成果经SE处理后,呈现出了全绿(经过)的测验成果。

而未经处理的版别,在6k长度时就现已开端“见红”了。

GitHub Copilot主创Alex Graveley也激动地宣告,在Llama2上进行的试验相同取得了成功。

在网友的进一步问询之下,Alex解说了推文中“work”的详细意义:原先在4k长度时就会呈现的噪声,现在现已消失了。

而关于SE窗口长度的极限,一位依据论文复现SE代码的大佬表明,理论上(只需算力满足)能够到达无限长。

那么,SE详细能到达什么样的效果呢?

长文本才干明显增强

在窗口长度从4096增加到16384的过程中,Llama 2的困惑度从一开端变飙升了两个数量级。

但运用SE后,文本长度变成了本来的4倍,困惑度却只添加了0.4。

而在Mistral上,SE比Mistral自身选用的滑动窗口(SWA)机制带来了更低的困惑度。

△左下图运用对数坐标

在专为长文本模型规划的LongBench数据会集,SE处理后的模型在单/多文档问答、总结、少样本学习、代码等使命中,评分均比较起原始版别有所提高。

特别是在一个名为SOLAR的模型上,处理后的模型在16k长度下的体现比原始版别在4k长度下的体现还要优异。

SOLAR由两个羊驼掐头去尾拼接而成,这种拼接的办法,使得其注意力层结构与其他根据Transformer的模型形成了必定差异。

一起,在GSM等由考试题组成的闭域问答使命中,SE优化后的模型也都比较原始版别取得了更高的均匀成果,在Mistral上稍逊于其自身的SWA办法。

而长文本才干的增强,并没有带来模型在短文本上的才干下降。

在HuggingFace的OpenLLM基准下,SE版Llama2的测评成果比较原版均为产生明显下降。

现在,SE的开箱即用版支撑Phi、Llama和Mistral三种模型,在这三种模型上只需4行代码就能进行窗口扩增。

关于其他模型,则需求对代码进行必定修正。

那么,SE是怎么给模型添加窗口长度的呢?

两种注意力机制一起效果

研究者以为,长文本才干是大模型自身就具有的,但需求经过必定办法激起才干完成。

其间最主要的问题是,大模型在处理长文本时,会遇到相对方位编码超出练习时所见规模的状况。

针对这一状况,作者选用了FLOOR注意力机制作为处理战略。

FLOOR对输入的文本序列进行分组,然后用组数对某一token的肯定方位做取整除,就能够长距离将映射到较短的规模。

然后,对这些映射值进行注意力运算,就处理了方位编码超限的问题,完成了长文本的处理。

而在处理中短长度文本时,依然运用模型原有的注意力机制,然后保证了模型不会“捉襟见肘”,防止因长文本才干的增加导致短文本才干丢失。

比特派钱包官网|四行代码让大模型上下文暴增3倍,羊驼Mistral都适用 - AI新智界

此外,在Mistral上复现SE的作者还坦言,现在该模型并不完美,或许存在核算量暴增的问题。

一起,SE的原作者也说,现在SE办法确实还没有做过功率方面的优化,未来方案经过引进FlashAttention机制等战略来处理这一问题。

论文地址:htTPs://arxiv.org/abs/2401.01325

转载请注明出处:TPwallet,如有疑问,请联系(TPwallet)。
本文地址:http://www.syxyhn.com/share/2521.html