Nous Research 提出高效计算法 YaRN,可扩展大模型上下文窗口

据品玩 9 月 5 日报道,Nous Research 联手 EleutherAI 实验室以及瑞士日内瓦大学的研究者发表论文,公布了一项名为 YaRN 的方法,可扩展大模型上下文窗口。论文显示,和传统方法相比,YaRN 需要更少的标记和训练步骤。利用这种方法,LLaMA 模型可以有效地利用和外推到比其原始预训练所允许的上下文长度更长的上下文,同时超过了过去窗口扩展的最新技术水平。据 GitHub 页面显示,使用 YaRN 进行微调的 LLaMA 2 7B/13B 上下文窗口分别可达到 64k 和 128k。

本文链接:https://www.8btc.com/article/6831948
转载请注明文章出处

原创文章,作者:惊蛰财经,如若转载,请注明出处:https://www.xmlm.net/bhq/26419.html

发表评论

您的电子邮箱地址不会被公开。 必填项已用*标注